jevbooks

← 全部项目

audio-jevlike

alperiox/audio-jevlike

音频原生Jev形决策模型,直接从语音,无需ASR。

分类与路由58%次选分类: 其他问卷体检

这是什么

Prosodia是一个音频原生的Jev形决策模型,以语音作为状态。它使用冻结的Whisper编码器对音频进行一次编码,并并行回答类型化问题,返回校准的概率分布,无需ASR或生成文本。

它怎么用 Jev

Jev基于共享的音频编码进行决策。类型化问题(Choice/Score/Noul)并行分支于此状态,返回关于情感、情绪和声学属性的校准分布。问题文本和选项集在请求时提供;结果在代码中作为概率使用。

用到的原语:choicescorenoul

值得抄的做法

仅预填充读出与指针机制:logits是分支向量与选项嵌入的内积,支持动态候选集。

怎么试

uv sync; uv run pytest; scripts/fetch_meld.sh; uv run python scripts/extract_features.py --encoder whisper; uv run python scripts/run_ablation.py ...

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.96
  • 有 System One 用法0.79
  • 处理了不确定性0.05
  • 有实测数据0.07
  • 可直接跑0.63
  • 值得推荐未判定0.56
  • 是模型的复刻0.93
  • 问题普遍性按 0–2 打分0.72
  • 与 Jev 相关0.97

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月23日 读 README 写成。