这是什么
Prosodia是一个音频原生的Jev形决策模型,以语音作为状态。它使用冻结的Whisper编码器对音频进行一次编码,并并行回答类型化问题,返回校准的概率分布,无需ASR或生成文本。
它怎么用 Jev
Jev基于共享的音频编码进行决策。类型化问题(Choice/Score/Noul)并行分支于此状态,返回关于情感、情绪和声学属性的校准分布。问题文本和选项集在请求时提供;结果在代码中作为概率使用。
用到的原语:choicescorenoul
值得抄的做法
仅预填充读出与指针机制:logits是分支向量与选项嵌入的内积,支持动态候选集。
怎么试
uv sync; uv run pytest; scripts/fetch_meld.sh; uv run python scripts/extract_features.py --encoder whisper; uv run python scripts/run_ablation.py ...
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.96
- 有 System One 用法是0.79
- 处理了不确定性否0.05
- 有实测数据否0.07
- 可直接跑是0.63
- 值得推荐未判定0.56
- 是模型的复刻是0.93
- 问题普遍性按 0–2 打分0.72
- 与 Jev 相关是0.97
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月23日 读 README 写成。