这是什么
Janus 在你自己的带标签数据或决策日志上测量:在小型模型与更大模型之间路由是否划算,以及阈值落在哪里。它不附带任何默认阈值。
它怎么用 Jev
Jev 是主(小型)模型:Janus 在你的带标签行或已记录决策上测量其置信度,针对回退模型扫描阈值,并写出报告。运行时 Router.decide 依据测得的阈值把每个输入发给 Jev 或回退模型。
用到的原语:score
值得抄的做法
在出结果前冻结协议,然后按数据集测量阈值,而不是假定阈值可迁移。
怎么试
pip install "janus-decide[typesafe,deepseek]",然后 janus measure --dataset mydata.jsonl --labels mylabels.json
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角未判定0.50
- 有 System One 用法是0.71
- 处理了不确定性是0.73
- 有实测数据否0.11
- 可直接跑是0.89
- 值得推荐未判定0.55
- 是模型的复刻否0.10
- 问题普遍性按 0–2 打分1.76
- 与 Jev 相关是0.98
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。