这是什么
一个 42 条断言的基准测试,检验引文段落是否支持原句的表述,对比 Jev 与三个前沿模型,并公开原始输出与评分结果。
它怎么用 Jev
Jev 对每条断言回答一个 Choice 问题:给定句子及其引用段落,判断 supported、unsupported 或 not_addressed。其类型化答案与概率被用作发布门禁的预过滤器,低置信度判定会被升级处理。
用到的原语:choice
值得抄的做法
将校准度与风险-覆盖率同总体准确率分开评估,因为前沿模型把所有答案都放进同一个置信度桶。
怎么试
bash bench.sh --system jev --tier A,或 python3 risk_coverage.py results/*.jsonl(无需密钥)。
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角未判定0.47
- 有 System One 用法否0.18
- 处理了不确定性否0.07
- 有实测数据否0.39
- 可直接跑否0.05
- 值得推荐否0.30
- 是模型的复刻否0.05
- 问题普遍性按 0–2 打分1.06
- 与 Jev 相关是0.98
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月21日 读 README 写成。