jevbooks

← 全部项目

jev-bench

TheWayWithin/jev-bench

引用的来源真的这么说吗?一个 42 条断言的基准测试。

评测与基准99%次选分类: 校验与安全门概率分档

这是什么

一个 42 条断言的基准测试,检验引文段落是否支持原句的表述,对比 Jev 与三个前沿模型,并公开原始输出与评分结果。

它怎么用 Jev

Jev 对每条断言回答一个 Choice 问题:给定句子及其引用段落,判断 supported、unsupported 或 not_addressed。其类型化答案与概率被用作发布门禁的预过滤器,低置信度判定会被升级处理。

用到的原语:choice

值得抄的做法

将校准度与风险-覆盖率同总体准确率分开评估,因为前沿模型把所有答案都放进同一个置信度桶。

怎么试

bash bench.sh --system jev --tier A,或 python3 risk_coverage.py results/*.jsonl(无需密钥)。

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角未判定0.47
  • 有 System One 用法0.18
  • 处理了不确定性0.07
  • 有实测数据0.39
  • 可直接跑0.05
  • 值得推荐0.30
  • 是模型的复刻0.05
  • 问题普遍性按 0–2 打分1.06
  • 与 Jev 相关0.98

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月21日 读 README 写成。