这是什么
JevBench 是 Benchmark Heaven 的 Jev 类决策模型基准:输入状态与受限评分标准,期望返回类型化答案,最好带概率。它为每个参赛者发布 534 条冻结决策的逐任务结果、评分代码和聚合结果。
它怎么用 Jev
README 未说明本仓库代码如何使用 Jev。它将 Jev 1.13.0 作为被测系统之一,并指出 classifier.dev 的 fast tier 就是 Jev,但没有给出集成细节。
用到的原语:choicescore
值得抄的做法
对机会校正后的 Intelligence、Calibration、Speed、Cost 做四轴等权调和平均,并对低智能和公开-密封差距设门控。
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角未判定0.55
- 有 System One 用法未判定0.50
- 处理了不确定性否0.08
- 有实测数据否0.21
- 可直接跑否0.07
- 值得推荐否0.23
- 是模型的复刻否0.07
- 问题普遍性按 0–2 打分1.15
- 与 Jev 相关是0.94
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月23日 读 README 写成。