jevbooks

← 全部项目

jevbench

fstandhartinger/jevbench

面向 Jev 类类型化决策模型的独立跨模型基准。

评测与基准97%次选分类: 分类与路由漏斗

这是什么

JevBench 是 Benchmark Heaven 的 Jev 类决策模型基准:输入状态与受限评分标准,期望返回类型化答案,最好带概率。它为每个参赛者发布 534 条冻结决策的逐任务结果、评分代码和聚合结果。

它怎么用 Jev

README 未说明本仓库代码如何使用 Jev。它将 Jev 1.13.0 作为被测系统之一,并指出 classifier.dev 的 fast tier 就是 Jev,但没有给出集成细节。

用到的原语:choicescore

值得抄的做法

对机会校正后的 Intelligence、Calibration、Speed、Cost 做四轴等权调和平均,并对低智能和公开-密封差距设门控。

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角未判定0.55
  • 有 System One 用法未判定0.50
  • 处理了不确定性0.08
  • 有实测数据0.21
  • 可直接跑0.07
  • 值得推荐0.23
  • 是模型的复刻0.07
  • 问题普遍性按 0–2 打分1.15
  • 与 Jev 相关0.94

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月23日 读 README 写成。