这是什么
jev-benchmarks 是一个可复现的类型化决策模型评估工具。它衡量校准、固定错误预算下的选择性自动化、延迟与完整性,并附带一个在零样本单标签文本分类上比较 TypeSafe Jev 与 GLiNER2.5 的试点。
它怎么用 Jev
Jev 通过 Choice 适配器作为托管后端运行,为每个样本返回逐标签概率。流水线验证概率向量、记录解析出的模型身份,并将预测送入判别、校准与风险/延迟报告。README 未描述适配器内部的提示词或状态构造。
用到的原语:choice
值得抄的做法
在固定修订版本上使用配对的目标分层 bootstrap 区间,配合均匀负对照与仅追加的预测日志。
怎么试
uv sync --extra benchmark --dev;uv run jev-bench prepare --config configs/pilot-v1.yaml;然后分别运行各后端并生成报告。
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角否0.25
- 有 System One 用法否0.28
- 处理了不确定性否0.09
- 有实测数据否0.10
- 可直接跑否0.13
- 值得推荐否0.26
- 是模型的复刻否0.08
- 问题普遍性按 0–2 打分1.50
- 与 Jev 相关是0.97
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。