jevbooks

← 全部项目

jev-benchmarks

AbdelStark/jev-benchmarks · 项目主页

面向类型化决策模型的概率感知评估:校准、选择性风险、延迟。

评测与基准89%次选分类: 分类与路由题目体检

这是什么

jev-benchmarks 是一个可复现的类型化决策模型评估工具。它衡量校准、固定错误预算下的选择性自动化、延迟与完整性,并附带一个在零样本单标签文本分类上比较 TypeSafe Jev 与 GLiNER2.5 的试点。

它怎么用 Jev

Jev 通过 Choice 适配器作为托管后端运行,为每个样本返回逐标签概率。流水线验证概率向量、记录解析出的模型身份,并将预测送入判别、校准与风险/延迟报告。README 未描述适配器内部的提示词或状态构造。

用到的原语:choice

值得抄的做法

在固定修订版本上使用配对的目标分层 bootstrap 区间,配合均匀负对照与仅追加的预测日志。

怎么试

uv sync --extra benchmark --dev;uv run jev-bench prepare --config configs/pilot-v1.yaml;然后分别运行各后端并生成报告。

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.25
  • 有 System One 用法0.28
  • 处理了不确定性0.09
  • 有实测数据0.10
  • 可直接跑0.13
  • 值得推荐0.26
  • 是模型的复刻0.08
  • 问题普遍性按 0–2 打分1.50
  • 与 Jev 相关0.97

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。