jevbooks

← 全部项目

jev-decision-benchmarks

baibizhe/jev-decision-benchmarks

JEV在MetaTool、When2Call和BFCL V4上的独立基准评测。

评测与基准84%次选分类: Agent 决策

这是什么

JEV在三个智能体决策基准上的评测报告,与Claude、Qwen、GPT等模型对比。面向评估JEV工具选择与弃权行为的读者。

它怎么用 Jev

JEV在MetaTool中选择正确工具或工具组合,在When2Call中选择下一步动作,在BFCL V4中决定工具调用还是弃权。MetaTool和When2Call使用Choice适配器,BFCL使用二分类适配器,结果与已发布基线对比。

用到的原语:choice

值得抄的做法

可复现的双语基准表格,带哈希校验的源数据和离线重建脚本。

怎么试

python3 scripts/build_tables.py --check; python3 scripts/build_tables.py

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.86
  • 有 System One 用法0.12
  • 处理了不确定性0.08
  • 有实测数据0.96
  • 可直接跑0.04
  • 值得推荐0.21
  • 是模型的复刻0.07
  • 问题普遍性按 0–2 打分1.31
  • 与 Jev 相关0.97

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。