这是什么
JEV在三个智能体决策基准上的评测报告,与Claude、Qwen、GPT等模型对比。面向评估JEV工具选择与弃权行为的读者。
它怎么用 Jev
JEV在MetaTool中选择正确工具或工具组合,在When2Call中选择下一步动作,在BFCL V4中决定工具调用还是弃权。MetaTool和When2Call使用Choice适配器,BFCL使用二分类适配器,结果与已发布基线对比。
用到的原语:choice
值得抄的做法
可复现的双语基准表格,带哈希校验的源数据和离线重建脚本。
怎么试
python3 scripts/build_tables.py --check; python3 scripts/build_tables.py
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.86
- 有 System One 用法否0.12
- 处理了不确定性否0.08
- 有实测数据是0.96
- 可直接跑否0.04
- 值得推荐否0.21
- 是模型的复刻否0.07
- 问题普遍性按 0–2 打分1.31
- 与 Jev 相关是0.97
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。