jevbooks

← 全部项目

jev-eval-agent

vinilana/jev-eval-agent

在含 100 个工具的智能体中比较 LLM 工具选择与 Jev 路由。

这是什么

一个用 eve (Vercel) 构建、通过 OpenRouter 提供的个人助理智能体,包含 100 个模拟工具。它用于衡量当 LLM 自行选择工具与由 Jev 选择工具时,智能体完成任务所需的步骤数差异。

它怎么用 Jev

在 jev-classifier 模式下,Jev 在每个模型步骤前被调用,状态为 { user_request, actions_taken[], assistant_said[] }。它回答 next_tool(在 100 个工具 + respond_to_user 上的 choice)和 done(noul)。若选择了 respond_to_user 但 done 低于 JEV_DONE_THRESHOLD,路由器会阻止回复并暴露次优工具。

用到的原语:choicenoul

值得抄的做法

置信度门控路由:用 noul 的 'done' 检查门控 choice 的 respond_to_user,回退到次优工具。

怎么试

cp .env.example .env.local,填入密钥,npm install,然后 npm run eval 或 AGENT_MODE=jev-classifier npm run eval。

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角未判定0.55
  • 有 System One 用法未判定0.60
  • 处理了不确定性0.05
  • 有实测数据0.06
  • 可直接跑0.20
  • 值得推荐未判定0.42
  • 是模型的复刻0.04
  • 问题普遍性按 0–2 打分1.17
  • 与 Jev 相关0.98

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。