jevbooks

← 全部项目

jev-eval

Shogo-nfrealmusic/jev-eval

第三方检验:Jev 与 GPT-4o-mini、Claude Sonnet 4.5 在预订咨询路由上的对比。

评测与基准53%次选分类: 分类与路由题目体检

这是什么

在相同条件下,将 TypeSafe AI 的纯判断模型 Jev 与 GPT-4o-mini 和 Claude Sonnet 4.5 进行对比,任务是对日本摄影服务的 60 条合成预订咨询进行路由。

它怎么用 Jev

Jev 通过 Vercel AI Gateway 使用 experimental_evaluate 调用。README 未说明 Jev 做出哪些决策、接收什么状态,或输出在代码中如何使用。

值得抄的做法

在相同条件下测量 Jev 和 LLM,使用串行调用、预热和原始响应日志。

怎么试

npm install; npx tsx src/smoke.ts; npm run measure; npm run score

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.38
  • 有 System One 用法0.09
  • 处理了不确定性0.04
  • 有实测数据0.23
  • 可直接跑0.14
  • 值得推荐0.26
  • 是模型的复刻0.04
  • 问题普遍性按 0–2 打分1.22
  • 与 Jev 相关0.98

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。