这是什么
在相同条件下,将 TypeSafe AI 的纯判断模型 Jev 与 GPT-4o-mini 和 Claude Sonnet 4.5 进行对比,任务是对日本摄影服务的 60 条合成预订咨询进行路由。
它怎么用 Jev
Jev 通过 Vercel AI Gateway 使用 experimental_evaluate 调用。README 未说明 Jev 做出哪些决策、接收什么状态,或输出在代码中如何使用。
值得抄的做法
在相同条件下测量 Jev 和 LLM,使用串行调用、预热和原始响应日志。
怎么试
npm install; npx tsx src/smoke.ts; npm run measure; npm run score
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角否0.38
- 有 System One 用法否0.09
- 处理了不确定性否0.04
- 有实测数据否0.23
- 可直接跑否0.14
- 值得推荐否0.26
- 是模型的复刻否0.04
- 问题普遍性按 0–2 打分1.22
- 与 Jev 相关是0.98
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。