这是什么
一个用于 Jev(TypeSafe 的结构化决策模型)的 Python 测试工具与基准,通过 OpenRouter 的 Decisions API 调用。它运行 17 个案例、23 项检查,并在延迟、成本和准确率上对比 Jev 与通用 LLM。
它怎么用 Jev
Jev 接收一个状态(字符串、对象或数组)和类型化问题(noul、choice、score),返回校准后的概率、标签和分数。测试工具检查预期结果,分配置信度区间(act/confirm/escalate),并与 LLM 基线对比。
用到的原语:noulchoicescore
值得抄的做法
使用带有 what + examples 的结构化标准,以提高分数置信度和准确率。
怎么试
uv sync && cp .env.example .env && uv run test_jev.py
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.92
- 有 System One 用法是0.73
- 处理了不确定性否0.06
- 有实测数据否0.09
- 可直接跑否0.23
- 值得推荐否0.38
- 是模型的复刻否0.03
- 问题普遍性按 0–2 打分1.01
- 与 Jev 相关是0.99
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月22日 读 README 写成。