这是什么
一个 pytest 插件,通过含义而非精确措辞来测试 LLM 应用输出。它提供 `jev` fixture 用于编写关于文本的语义断言,面向测试 LLM 应用的开发者。
它怎么用 Jev
Jev 评判关于文本的声明:`expect` 批量处理 Noul 声明,`choice` 选择选项,`score` 对有序等级评分。结果是校准概率,插件用阈值据此判定测试通过或失败。
用到的原语:choicescorenoul
值得抄的做法
将关于同一文本的所有声明批量合并为一个 Jev 请求,然后对返回的概率应用普通 Python 阈值。
怎么试
pip install pytest-jev,设置 OPENROUTER_API_KEY 或 TYPESAFE_API_KEY,使用 jev fixture 编写测试,运行 pytest。
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.94
- 有 System One 用法是0.70
- 处理了不确定性是0.91
- 有实测数据是0.78
- 可直接跑是0.97
- 值得推荐未判定0.58
- 是模型的复刻否0.03
- 问题普遍性按 0–2 打分1.07
- 与 Jev 相关是0.98
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月21日 读 README 写成。