jevbooks

← 全部项目

pytest-jev

allebee/pytest-jev · 项目主页

由 TypeSafe 的 Jev 评判的 LLM 输出语义 pytest 断言。

这是什么

一个 pytest 插件,通过含义而非精确措辞来测试 LLM 应用输出。它提供 `jev` fixture 用于编写关于文本的语义断言,面向测试 LLM 应用的开发者。

它怎么用 Jev

Jev 评判关于文本的声明:`expect` 批量处理 Noul 声明,`choice` 选择选项,`score` 对有序等级评分。结果是校准概率,插件用阈值据此判定测试通过或失败。

用到的原语:choicescorenoul

值得抄的做法

将关于同一文本的所有声明批量合并为一个 Jev 请求,然后对返回的概率应用普通 Python 阈值。

怎么试

pip install pytest-jev,设置 OPENROUTER_API_KEY 或 TYPESAFE_API_KEY,使用 jev fixture 编写测试,运行 pytest。

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.94
  • 有 System One 用法0.70
  • 处理了不确定性0.91
  • 有实测数据0.78
  • 可直接跑0.97
  • 值得推荐未判定0.58
  • 是模型的复刻0.03
  • 问题普遍性按 0–2 打分1.07
  • 与 Jev 相关0.98

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月21日 读 README 写成。