jevbooks

← 全部项目

jev-test

souvikr/jev-test

TypeSafe Jev 决策模型的测试工具与基准。

这是什么

一个用于 Jev(TypeSafe 的结构化决策模型)的 Python 测试工具与基准,通过 OpenRouter 的 Decisions API 调用。它运行 17 个案例、23 项检查,并在延迟、成本和准确率上对比 Jev 与通用 LLM。

它怎么用 Jev

Jev 接收一个状态(字符串、对象或数组)和类型化问题(noul、choice、score),返回校准后的概率、标签和分数。测试工具检查预期结果,分配置信度区间(act/confirm/escalate),并与 LLM 基线对比。

用到的原语:noulchoicescore

值得抄的做法

使用带有 what + examples 的结构化标准,以提高分数置信度和准确率。

怎么试

uv sync && cp .env.example .env && uv run test_jev.py

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.92
  • 有 System One 用法0.73
  • 处理了不确定性0.06
  • 有实测数据0.09
  • 可直接跑0.23
  • 值得推荐0.38
  • 是模型的复刻0.03
  • 问题普遍性按 0–2 打分1.01
  • 与 Jev 相关0.99

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月22日 读 README 写成。