jevbooks

← 全部项目

jev-calibration-audit

jujumilk3/jev-calibration-audit

对TypeSafe AI的Jev决策模型进行独立的仅API校准审计。

校准与研究99%次选分类: 评测与基准问卷

这是什么

对TypeSafe AI的Jev进行独立的仅API校准审计。Jev是一个“System One”决策模型,它基于文本状态回答预定义问题,返回概率分布而非生成文本。面向评估Jev概率可靠性的研究人员和从业者。

它怎么用 Jev

通过公共HTTP调用,使用状态和类型化问题(Choice、Score、Noul)查询Jev,获取概率分布。审计测量校准误差、一致性、不变性、干扰、对冲和韩语表现。每次调用的结果记录在JSONL中。

用到的原语:choicescorenoul

值得抄的做法

报告ECE时对照噪声下限而非零,并在每个集合中包含状态盲基线。

怎么试

uv sync; cp .env.example .env; 填写JEV_API_KEY; uv run python -m jev_audit.preflight

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.90
  • 有 System One 用法0.22
  • 处理了不确定性0.13
  • 有实测数据0.31
  • 可直接跑0.06
  • 值得推荐0.28
  • 是模型的复刻0.02
  • 问题普遍性按 0–2 打分1.14
  • 与 Jev 相关0.99

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月21日 读 README 写成。