这是什么
对TypeSafe AI的Jev进行独立的仅API校准审计。Jev是一个“System One”决策模型,它基于文本状态回答预定义问题,返回概率分布而非生成文本。面向评估Jev概率可靠性的研究人员和从业者。
它怎么用 Jev
通过公共HTTP调用,使用状态和类型化问题(Choice、Score、Noul)查询Jev,获取概率分布。审计测量校准误差、一致性、不变性、干扰、对冲和韩语表现。每次调用的结果记录在JSONL中。
用到的原语:choicescorenoul
值得抄的做法
报告ECE时对照噪声下限而非零,并在每个集合中包含状态盲基线。
怎么试
uv sync; cp .env.example .env; 填写JEV_API_KEY; uv run python -m jev_audit.preflight
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.90
- 有 System One 用法否0.22
- 处理了不确定性否0.13
- 有实测数据否0.31
- 可直接跑否0.06
- 值得推荐否0.28
- 是模型的复刻否0.02
- 问题普遍性按 0–2 打分1.14
- 与 Jev 相关是0.99
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月21日 读 README 写成。