这是什么
一个基准测试工具,测量对 Jev 概率做 SQL ORDER BY 是否产生可辩护的顺序,面向在 Jev 上构建语义排序的开发者。它按预先注册的门槛报告成对反转、Score 序数性、校准、措辞不变性和排序键并列。
它怎么用 Jev
Jev 提供被排序的概率:在 360 条标注行和 Amazon ESCI 查询-商品对上调用 jev_bool、jev_choice 和 jev_score,返回的值用于测量反转、序数性、校准和并列,而不是用于做出产品决策。
用到的原语:choicescorenoul
值得抄的做法
预先注册门槛阈值,再加入改写对照,使否定结果不会被过度解读为否定特有性质。
怎么试
带密钥运行 python3 harness/run_calibration.py;--analyze-only 从缓存重算。
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.81
- 有 System One 用法否0.26
- 处理了不确定性否0.04
- 有实测数据是0.94
- 可直接跑否0.09
- 值得推荐否0.29
- 是模型的复刻否0.05
- 问题普遍性按 0–2 打分1.09
- 与 Jev 相关是0.99
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。