jevbooks

← 全部项目

jev-orderby-bench

yodablocks/jev-orderby-bench

独立测量:对 Jev 概率做 ORDER BY 是否给出可辩护的顺序。

打分与排序53%次选分类: 评测与基准

这是什么

一个基准测试工具,测量对 Jev 概率做 SQL ORDER BY 是否产生可辩护的顺序,面向在 Jev 上构建语义排序的开发者。它按预先注册的门槛报告成对反转、Score 序数性、校准、措辞不变性和排序键并列。

它怎么用 Jev

Jev 提供被排序的概率:在 360 条标注行和 Amazon ESCI 查询-商品对上调用 jev_bool、jev_choice 和 jev_score,返回的值用于测量反转、序数性、校准和并列,而不是用于做出产品决策。

用到的原语:choicescorenoul

值得抄的做法

预先注册门槛阈值,再加入改写对照,使否定结果不会被过度解读为否定特有性质。

怎么试

带密钥运行 python3 harness/run_calibration.py;--analyze-only 从缓存重算。

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.81
  • 有 System One 用法0.26
  • 处理了不确定性0.04
  • 有实测数据0.94
  • 可直接跑0.09
  • 值得推荐0.29
  • 是模型的复刻0.05
  • 问题普遍性按 0–2 打分1.09
  • 与 Jev 相关0.99

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。