jevbooks

← 全部项目

S1Rank

zaesho/S1Rank

评估 System-One 决策模型 Jev 作为重排序器的基准。

打分与排序100%次选分类: 分类与路由问卷

这是什么

S1Rank 评估 Jev(一个非生成式模型,通过概率回答类型化问题)能否对 BM25 前 100 个候选进行重排序。它为研究人员提供基准、原始响应和论文。

它怎么用 Jev

Jev 在一个包含所有 100 个候选的请求中,对每个文档回答 Noul 是/否问题(联合逐点),产生每个文档的概率用于排序。还测试了:孤立逐点、分级 Score、Choice-best、Peel、Tournament 和 S1Adaptive 路由。

用到的原语:noulchoicescore

值得抄的做法

联合逐点:一个请求包含所有候选,每个文档一个 Noul 问题。

怎么试

python scripts/fetch_data.py && python scripts/analyze.py

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.94
  • 有 System One 用法0.62
  • 处理了不确定性0.11
  • 有实测数据0.16
  • 可直接跑0.06
  • 值得推荐0.33
  • 是模型的复刻0.04
  • 问题普遍性按 0–2 打分1.09
  • 与 Jev 相关0.98

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月23日 读 README 写成。