jevbooks

← 全部项目

love-arena-v2

shentonyan/love-arena-v2

用本地 LLM 判官评审爱语改写,复现 Jev 式决策模式。

其他49%次选分类: 评测与基准验货

这是什么

检验三个本地 Ollama 模型能否按 PoL 爱语判据评审由恨语到爱语的改写,采用全交叉判定、自偏好校正与校准。验证标签由 Claude 生成,非人工。

它怎么用 Jev

本项目不调用 Jev。它在 jev_local.py 中用 Ollama logprobs 复现 Jev 的 Choice/Score/Noul 模式:判官输出单个选项 token,从 top_logprobs 读取答案,量表正反序提问,Noul 陈述与其否定一起提问以暴露位置偏差。

用到的原语:choicescorenoul

值得抄的做法

在 logprobs 上正反序与否定重问以暴露位置偏差,并用 coverage 标记超出允许 token 的概率质量。

怎么试

python run.py validate --run flowtest --tuned --set holdout;python run.py analyze --run flowtest --tuned --quick

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.11
  • 有 System One 用法未判定0.41
  • 处理了不确定性0.03
  • 有实测数据0.10
  • 可直接跑0.07
  • 值得推荐0.03
  • 是模型的复刻未判定0.47
  • 问题普遍性按 0–2 打分0.57
  • 与 Jev 相关0.89

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月22日 读 README 写成。