这是什么
检验三个本地 Ollama 模型能否按 PoL 爱语判据评审由恨语到爱语的改写,采用全交叉判定、自偏好校正与校准。验证标签由 Claude 生成,非人工。
它怎么用 Jev
本项目不调用 Jev。它在 jev_local.py 中用 Ollama logprobs 复现 Jev 的 Choice/Score/Noul 模式:判官输出单个选项 token,从 top_logprobs 读取答案,量表正反序提问,Noul 陈述与其否定一起提问以暴露位置偏差。
用到的原语:choicescorenoul
值得抄的做法
在 logprobs 上正反序与否定重问以暴露位置偏差,并用 coverage 标记超出允许 token 的概率质量。
怎么试
python run.py validate --run flowtest --tuned --set holdout;python run.py analyze --run flowtest --tuned --quick
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角否0.11
- 有 System One 用法未判定0.41
- 处理了不确定性否0.03
- 有实测数据否0.10
- 可直接跑否0.07
- 值得推荐否0.03
- 是模型的复刻未判定0.47
- 问题普遍性按 0–2 打分0.57
- 与 Jev 相关是0.89
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月22日 读 README 写成。