jevbooks

← 全部项目

beat-the-reviewer

Ash20pk/beat-the-reviewer · 项目主页

十个待批准的请求,由概率而非句子来裁决。

校验与安全门76%次选分类: 评测与基准

这是什么

一个游戏:你编写 pull request 正文,说服审查者批准十个高风险的生产请求。适合想要在概率门槛下练习精确、有范围论证的开发者。

它怎么用 Jev

每个关卡是一条类型化判断规则:一个确定性门控、一个问题和一个阈值。问题发送给 jev-1.13.0,返回一个概率。阈值将该数字转化为 APPROVED 或 REFUSED。裁决和数字出现在 PR 评论中。

用到的原语:score

值得抄的做法

固定模型版本并对问题做哈希,使细至 0.25 的阈值不会悄然重调。

怎么试

使用 GitHub 模板,克隆你的副本,创建名为 level-01 的分支,并打开一个 pull request,在正文中写入你的请求。

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.91
  • 有 System One 用法0.73
  • 处理了不确定性未判定0.48
  • 有实测数据未判定0.52
  • 可直接跑未判定0.53
  • 值得推荐0.39
  • 是模型的复刻0.17
  • 问题普遍性按 0–2 打分1.68
  • 与 Jev 相关0.89

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。