jevbooks

Jev 与大模型评委

「大模型当评委」(LLM-as-judge)指的是:调一个通用大模型去打分、排序或者放行,再从它写出来的文字里解析出结论。Jev 替掉的是这件事窄的那一头——一道字面问题,一个校准过的概率,约 300 毫秒,然后由你的代码决定这个概率意味着什么。

埋在纸堆里的大模型评委,旁边是举着一个数的 Jev

它替不掉宽的那一头:凡是需要 state 里没有的背景知识、要在不可比的东西之间权衡、或者必须给出一句解释的判断,都不行。这条线到底在哪儿,我们用自己的数据量了一遍,结论如下。

第一次听说 Jev?先看「Jev 是什么?」→

逐项对比

Jev 这一列是实测值;「大模型评委」一列描述的是这类做法的形态,不针对某一个具体模型。

Jev大模型评委
输出带类型的答案,外加每个选项的概率(noul / choice / score一段文字,或者它写出来、由你解析的 JSON
时延约 300 毫秒;多问的题搭同一次前向几秒到几分钟,随提示词和回复一起涨
成本输入每百万 token $0.042,输出免费前沿模型的价钱,而且它写的每个 token 你也要付
校准专门为校准训练出来的概率;0.5 是「分不清」,不是「中等」它自己写下来的「置信度」——关于数字的文字,不是量出来的数
稳定性同样的 state 和措辞,分布只在小范围内漂(实测 confidence 运行间漂 ±0.02–0.09)改措辞、换选项顺序、调 temperature 都会改结论;输出还得解析和兜底
擅长窄的字面判断:意图路由、安全门、重排序、规则检查、「这段里有没有 X」综合权衡、背景知识、把理由写出来、给出修法
不擅长数数、算术、日期、多跳推理、「这些里哪个整体最好」一旦按条调用,成本和时延就撑不住;也给不出能直接卡阈值的数
会生成吗永远不会它存在的意义就是生成

我们实测了什么

我们把 150 个 Jev 项目交给几位评委,各自选出最好的十个——这恰恰是 Jev 理论上不擅长的「综合选最好」。Jev 这一侧是按正确姿势搭的:每个项目单独一次请求,state 里只有文本;八道窄的存在性问题,criteria 对称并带 not_for;0.4–0.6 一律算无判定;再加一道互相看不见的交叉校验题;然后对前 20 名两两对决,正反两序各问一次。加权和排名全部在代码里完成。

位置偏差是真实存在的,要提前留预算:对决阶段 Jev 平均偏向第二张卡 −0.14,所以每一对都问了两遍。

与 Fable 前十的重合
Jev5 / 10Claude Fable6–7 / 10
成本
Jev$0.027Claude Fable≈ $0.95
耗时
Jev30 秒Claude Fable105 秒

Jev 的 5/10 是与 Fable 前十的重合;6–7/10 是其他 Claude 模型与同一份榜单的重合。成本和耗时都是跑完 150 个项目一整轮的数。

Claude 家族彼此的重合是 6–7/10,Jev 停在 5,而且我们把技巧用足之后它也没再涨。分歧不在措辞,在知识:Jev 奖励那些在 README 里把实测数字和阈值写清楚的项目,Fable 奖励那些对生态有范式意义的项目——而后者文本里根本没写。所以:窄的、可字面化的选择归 Jev,它在那儿快 3–10 倍、便宜两个数量级;需要背景知识和综合权衡的选择不归它,再怎么改提示词也补不上。

实验 · 150 个项目 · 五位评委
JevClaude Fable
与 Fable 前十的重合5 / 10—(对 Opus 7/10、Sonnet 6/10、Haiku 6/10)
成本530 次调用 $0.027≈ $0.95
耗时30 秒,8 路并发105 秒
只做初筛150 个项目 $0.01、9 秒

这两半结论,各自都是一个可以单独读的模式: 便宜宽筛再窄查 · 规则即问题

什么时候用哪个

五个问题,按通常该关心的顺序排;答完就有结论。

  1. 这道题能不能照字面、只看眼前这段文本就答出来?

    能就交给 Jev。「这条消息是不是在要求转账」是 Jev 的题,「这个设计好不好」不是。

  2. 你会不会问上几千几万次——每条数据、每次编辑、每个 agent 步骤都问一遍?

    会就交给 Jev。单次决策的成本和时延就是全部理由,而且多挂一道暂时用不上的题几乎不花钱。

  3. 你要的是一个能卡阈值的数、一条可以弃权的无判定带、一道能调的门吗?

    是就交给 Jev。大模型的「置信度」是文字,校准过的概率才是旋钮。

  4. 这道题需不需要 state 里没有的背景知识,或者要在不可比的东西之间做取舍?

    需要就交给大模型评委。我们那个 5/10 就是从这儿来的。

  5. 有没有人要读那句「为什么」——评审意见、摘要、一份修改建议?

    有就必须是大模型。Jev 给不出一句话,只给一个数。

两个一起用

便宜宽筛,贵的窄查。我们自己的数据支持这条路:只做初筛的那一遍,150 个项目 $0.01、9 秒;那就让 Jev 先砍掉八成,把前沿模型的钱花在活下来的那部分上。

让 Jev 去检查大模型写的题。jevbooks 每一次请求都在这么做:大模型先给你的问题起草题目,Jev 再把这些题目挨个打分——这道是不是一次问了两件事、是不是在问整体印象而不是事实、not_for 是不是漏了、有没有两道题彼此重叠——警告在你把它们复制走之前就出现。

规则编译一次,往后只执行。让贵模型离线把你写的规则编译成带类型的题目,之后每次检查只付 Jev 的钱:一次性的活按前沿价付,每次调用的活按每百万 token $0.042 付。

接下来

拿你自己的问题去问 Jev逛图鉴官方文档去拿 API key