这是什么
ruling 将任何开放聊天模型转变为类似 TypeSafe 的 Jev 的决策引擎。您发送一个状态和类型化问题;您会得到您声明的每个选项的概率。不生成任何内容,因此无需解析,模型也无法编造您未列出的答案。
它怎么用 Jev
ruling 是一个与 System One 兼容的服务器,它从原始模型的 logits 中对类型化问题进行评分,无需训练。它原样接受官方 SDK,并重新评分了 256 个带有 Jev 自身答案的公共判断(231 对 238,无显著差异)。它提供 MLX 检查点或任何 OpenAI 兼容端点。
用到的原语:choicescorenoul
值得抄的做法
从原始模型的 logits 中对类型化问题进行评分,无需训练,然后通过您自己标记决策上的简短 LoRA 微调来校准置信度。
怎么试
uv sync && uv run ruling serve
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.70
- 有 System One 用法否0.30
- 处理了不确定性否0.05
- 有实测数据是0.93
- 可直接跑是0.94
- 值得推荐否0.31
- 是模型的复刻是0.84
- 问题普遍性按 0–2 打分1.06
- 与 Jev 相关是0.97
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月23日 读 README 写成。