jevbooks

← 全部项目

ruling

bradAGI/ruling

来自本地模型的类型化、校准决策。不生成文本。

评测与基准25%次选分类: 打分与排序问卷漏斗体检

这是什么

ruling 将任何开放聊天模型转变为类似 TypeSafe 的 Jev 的决策引擎。您发送一个状态和类型化问题;您会得到您声明的每个选项的概率。不生成任何内容,因此无需解析,模型也无法编造您未列出的答案。

它怎么用 Jev

ruling 是一个与 System One 兼容的服务器,它从原始模型的 logits 中对类型化问题进行评分,无需训练。它原样接受官方 SDK,并重新评分了 256 个带有 Jev 自身答案的公共判断(231 对 238,无显著差异)。它提供 MLX 检查点或任何 OpenAI 兼容端点。

用到的原语:choicescorenoul

值得抄的做法

从原始模型的 logits 中对类型化问题进行评分,无需训练,然后通过您自己标记决策上的简短 LoRA 微调来校准置信度。

怎么试

uv sync && uv run ruling serve

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.70
  • 有 System One 用法0.30
  • 处理了不确定性0.05
  • 有实测数据0.93
  • 可直接跑0.94
  • 值得推荐0.31
  • 是模型的复刻0.84
  • 问题普遍性按 0–2 打分1.06
  • 与 Jev 相关0.97

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月23日 读 README 写成。