这是什么
一个配套的测量实验室,服务于 dspy-typesafeify 及其他在 DSPy 风格流水线中使用 TypeSafe 决策的调用方。它提供可复现的校准、置信度门控、延迟和建模成本基准测试,并支持离线回放。
它怎么用 Jev
Jev 对支持工单路由状态做出 Choice 决策,返回选定的负责人和置信度。基准测试应用置信度门控:低于阈值的决策变为 predicted: null 和 abstained: true。覆盖率、已回答准确率、选择性风险、Brier 分数和 ECE 等指标均基于这些门控后的决策计算。
用到的原语:choicenoul
值得抄的做法
置信度门控弃权,配合仅在声明门控后拟合的防泄漏 Platt 缩放校准。
怎么试
uv sync && uv run jev-dspy-benchmark --dataset fixtures/tickets.jsonl --responses fixtures/typesafe_responses.jsonl --output evidence/benchmark --field owner --threshold 0.7 --bootstrap-samples 2000 --seed 17
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.77
- 有 System One 用法是0.72
- 处理了不确定性否0.12
- 有实测数据否0.13
- 可直接跑否0.09
- 值得推荐否0.27
- 是模型的复刻否0.05
- 问题普遍性按 0–2 打分1.01
- 与 Jev 相关是0.97
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。