这是什么
在5,000名真实CDC BRFSS 2015受访者上,将Jev(TypeSafe System One)与逻辑回归、手写规则、聊天LLM和基准率进行对比评分。面向评估决策模型的研究者。
它怎么用 Jev
Jev读取纯英文调查答案并判断心脏病风险。它返回带有可检查原因的typed输出。结果用作排名分数,而非校准概率;截断值在代码中设置。
用到的原语:choice
值得抄的做法
将Jev用于在合理选项中进行选择,而非罕见事件的校准概率。
怎么试
打开交互式演示:https://rubinagentagi-tech.github.io/jev-heart-risk-bench/
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.83
- 有 System One 用法否0.25
- 处理了不确定性否0.05
- 有实测数据否0.26
- 可直接跑否0.11
- 值得推荐未判定0.42
- 是模型的复刻否0.04
- 问题普遍性按 0–2 打分0.26
- 与 Jev 相关是0.98
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。