jevbooks

← 全部项目

jev-heart-risk-bench

rubinagentagi-tech/jev-heart-risk-bench

在5,000名CDC心脏风险调查受访者上对Jev进行基准测试。

评测与基准91%次选分类: 打分与排序题目体检

这是什么

在5,000名真实CDC BRFSS 2015受访者上,将Jev(TypeSafe System One)与逻辑回归、手写规则、聊天LLM和基准率进行对比评分。面向评估决策模型的研究者。

它怎么用 Jev

Jev读取纯英文调查答案并判断心脏病风险。它返回带有可检查原因的typed输出。结果用作排名分数,而非校准概率;截断值在代码中设置。

用到的原语:choice

值得抄的做法

将Jev用于在合理选项中进行选择,而非罕见事件的校准概率。

怎么试

打开交互式演示:https://rubinagentagi-tech.github.io/jev-heart-risk-bench/

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.83
  • 有 System One 用法0.25
  • 处理了不确定性0.05
  • 有实测数据0.26
  • 可直接跑0.11
  • 值得推荐未判定0.42
  • 是模型的复刻0.04
  • 问题普遍性按 0–2 打分0.26
  • 与 Jev 相关0.98

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。