jevbooks

← 全部项目

jev-typed-evaluation-collapse

mleyvaz/jev-typed-evaluation-collapse

关于 Jev 类型化评估坍缩的六项实验案例研究

评测与基准76%次选分类: 校准与研究

这是什么

一份田野笔记与手稿,通过 Vercel AI Gateway 运行的六项实验研究 Jev(TypeSafe AI)这一商用“System One 模型”,目标期刊为 NCML。

它怎么用 Jev

README 未说明 Jev 接收何种状态,也未说明结果如何在代码中使用。README 指出 Jev 根据声明的提问类型与 schema 产生不同的输出模式:boolean/Noul 下坍缩,Choice 下分离,并通过组合两次 boolean 调用重建 LPA2v。

用到的原语:choicescorenoul

值得抄的做法

组合两次独立的 boolean 调用(μ/λ)即可重建 LPA2v 格,而无需模型内部计算。

怎么试

cd experiment && npm install;export AI_GATEWAY_API_KEY=vck_...;node --env-file=.env.local run_experiment.mjs

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角未判定0.55
  • 有 System One 用法0.15
  • 处理了不确定性0.09
  • 有实测数据0.12
  • 可直接跑0.04
  • 值得推荐0.18
  • 是模型的复刻0.07
  • 问题普遍性按 0–2 打分0.98
  • 与 Jev 相关0.96

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。