这是什么
一份关于 Jev 1.13.0 框架敏感性与失败的公开实地指南,基于合成任务中的 11,621 次文本研究请求。面向选择如何使用 Jev 的 AI 研究者和实践者。
它怎么用 Jev
Jev 通过回答每个任务中的明确类型化问题来做决策,例如选择 Snake 移动、驾驶动作或数值答案。研究记录每个响应及其 token 用量,然后离线对照已知正确答案评估准确率。
用到的原语:choicescore
值得抄的做法
用平实语言描述任务并给出明确优先级,比原始棋盘历史更能提升 Snake 表现。
怎么试
在线探索 City lab 和 Snake lab 演示,或阅读仓库中的报告与原始 CSV 文件。
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角未判定0.43
- 有 System One 用法否0.18
- 处理了不确定性否0.05
- 有实测数据是0.66
- 可直接跑否0.04
- 值得推荐未判定0.50
- 是模型的复刻否0.03
- 问题普遍性按 0–2 打分1.02
- 与 Jev 相关是0.99
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。