jevbooks

← 全部项目

jev-behavior-study

RINNECODER/jev-behavior-study

Jev 1.13.0 行为独立研究:发现与失败。

校准与研究94%次选分类: 评测与基准

这是什么

一份关于 Jev 1.13.0 框架敏感性与失败的公开实地指南,基于合成任务中的 11,621 次文本研究请求。面向选择如何使用 Jev 的 AI 研究者和实践者。

它怎么用 Jev

Jev 通过回答每个任务中的明确类型化问题来做决策,例如选择 Snake 移动、驾驶动作或数值答案。研究记录每个响应及其 token 用量,然后离线对照已知正确答案评估准确率。

用到的原语:choicescore

值得抄的做法

用平实语言描述任务并给出明确优先级,比原始棋盘历史更能提升 Snake 表现。

怎么试

在线探索 City lab 和 Snake lab 演示,或阅读仓库中的报告与原始 CSV 文件。

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角未判定0.43
  • 有 System One 用法0.18
  • 处理了不确定性0.05
  • 有实测数据0.66
  • 可直接跑0.04
  • 值得推荐未判定0.50
  • 是模型的复刻0.03
  • 问题普遍性按 0–2 打分1.02
  • 与 Jev 相关0.99

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。