这是什么
一个面向 Jev/System One 等类型化决策模型的基准与 Gymnasium 风格单步 bandit。它评估将非结构化状态与封闭问题映射为已声明候选上的概率分布的模型,不涉及自由文本生成。
它怎么用 Jev
Jev 类模型接收状态与封闭问题 Q=(tau, iota, C),必须返回候选上的分布 p。环境暴露观测 {state, instructions, type, candidate_ids, K},并通过 log、brier 或 zero_one 评分对动作 p 或离散索引给予奖励。
用到的原语:choicescorenoul
值得抄的做法
单步上下文 bandit,使用严格适当评分规则作为奖励,针对冻结标签训练决策头。
怎么试
uv sync; uv run jev-eval list; uv run jev-eval export --suite all --out /tmp/jev-eval.json
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.87
- 有 System One 用法否0.19
- 处理了不确定性否0.04
- 有实测数据否0.06
- 可直接跑否0.10
- 值得推荐否0.27
- 是模型的复刻否0.39
- 问题普遍性按 0–2 打分0.99
- 与 Jev 相关是0.97
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。