jevbooks

← 全部项目

jev-eval

SivletLabs/jev-eval

面向类型化决策模型的基准与单步强化学习环境。

评测与基准100%次选分类: 分类与路由

这是什么

一个面向 Jev/System One 等类型化决策模型的基准与 Gymnasium 风格单步 bandit。它评估将非结构化状态与封闭问题映射为已声明候选上的概率分布的模型,不涉及自由文本生成。

它怎么用 Jev

Jev 类模型接收状态与封闭问题 Q=(tau, iota, C),必须返回候选上的分布 p。环境暴露观测 {state, instructions, type, candidate_ids, K},并通过 log、brier 或 zero_one 评分对动作 p 或离散索引给予奖励。

用到的原语:choicescorenoul

值得抄的做法

单步上下文 bandit,使用严格适当评分规则作为奖励,针对冻结标签训练决策头。

怎么试

uv sync; uv run jev-eval list; uv run jev-eval export --suite all --out /tmp/jev-eval.json

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.87
  • 有 System One 用法0.19
  • 处理了不确定性0.04
  • 有实测数据0.06
  • 可直接跑0.10
  • 值得推荐0.27
  • 是模型的复刻0.39
  • 问题普遍性按 0–2 打分0.99
  • 与 Jev 相关0.97

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。