jevbooks

← 全部项目

PlayJev

OmniJev/PlayJev · 项目主页

0.8B 视觉语言模型,直接从原始像素玩十款浏览器游戏

游戏与模拟60%次选分类: Agent 决策

这是什么

PlayJev 是在 Qwen3.5-0.8B-Base 上微调的模型,直接从原始像素玩十款经典浏览器游戏,面向实时 GUI 游戏智能体与 Jev 式决策模型。

它怎么用 Jev

每一步,模型接收当前帧(当速度重要时还包括上一帧)以及游戏给出的动作列表。单次前向传播返回这些动作上的概率;游戏循环取 argmax,低置信度的步骤可交给每款游戏的 teacher。

用到的原语:choice

值得抄的做法

在每个训练样本中打乱动作列表,使位置不携带信息。

怎么试

python -m playjev.play snake --policy local --ckpt OmniJev/PlayJev-0.8B --episodes 1

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.84
  • 有 System One 用法0.85
  • 处理了不确定性0.65
  • 有实测数据0.93
  • 可直接跑未判定0.53
  • 值得推荐未判定0.45
  • 是模型的复刻0.96
  • 问题普遍性按 0–2 打分0.05
  • 与 Jev 相关0.70

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。