这是什么
PlayJev 是在 Qwen3.5-0.8B-Base 上微调的模型,直接从原始像素玩十款经典浏览器游戏,面向实时 GUI 游戏智能体与 Jev 式决策模型。
它怎么用 Jev
每一步,模型接收当前帧(当速度重要时还包括上一帧)以及游戏给出的动作列表。单次前向传播返回这些动作上的概率;游戏循环取 argmax,低置信度的步骤可交给每款游戏的 teacher。
用到的原语:choice
值得抄的做法
在每个训练样本中打乱动作列表,使位置不携带信息。
怎么试
python -m playjev.play snake --policy local --ckpt OmniJev/PlayJev-0.8B --episodes 1
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.84
- 有 System One 用法是0.85
- 处理了不确定性是0.65
- 有实测数据是0.93
- 可直接跑未判定0.53
- 值得推荐未判定0.45
- 是模型的复刻是0.96
- 问题普遍性按 0–2 打分0.05
- 与 Jev 相关是0.70
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。