这是什么
Foreman 是一个 Python asyncio 运行时,位于 Codex 或 OpenCode 工作器之上。它接受自由形式的软件任务,并独立评估实现是否完成、测试是否充分、是否需要验证或是否需要人工介入。
它怎么用 Jev
Jev 评估十个维度:implementation_complete、tests_sufficient、requirements_satisfied、needs_verification、ready_to_finish、meaningful_progress、worker_stuck、work_off_track、agents_md_drift、needs_human。每个维度是一个 Noul 问题,在一个请求中发送。概率经过验证、归一化、存储在 state.json 中,并由确定性 Python 策略用于决定 CONTINUE、START_VERIFIER、STEER_WORKER、STOP_WORKER、FINISH 或 ESCALATE 等操作。
用到的原语:noul
值得抄的做法
使用快速决策模型独立监督慢速生成式工作器,而不中断其循环。
怎么试
FOREMAN_WORKER_BACKEND=opencode foreman run --repo ./my-project --job "Add request retries"
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.88
- 有 System One 用法未判定0.44
- 处理了不确定性否0.33
- 有实测数据否0.04
- 可直接跑是0.62
- 值得推荐否0.39
- 是模型的复刻否0.07
- 问题普遍性按 0–2 打分1.91
- 与 Jev 相关是0.97
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。