jevbooks

← 全部项目

jev-research-eval

jgridifier/jev-research-eval

可复现的 Jev Ultrafast 研究浏览器任务评估工具。

评测与基准100%次选分类: 分类与路由

这是什么

一个可复现的评估工具,用于 Jared 的 Jev Ultrafast 研究浏览器会话,包含基线案例、压力测试套件、QC 评分、现场笔记和笔记本。面向评估浏览器代理的研究人员。

它怎么用 Jev

Jev 在研究浏览器代理中做出决策;该工具驱动 browser-use/jev-ultrafast 的上游检出以运行案例,然后应用 QC 评分并生成报告。Jev 的输出用于代理的历史记录和追踪中。

值得抄的做法

CoS 锁定的 QC 评分和逐步 Trace 报告,用于可复现评估。

怎么试

运行 python scripts/generate_report_v4.py --input fixtures/qc_rescored.json --output /tmp/jev_note_regen.html

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角未判定0.44
  • 有 System One 用法未判定0.40
  • 处理了不确定性0.05
  • 有实测数据0.19
  • 可直接跑0.11
  • 值得推荐未判定0.43
  • 是模型的复刻0.04
  • 问题普遍性按 0–2 打分1.00
  • 与 Jev 相关0.97

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。