这是什么
在 Agent Skills Hub 目录(33,047 个 skills、MCP servers 与 coding-agent 工具)上做分级相关性评测,含 164 条中/英/混合查询与 9,831 个标注对,比较 Jev 重排与词法、embedding、融合基线。
它怎么用 Jev
Jev 作为 score 重排器作用于其他系统 top 30 候选,每查询一次 API 调用;同时作为两个标注模型之一产出 0–3 相关性标签。README 未说明代码中除 OpenRouter /alpha/decisions 端点外如何调用 Jev。
用到的原语:score
值得抄的做法
在三套标签集(含 Jev 未参与的一套)下重评每个系统,以暴露评审循环偏差。
怎么试
python -m jse robustness(无 API 调用);完整表格见 results/robustness.md
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角否0.34
- 有 System One 用法否0.13
- 处理了不确定性否0.04
- 有实测数据未判定0.45
- 可直接跑否0.11
- 值得推荐否0.25
- 是模型的复刻否0.14
- 问题普遍性按 0–2 打分1.06
- 与 Jev 相关是0.98
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。