jevbooks

← 全部项目

jev-search-rerank-eval

zhuyansen/jev-search-rerank-eval

TypeSafe Jev 重排能否胜过 embedding 检索?

打分与排序82%次选分类: 评测与基准

这是什么

在 Agent Skills Hub 目录(33,047 个 skills、MCP servers 与 coding-agent 工具)上做分级相关性评测,含 164 条中/英/混合查询与 9,831 个标注对,比较 Jev 重排与词法、embedding、融合基线。

它怎么用 Jev

Jev 作为 score 重排器作用于其他系统 top 30 候选,每查询一次 API 调用;同时作为两个标注模型之一产出 0–3 相关性标签。README 未说明代码中除 OpenRouter /alpha/decisions 端点外如何调用 Jev。

用到的原语:score

值得抄的做法

在三套标签集(含 Jev 未参与的一套)下重评每个系统,以暴露评审循环偏差。

怎么试

python -m jse robustness(无 API 调用);完整表格见 results/robustness.md

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.34
  • 有 System One 用法0.13
  • 处理了不确定性0.04
  • 有实测数据未判定0.45
  • 可直接跑0.11
  • 值得推荐0.25
  • 是模型的复刻0.14
  • 问题普遍性按 0–2 打分1.06
  • 与 Jev 相关0.98

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。