这是什么
jev-curate 将 Parquet 和 JSONL 数据集流经 TypeSafe AI 的 Jev 模型,用于筛选合成推理数据、指令微调对和网络抓取语料,为数据工程师原样输出干净和被拒绝的记录。
它怎么用 Jev
Jev 通过预设以多线程批次评估行。reasoning-math 使用 Noul 检查(has_circular_logic、is_step_valid)和 Score(reasoning_depth 1-5);anti-sycophancy 和 code-correctness 使用 Noul 检查。结果将行分为干净和被拒绝的输出。
用到的原语:choicescorenoul
值得抄的做法
通过 Jev 预设流式处理 Arrow/Parquet 行,配合主机端健全性修剪和自适应令牌桶限流。
怎么试
cargo install jev-curate;export TYPESAFE_API_KEY;jev-curate filter train.parquet --preset reasoning-math --out ./output/
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角是0.94
- 有 System One 用法是0.82
- 处理了不确定性否0.11
- 有实测数据否0.36
- 可直接跑是0.95
- 值得推荐未判定0.50
- 是模型的复刻否0.04
- 问题普遍性按 0–2 打分1.21
- 与 Jev 相关是0.98
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。