jevbooks

← 全部项目

typesafe-ai-benchmark

iammrduncan/typesafe-ai-benchmark · 项目主页

Jev 与 Qwen 在结构化判断任务上的并排基准测试。

评测与基准96%次选分类: 校验与安全门一个 state 多题平铺

这是什么

一个 LLM 网关与基准测试,在七个合成工作负载上对比 TypeSafe Jev 与 Cerebras 上的 Qwen 3.8 27B,记录延迟、成本和判断质量,供评估结构化输出方案的开发者参考。

它怎么用 Jev

Jev 每次请求处理一个应用决策,通过批量发送原生 Choice/Noul 问题,映射到与 Qwen 的 schema 约束响应相同的应用输出。结果在模拟操作前经过验证;原生概率保留在导出中。

用到的原语:choicenoul

值得抄的做法

将应用字段编译为紧凑的数值槽位,并批量发送原生类型化问题,而非一个联合 schema 响应。

怎么试

npm ci;在 .env 中设置 CEREBRAS_API_KEY 和 JEV_KEY;npm run build;npm run start:demos:live

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.31
  • 有 System One 用法0.21
  • 处理了不确定性0.07
  • 有实测数据0.17
  • 可直接跑0.19
  • 值得推荐0.24
  • 是模型的复刻0.62
  • 问题普遍性按 0–2 打分1.17
  • 与 Jev 相关0.97

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。