这是什么
一个 LLM 网关与基准测试,在七个合成工作负载上对比 TypeSafe Jev 与 Cerebras 上的 Qwen 3.8 27B,记录延迟、成本和判断质量,供评估结构化输出方案的开发者参考。
它怎么用 Jev
Jev 每次请求处理一个应用决策,通过批量发送原生 Choice/Noul 问题,映射到与 Qwen 的 schema 约束响应相同的应用输出。结果在模拟操作前经过验证;原生概率保留在导出中。
用到的原语:choicenoul
值得抄的做法
将应用字段编译为紧凑的数值槽位,并批量发送原生类型化问题,而非一个联合 schema 响应。
怎么试
npm ci;在 .env 中设置 CEREBRAS_API_KEY 和 JEV_KEY;npm run build;npm run start:demos:live
证据
每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。
- Jev 是主角否0.31
- 有 System One 用法否0.21
- 处理了不确定性否0.07
- 有实测数据否0.17
- 可直接跑否0.19
- 值得推荐否0.24
- 是模型的复刻是0.62
- 问题普遍性按 0–2 打分1.17
- 与 Jev 相关是0.97
信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。