jevbooks

← 全部项目

jev-lab

llt22/jev-lab

Jev 独立实验室:基准测试、用例与生态审计。

评测与基准89%次选分类: 校准与研究

这是什么

一个社区运营的 TypeSafe Jev(System One 模型)研究实验室。它整理官方资源、SDK 和真实用例,并提供 Noul、Choice、Score 原语、置信度门控、扇出延迟和代理控制的可复现基准测试。

它怎么用 Jev

Jev 将自然语言状态转化为类型化决策:Noul 用于是/否,Choice 用于选择选项,Score 用于有序评分。实验室对这些原语进行基准测试,测量扇出延迟和置信度门控升级,并将 Jev 与确定性关键词基线在支持路由上进行比较。

用到的原语:choicescorenoul

值得抄的做法

基于 API 的 confidence 进行门控,而不仅仅依赖最大答案概率;将接近 0.5 的概率视为不确定性。

怎么试

cp .env.example .env; python3 -m unittest discover -s tests; python3 scripts/evaluate_support.py --run-name support-routing-v1

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.93
  • 有 System One 用法0.79
  • 处理了不确定性0.10
  • 有实测数据0.10
  • 可直接跑0.11
  • 值得推荐未判定0.53
  • 是模型的复刻0.05
  • 问题普遍性按 0–2 打分1.00
  • 与 Jev 相关0.98

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月21日 读 README 写成。