jevbooks

← 全部项目

jev_playground

JYeswak/jev_playground

在基于 Jev 构建之前,衡量它实际能做什么。

评测与基准79%次选分类: 校验与安全门题目体检

这是什么

一个测试 Jev 在真实数据上表现的 playground,记录分级发现、已排除的候选方案以及带停止条件的配方。面向在集成前评估 Jev 成本效益的开发者。

它怎么用 Jev

README 未描述具体的 Jev 决策、状态输入或结果在代码中的使用方式。它报告了 Jev 在工具调用危害、钓鱼、路由和压缩等表面上的测试,但没有给出实现细节。

值得抄的做法

使用留出数据和基础率来避免高估可部署性。

怎么试

运行 `node work/omp-harm-rule/verify-claim.mjs` 或 `bash foundation/gates.sh`。

去 GitHub 看

Jev 判的jev-1.13.0

证据

每一行都是就 README 问 Jev 的一道题。≥ 0.60 算「是」,≤ 0.40 算「否」,中间这一段 Jev 不下判断。

  • Jev 是主角0.29
  • 有 System One 用法0.28
  • 处理了不确定性0.10
  • 有实测数据0.94
  • 可直接跑0.09
  • 值得推荐0.19
  • 是模型的复刻0.15
  • 问题普遍性按 0–2 打分1.46
  • 与 Jev 相关0.95

信号由 Jev jev-1.13.0 判定,简介由 DeepSeek V4.1 Flash 于 2026年9月20日 读 README 写成。