Jev 实战该问它什么,什么留在代码里
别拿大模型
做是非题。
Jev 不写字。你把 state 和带类型的问题发给它,约 300 毫秒后每题拿回一个概率。拍板的是你的代码。
这页上的每个数字都是 Jev 自己给的;方案文字来自语言模型,会单独标注。
01一次请求长什么样

02一道现场题
改一句话,看数字动。

一道现场的 Jev 题。任务固定;改一改「观察到的结果」,Jev 会重新回答 task_done(noul,即 P(是)),约 300 毫秒。
task今晚 7 点订一张两人的桌。
Jev 只认字面——讽刺和空喊「搞定」归你的代码管:加一道题,或在 state 里要求细节
task_done—
我们发给 Jev 的题
{
"state": {
"task": "今晚 7 点订一张两人的桌。",
"observation": "预订已确认——2 位,19:00,12 号桌。"
},
"questions": {
"task_done": {
"type": "noul",
"instructions": {
"what": "Does `observation` confirm that the goal in `task` was achieved?",
"not_for": "Partial progress, a different time or party size, or a promise to book later."
},
"criteria": {
"true": "The observation confirms the task exactly as stated.",
"false": "It does not confirm the task as stated."
}
}
}
}0 = 否 · 1 = 是 · 0.5 是「不知道」,不是「中等」
自己跑:key 在 console.typesafe.ai/keys · 输入 $0.042/百万 token,输出免费 · 这道题 … token ≈ $… · 直接 fetch,不需要 SDK
还没发布可靠性图——这页的每个数字都是现场跑的,没挑过
03三种问法
noul
observation 能确认 task 里的目标达成了吗?
“预订已确认——2 位,19:00,12 号桌。”
choice
「19:00 显示没位,19:30 可选」
score
- 0 什么都没做
- 1 开始了
- 2 确认完成一个子目标
- 3 就差最后一步
- 4 全部确认完成