一句话看懂:Jev 是 TypeSafe AI 发布的首个 System One 模型——它不生成文本,只接收一段「程序状态 + 类型化问题」,然后在几十到几百毫秒内并行返回带校准概率的结构化决策。输入每百万 Token 只要 $0.042,输出 Token 永久免费。

目录
1. 背景:教 AI 说话的人,为什么让 AI 闭嘴
2026 年 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 结束两年隐身,正式发布新模型 Jev,同时宣布其创办的初创公司 TypeSafe AI 浮出水面,种子轮融资 4000 万美元,由 DCVC 领投。
Almeida 的履历相当硬核:他是 2022 年 InstructGPT 论文(Ouyang et al.)的第四作者,是 RLHF 的共同发明人之一,深度参与了 OpenAI 早期 RLHF 与 GPT-4 相关工作——可以说,今天 ChatGPT 背后的核心方法有他一份。
而他这次的选择极具戏剧性:亲手教了 AI 小半辈子「好好说话」,转头就做了个「哑巴」模型。
Almeida 在 X(原推特)上写道:
After co-inventing ChatGPT, I kept asking myself: why have superhuman chat models not led to AGI? 我花了两年时间秘密研究新的训练方法(RLCD)和一种新类型的前沿 AI 模型——今天正式发布:Jev。
- 20-200x faster(快 20-200 倍)
- 40-400x cheaper(便宜 40-400 倍,输出 Token 免费)
这条推文引爆全网:播放量 3700 万+,发布不到 36 小时就有 14 万开发者涌入内测,Vercel、Cloudflare、LangChain 等主流平台迅速集成,连 Google Gemma 官方账号都发了「DiffusionGemma as Jev」跟风蹭热度。
为什么叫 Jev?
名字来自经济学中的 杰文斯悖论(Jevons Paradox):蒸汽机效率越高,烧掉的煤反而越多。Almeida 的野心很直白——当 AI 决策的成本趋近于零、速度快到离谱时,开发者对 AI 决策的需求不会减少,而会像大爆炸一样席卷所有代码。
为什么叫 System One?
来自诺贝尔奖得主丹尼尔·卡尼曼《思考,快与慢》:系统 1 是快速、直觉式的本能判断,系统 2 是缓慢、深度的逻辑推理。Almeida 认为现在的 LLM 都在沿着系统 2 走(慢速、长文本推理),而 Jev 反其道而行之,专攻系统 1——高速直觉式决策。
2. 核心设计:System One——只做判断,不写作文
Jev 的定位是官方博客里那句话:
Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out. (把 Jev 想成一个前沿智能函数调用:非结构化状态进,类型化概率决策出。)
2.1 三种原语(Primitives)
Jev 不生成任何自然语言,输出只有三种固定形状,官方文档称为「原语(Primitives)」:
| Choice(选择) | 从这些选项里选哪个? | 选项 + 每个选项的概率 + 置信度 | 最多 255 个选项,建议补一个 other 兜底 |
| Score(评分) | 在这个有序刻度上打几分? | 分数(概率加权均值)+ 各级概率 + 置信度 | 至少 2 级、最多 10 级 |
| Noul(判断) | 这个陈述是否成立? | 0-1 之间的「是」概率 | 无独立置信度,可选 criteria 说明是与否的含义 |
有趣的小知识:Noul 这个词是「binary (boulean)」倒过来拼的,官方自己也在 FAQ 里承认。
每个答案都附带所有选项的概率分布 + 整体置信度。多个问题可以在一次请求里并行问同一个 state,官方表示「加问题几乎不增加响应时间」,因为问题是相互隔离的,不会出现长上下文导致的「context-rot(上下文腐烂)」。
2.2 为什么「零类型错误」是数学上保证的
因为 Jev 根本不解码文本 token,它只会给预先定义好的选项分配概率——你给它 A、B、C 三个选项,它物理上不可能输出一个 D。所以永远不会出现坏的 JSON、未转义的引号、非法的 key。

2.3 采样方式:并行 vs 逐 token
| 采样方式 | 顺序生成,一个 token 依赖上一个 token | 并行采样,所有输出一次查询全部给出 |
| 端到端延迟 | 3 – 329 秒(前沿模型) | 70 – 500 毫秒(官方数据) |
| 输出 | 字符串,需要解析 + 校验 + 重试 | 类型安全的结构化值,拿来即用 |
| 幻觉风险 | 可能跑偏、编造、拒答 | 选项之外编不出来(但可能选错,见第 8 节) |
3. 训练方法:RLCD,第三条强化学习路线
Jev 的核心创新是新的训练方法:RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。TypeSafe 把它定位为继 RLHF、RLVR 之后的第三条强化学习路径。
#mermaid-svg-LWyDGEz2Ck3dlGgw{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-LWyDGEz2Ck3dlGgw .error-icon{fill:#552222;}#mermaid-svg-LWyDGEz2Ck3dlGgw .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-LWyDGEz2Ck3dlGgw .marker{fill:#333333;stroke:#333333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .marker.cross{stroke:#333333;}#mermaid-svg-LWyDGEz2Ck3dlGgw svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-LWyDGEz2Ck3dlGgw p{margin:0;}#mermaid-svg-LWyDGEz2Ck3dlGgw .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster-label text{fill:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster-label span{color:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster-label span p{background-color:transparent;}#mermaid-svg-LWyDGEz2Ck3dlGgw .label text,#mermaid-svg-LWyDGEz2Ck3dlGgw span{fill:#333;color:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .node rect,#mermaid-svg-LWyDGEz2Ck3dlGgw .node circle,#mermaid-svg-LWyDGEz2Ck3dlGgw .node ellipse,#mermaid-svg-LWyDGEz2Ck3dlGgw .node polygon,#mermaid-svg-LWyDGEz2Ck3dlGgw .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .rough-node .label text,#mermaid-svg-LWyDGEz2Ck3dlGgw .node .label text,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape .label,#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape .label{text-anchor:middle;}#mermaid-svg-LWyDGEz2Ck3dlGgw .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .rough-node .label,#mermaid-svg-LWyDGEz2Ck3dlGgw .node .label,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape .label,#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape .label{text-align:center;}#mermaid-svg-LWyDGEz2Ck3dlGgw .node.clickable{cursor:pointer;}#mermaid-svg-LWyDGEz2Ck3dlGgw .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .arrowheadPath{fill:#333333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-LWyDGEz2Ck3dlGgw .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-LWyDGEz2Ck3dlGgw .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster text{fill:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster span{color:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-LWyDGEz2Ck3dlGgw .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw rect.text{fill:none;stroke-width:0;}#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape p,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape .label rect,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-LWyDGEz2Ck3dlGgw .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-LWyDGEz2Ck3dlGgw .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-LWyDGEz2Ck3dlGgw :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}
基础语言模型Pre-Trained Models
post-training
延伸
另一条路
第三条路
GPT / BERTsLow Intelligence
GPT-3 / LLaMaHigh Intelligence
RLHFChat Models聊天模型
RLVRReasoning Models推理模型 (o1/o3)
InstructGPT / Grok / DeepSeek
RLCDSystem One Models校准决策模型 (Jev)
三条路线对比
| RLHF | 人类反馈强化学习 | 「人类看了很爽」的回复 | ChatGPT、Claude 等聊天模型 |
| RLVR | 可验证奖励强化学习 | 能被程序验证的结果(数学、代码) | o1、o3 等推理模型 |
| RLCD | 校准决策强化学习 | 「你给的概率要和实际命中率咬合」 | Jev 等 System One 模型 |
校准(Calibration)是什么意思?
用 TypeSafe 原话:模型说 0.9,就必须有大约 90% 的时候是正确的。
- 被模型标为 0.2 概率的结果,真实发生的比例应约等于 20%
- 被模型标为 0.8 概率的结果,真实发生的比例应约等于 80%
这就是「诚实的概率(epistemically honest probabilities)」。没有校准的置信度数字没有参考价值——而 RLHF 恰恰会奖励过度自信和听起来自信的幻觉。
注意:截至 2026 年 9 月,TypeSafe 没有发表 RLCD 的技术论文(arXiv 上搜不到),方法细节不可外部验证。目前关于 RLCD 的描述全部来自官方博客、文档和 AI primer。这一条在圈内有不少讨论,详见第 8 节。
4. 性能与成本:20-200 倍快,40-400 倍便宜
4.1 官方核心数据
| 端到端延迟 | 70 – 500 ms | 官网演示 0.114s 完成 27 个问题 |
| 输入价格 | $0.042 / 百万 token($42/十亿 token) | 对比 Claude Fable 5.1 的 $10/百万,低约 238 倍 |
| 输出价格 | 免费(too cheap to meter) | 没有逐字生成过程,就没有可计费的输出 |
| 对比 LLM 速度 | 快 40-200 倍 | 官方声称,同智能水平 |
| 对比 LLM 价格 | 便宜 40-400 倍 | Almeida 推文口径 |
| 工作流评测 | 快 193.6 倍、便宜 444.6 倍 | 官方 homepage,基于 4 个工作流评测 |
| 上下文窗口 | ~32K token(约 15 万英文字符) | 所有问题共享请求预算 |
4.2 官网「当面打脸」演示
TypeSafe 官网放了一个并排对比 demo:同样 27 个问题、同样的输入,同时发起请求:
| 耗时 | 0.114 秒 | 8.566 秒 |
| 成本 | $0.000081 | $0.013880 |
| 输出方式 | 27 个答案一次性全部给出 | 逐 token 生成,等待首个 token |
官网自己也承认这个 demo 做了有利于自己的选择:输入是短而紧凑的段落,27 个问题也被简化过。但「并行输出全部答案」与「逐 token 等待」的差距是实打实存在的。
4.3 独立第三方评测:半美分跑完 24 份挪威语意见信
开发者 Emil Lindfors(9 月 18 日)用自己的早期访问密钥做了独立测试:把 24 份挪威语公共听证意见书(鲑鱼资源税,语言杂乱、含 PDF 提取的归档码)发给 Jev 1.13,与 DeepSeek V4.1 Flash(OpenRouter,reasoning 开/关)对比:
| 立场判断(4 选) | 20/24 | 20/24 | 22/24 |
| 回应者类型(6 选) | 21/23 | 22/23 | 23/23 |
| 论据识别(192 个是非) | 0.86 | 0.89 | 0.88 |
| 内容深度评级(精确等级) | 19/24 | 14/24 | 14/24 |
| 成本(每 1000 份文档) | $0.22 | $1.31 | $3.08 |
| 中位延迟 | 0.32 s | 2.7 s | 26 s |
| 最慢请求 | 1.3 s | 17.9 s | 250 s |
关键结论(注意:参考标签由 Claude Fable 5.1 标注,只测一致性不测绝对正确性):
4.4 校准能力对比(这是最值钱的部分)
RLCD 要买的就是「概率可信」。Lindfors 用 192 个是非论据判断做了个粗略校准检查:
| 0.0 – 0.1 | 14 | 0% |
| 0.1 – 0.3 | 56 | 4% |
| 0.3 – 0.7 | 41 | 34% |
| 0.7 – 0.9 | 38 | 97% |
| 0.9 – 1.0 | 43 | 98% |
方向完全正确,只是两端略保守。而 DeepSeek 开推理时,声称 0.7-0.9 的答案里参考标签只有 48% 同意——这就是「会说话的自信」和「校准过的自信」的区别。
在实战中的用法:Jev 说 0.9 以上时基本可以放心自动执行(Stance 15 个里对 14 个,Respondent 20/20),低于 0.9 的丢给人或更慢的推理模型复核。这就是官方推荐的 confidence-gated routing(置信度门控路由)。
5. Jev vs 其他模型:一次正面 PK
5.1 官方对比:LLM vs System One
这是 TypeSafe 官方博客的框架(注意:官方口径,立场偏自家):
| 优化目标 | 人类偏好(RLHF)/ 可验证奖励(RLVR) | 校准决策(RLCD) |
| 输入侧重 | 顺序消息 | 结构化程序状态 |
| 输出 | 字符串,需解析 + 校验 | 类型安全结构值,定义在请求前 |
| 采样 | 顺序逐 token | 并行,一次查询全出 |
| 成本 | 输入 $0.20-$10/百万 token,输出约 5 倍 | 输入 $0.042/百万,输出免费 |
| 速度 | 端到端 3-329 秒 | 70-500ms |
| 置信度 | 过度自信、前后不一致 | 每次输出都带校准概率 |
| 适合场景 | 聊天、Copilot、编码 Agent、可验证问题、Demo | 智能 if 语句、Map-Reduce、实时应用、LLM 输出审核 |
5.2 与当下主流模型对比总表
| 类型 | System One 决策模型 | 通用 LLM | 通用 LLM | 通用 LLM |
| 输出 | 结构化决策+概率 | 文本(可要求 JSON) | 文本(可要求 JSON) | 文本(可要求 JSON) |
| 端到端延迟 | 70-500ms | 数秒-数十秒 | 数秒-数十秒 | 2.7s(无推理)/ 26s(推理) |
| 输入价格/百万 token | $0.042 | ~$2 | ~$10(Fable 5.1) | ~$0.2-0.6(Flash 级) |
| 输出价格/百万 token | $0(免费) | ~$12 | ~$50 | 按 token 计费 |
| 置信度 | 校准,随输出返回 | 无原生校准 | 无原生校准 | 无原生校准 |
| 是否可能输出非法结构 | 不可能(数学保证) | 可能,需解析校验 | 可能,需解析校验 | 可能,需解析校验 |
| 能否写文章/聊天 | 不能 | 能 | 能 | 能 |
| 上下文 | 32K token | 大(百万级) | 大(百万级) | 大 |
| 图像输入 | 不支持 | 支持 | 支持 | 支持 |
核心判断:Jev 不是来替代 LLM 的,它是给软件当「判断单元」的。官方原话:Jev 和现有大模型的关系是「双核搭档」——LLM 在前面吭哧吭哧生成内容,Jev 在旁边花几十毫秒给产物打分、把关、路由。
独立评测里 Jev 的 stance(立场判断)与 DeepSeek 打平(20/24),但成本和延迟低一个数量级以上;有序评级(Score)则明显领先。而在需要自由生成、长文本推理、图像理解的场景,Jev 完全不在讨论范围内。
6. 典型应用案例
6.1 客服工单自动路由(最典型的入门场景)
把一封「炸毛的客诉邮件」丢给 Jev,一次请求并行问:
- 该转哪个部门?(Choice:billing / technical / sales / other)
- 用户是不是在要退款?(Noul)
- 情绪激烈程度?(Score:1-5)
- 需要人工介入吗?(Noul)
软件拿到结果直接执行:if 退款概率 > 0.9 and 情绪评分 > 4 → 转人工加急。全程不需要任何人去读那封邮件。
6.2 安全事件响应(官方演示过的完整流程)
量子位报道中展示了 TypeSafe 官方演示的安全告警自动处理流水线:
#mermaid-svg-mU7scdbS6oo62oxm{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-mU7scdbS6oo62oxm .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-mU7scdbS6oo62oxm .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-mU7scdbS6oo62oxm .error-icon{fill:#552222;}#mermaid-svg-mU7scdbS6oo62oxm .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-mU7scdbS6oo62oxm .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-mU7scdbS6oo62oxm .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-mU7scdbS6oo62oxm .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-mU7scdbS6oo62oxm .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-mU7scdbS6oo62oxm .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-mU7scdbS6oo62oxm .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-mU7scdbS6oo62oxm .marker{fill:#333333;stroke:#333333;}#mermaid-svg-mU7scdbS6oo62oxm .marker.cross{stroke:#333333;}#mermaid-svg-mU7scdbS6oo62oxm svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-mU7scdbS6oo62oxm p{margin:0;}#mermaid-svg-mU7scdbS6oo62oxm .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-mU7scdbS6oo62oxm .cluster-label text{fill:#333;}#mermaid-svg-mU7scdbS6oo62oxm .cluster-label span{color:#333;}#mermaid-svg-mU7scdbS6oo62oxm .cluster-label span p{background-color:transparent;}#mermaid-svg-mU7scdbS6oo62oxm .label text,#mermaid-svg-mU7scdbS6oo62oxm span{fill:#333;color:#333;}#mermaid-svg-mU7scdbS6oo62oxm .node rect,#mermaid-svg-mU7scdbS6oo62oxm .node circle,#mermaid-svg-mU7scdbS6oo62oxm .node ellipse,#mermaid-svg-mU7scdbS6oo62oxm .node polygon,#mermaid-svg-mU7scdbS6oo62oxm .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-mU7scdbS6oo62oxm .rough-node .label text,#mermaid-svg-mU7scdbS6oo62oxm .node .label text,#mermaid-svg-mU7scdbS6oo62oxm .image-shape .label,#mermaid-svg-mU7scdbS6oo62oxm .icon-shape .label{text-anchor:middle;}#mermaid-svg-mU7scdbS6oo62oxm .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-mU7scdbS6oo62oxm .rough-node .label,#mermaid-svg-mU7scdbS6oo62oxm .node .label,#mermaid-svg-mU7scdbS6oo62oxm .image-shape .label,#mermaid-svg-mU7scdbS6oo62oxm .icon-shape .label{text-align:center;}#mermaid-svg-mU7scdbS6oo62oxm .node.clickable{cursor:pointer;}#mermaid-svg-mU7scdbS6oo62oxm .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-mU7scdbS6oo62oxm .arrowheadPath{fill:#333333;}#mermaid-svg-mU7scdbS6oo62oxm .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-mU7scdbS6oo62oxm .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-mU7scdbS6oo62oxm .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-mU7scdbS6oo62oxm .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-mU7scdbS6oo62oxm .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-mU7scdbS6oo62oxm .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-mU7scdbS6oo62oxm .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-mU7scdbS6oo62oxm .cluster text{fill:#333;}#mermaid-svg-mU7scdbS6oo62oxm .cluster span{color:#333;}#mermaid-svg-mU7scdbS6oo62oxm div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-mU7scdbS6oo62oxm .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-mU7scdbS6oo62oxm rect.text{fill:none;stroke-width:0;}#mermaid-svg-mU7scdbS6oo62oxm .icon-shape,#mermaid-svg-mU7scdbS6oo62oxm .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-mU7scdbS6oo62oxm .icon-shape p,#mermaid-svg-mU7scdbS6oo62oxm .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-mU7scdbS6oo62oxm .icon-shape .label rect,#mermaid-svg-mU7scdbS6oo62oxm .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-mU7scdbS6oo62oxm .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-mU7scdbS6oo62oxm .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-mU7scdbS6oo62oxm :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}
1 Triage 分诊3 个读数:是否未授权?是否有记录解释?证据多强?
2 Disposition 处置代码把读数转成close / quiesce / act
3 Containment 遏制对事件状态跑 11 个读数:凭证、会话、邮件、持久化、进程、流量、横向移动
4 Playbook 行动手册按严重级别分组执行动作:严重→隔离资产+撤销凭证高→轻遏制+杀进程中→监控+限权低→静默+记录
不符合任何分组→ 紧急升级人工
每个步骤都是 Jev 输出概率 → 代码根据阈值决策,无人值守。
6.3 实时游戏决策:AI 打《毁灭战士》
TypeSafe 放出的演示:让 Jev 实时玩《毁灭战士》,每秒做 10 次决策,一小时算力成本仅约 7 美元。还有维基百科超链寻路——从几千个链接里每次挑选最可能通向目标页的链接(Choice 上限 255 个选项正好用上)。
6.4 代码审查(PR 评审)
36氪报道的开发者用例:用 Jev 审 PR,一次 7 万分之一美元,审 1000 个 PR 才花 7 美分;同样的活交给 Claude Opus 5 要烧掉约 14.5 美元。
6.5 LLM 输出验证 / Guardrail(官方主推场景)
Jev 的「双核搭档」玩法:LLM 生成内容 → Jev 打分(是否合规、是否越狱、是否幻觉、是否应放行)→ 分数高放行,分数低打回重写。TypeSafe 官方 SEC 文件 cookbook 报告:置信度 ≥0.9 时 30 个里对 27 个。
6.6 Map-Reduce 大数据处理
官方推荐的场景之一:对 PB 级数据逐条跑结构化问题,把每条记录变成特征/标签/判断,再做聚合。单条 70-500ms、单次半美分级成本,让这种「把智能铺满每一行数据」成为可能。
7. 实战:API 调用示例
说明:Jev 目前是 early access(早期访问),需在 typesafe.ai 官网登记 waitlist。以下示例根据官方文档、Cloudflare 集成文档和社区教程整理,接口字段以官方最新 SDK 为准。
7.1 安装与初始化
# Python SDK
pip install typesafe-sdk
# 或 npm
npm install typesafe-sdk
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
# 自动读取环境变量 TYPESAFE_API_KEY
client = TypeSafeClient(model="jev-latest")
7.2 一个请求问三种问题(Noul + Choice + Score 混合)
以客服工单为例——一次调用,并行返回多个决策:
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
ticket = (
"I was charged twice for order A-104. I've asked three times now. "
"Please refund the duplicate charge or I'm switching to a competitor."
)
with TypeSafeClient() as client:
result = client.system_one(
state=ticket,
questions={
# Choice:该转哪个部门?
"department": Choice(
instructions="Which team should handle this support request?",
criteria={
"billing": "Charges, invoices, refunds, or subscriptions",
"technical": "Product bugs, outages, or integrations",
"account": "Login, password, profile, or security issues",
"other": "Requests that do not fit the other departments",
},
),
# Noul:用户是不是在要求退款?
"refund_requested": Noul(
instructions="Is the customer asking for a refund or money back?"
),
# Noul:是否情绪激烈/有流失风险?
"churn_risk": Noul(
instructions="Is the customer threatening to leave or escalate?"
),
# Score:紧急程度 0-5
"urgency": Score(
instructions="Rate the urgency of this request.",
legend={
"0": "No time pressure",
"3": "Needs attention today",
"5": "Immediate action required",
},
),
},
)
print(result.choices["department"].choice) # billing
print(result.nouls["refund_requested"].noul) # 0.98
print(result.nouls["churn_risk"].noul) # 0.93
print(result.scores["urgency"].score) # 3.8
7.3 JavaScript / TypeScript
import { TypeSafeClient } from "typesafe-sdk";
const client = new TypeSafeClient({ model: "jev-latest" });
const result = await client.system_one({
state: "My running shoes arrived in the wrong size. Can I swap them for a size 10?",
questions: {
department: {
type: "choice",
instructions: "Which team should handle this?",
criteria: {
returns: "Exchanges, refunds, wrong or damaged items",
shipping: "Delivery status, delays, lost packages",
billing: "Charges, invoices, payment problems",
},
},
refund: {
type: "noul",
instructions: "Is the customer asking for a refund?",
},
},
});
console.log(result.answers.refund); // { type: 'noul', noul: 0.98 }
7.4 原生 HTTP 调用(不依赖 SDK)
curl https://api.typesafe.ai/v1/systemone \\
-H "Authorization: Bearer $TYPESAFE_API_KEY" \\
-H "Content-Type: application/json" \\
-d '{
"model": "jev-latest",
"state": "My card was charged twice for the same subscription. Please fix this.",
"questions": {
"refund": {
"type": "noul",
"instructions": "Is the customer asking for money back?"
},
"department": {
"type": "choice",
"instructions": "Which team should handle this support request?",
"criteria": {
"billing": "Charges, invoices, refunds, or subscriptions",
"technical": "Product bugs, outages, or integrations",
"other": "Anything else"
}
}
}
}'
典型响应(社区实测截图整理):
{
"model": "jev-1.13.0",
"answers": {
"department": {
"type": "choice",
"choice": "billing",
"confidence": 1.0,
"probabilities": {
"billing": 0.98,
"technical": 0.01,
"other": 0.01
}
},
"refund": {
"type": "noul",
"noul": 0.99
}
},
"usage": {
"input_tokens": 292,
"output_tokens": 25
},
"evaluation_time_ms": 123
}
7.5 置信度门控模式(官方推荐架构)
这是 Jev 官方文档主推的用法——用置信度分三档路由:
#mermaid-svg-uZBn1caycsoJcfGC{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-uZBn1caycsoJcfGC .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-uZBn1caycsoJcfGC .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-uZBn1caycsoJcfGC .error-icon{fill:#552222;}#mermaid-svg-uZBn1caycsoJcfGC .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-uZBn1caycsoJcfGC .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-uZBn1caycsoJcfGC .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-uZBn1caycsoJcfGC .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-uZBn1caycsoJcfGC .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-uZBn1caycsoJcfGC .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-uZBn1caycsoJcfGC .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-uZBn1caycsoJcfGC .marker{fill:#333333;stroke:#333333;}#mermaid-svg-uZBn1caycsoJcfGC .marker.cross{stroke:#333333;}#mermaid-svg-uZBn1caycsoJcfGC svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-uZBn1caycsoJcfGC p{margin:0;}#mermaid-svg-uZBn1caycsoJcfGC .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-uZBn1caycsoJcfGC .cluster-label text{fill:#333;}#mermaid-svg-uZBn1caycsoJcfGC .cluster-label span{color:#333;}#mermaid-svg-uZBn1caycsoJcfGC .cluster-label span p{background-color:transparent;}#mermaid-svg-uZBn1caycsoJcfGC .label text,#mermaid-svg-uZBn1caycsoJcfGC span{fill:#333;color:#333;}#mermaid-svg-uZBn1caycsoJcfGC .node rect,#mermaid-svg-uZBn1caycsoJcfGC .node circle,#mermaid-svg-uZBn1caycsoJcfGC .node ellipse,#mermaid-svg-uZBn1caycsoJcfGC .node polygon,#mermaid-svg-uZBn1caycsoJcfGC .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-uZBn1caycsoJcfGC .rough-node .label text,#mermaid-svg-uZBn1caycsoJcfGC .node .label text,#mermaid-svg-uZBn1caycsoJcfGC .image-shape .label,#mermaid-svg-uZBn1caycsoJcfGC .icon-shape .label{text-anchor:middle;}#mermaid-svg-uZBn1caycsoJcfGC .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-uZBn1caycsoJcfGC .rough-node .label,#mermaid-svg-uZBn1caycsoJcfGC .node .label,#mermaid-svg-uZBn1caycsoJcfGC .image-shape .label,#mermaid-svg-uZBn1caycsoJcfGC .icon-shape .label{text-align:center;}#mermaid-svg-uZBn1caycsoJcfGC .node.clickable{cursor:pointer;}#mermaid-svg-uZBn1caycsoJcfGC .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-uZBn1caycsoJcfGC .arrowheadPath{fill:#333333;}#mermaid-svg-uZBn1caycsoJcfGC .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-uZBn1caycsoJcfGC .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-uZBn1caycsoJcfGC .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-uZBn1caycsoJcfGC .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-uZBn1caycsoJcfGC .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-uZBn1caycsoJcfGC .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-uZBn1caycsoJcfGC .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-uZBn1caycsoJcfGC .cluster text{fill:#333;}#mermaid-svg-uZBn1caycsoJcfGC .cluster span{color:#333;}#mermaid-svg-uZBn1caycsoJcfGC div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-uZBn1caycsoJcfGC .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-uZBn1caycsoJcfGC rect.text{fill:none;stroke-width:0;}#mermaid-svg-uZBn1caycsoJcfGC .icon-shape,#mermaid-svg-uZBn1caycsoJcfGC .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-uZBn1caycsoJcfGC .icon-shape p,#mermaid-svg-uZBn1caycsoJcfGC .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-uZBn1caycsoJcfGC .icon-shape .label rect,#mermaid-svg-uZBn1caycsoJcfGC .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-uZBn1caycsoJcfGC .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-uZBn1caycsoJcfGC .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-uZBn1caycsoJcfGC :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}
高(> 0.9)
中(0.7 – 0.9)
低(< 0.7)
Jev 输出决策 + 概率
置信度?
自动执行无人值守
确认制通知用户确认后执行
升级转人工 / 转慢速推理模型
THRESHOLD_AUTO = 0.9
THRESHOLD_CONFIRM = 0.7
def route(action_decision, destructive=False):
# 破坏性操作提高门槛
auto_t = THRESHOLD_AUTO if not destructive else 0.97
if action_decision.confidence >= auto_t:
return "AUTO_EXECUTE"
if action_decision.confidence >= THRESHOLD_CONFIRM:
return "ASK_CONFIRM"
return "ESCALATE_HUMAN"
设计要点:
- 破坏性操作(删库、退款、封号)比只读操作(分类、打标)设置更高的自动执行门槛
- 除了官方返回的 confidence,你也可以自己从原始概率分布算(分布集中在单一选项 = 高置信)
- 多个独立判断拆成多个 question 并行问,比让模型一次性写长分析可靠得多
8. 局限与争议:不要把「零幻觉」神话
Jev 火得越快,质疑声也越多。客观列一下目前已知的短板和争议:
| 「零幻觉」要打折 | Jev 保证的是类型正确(不会输出选项外的东西),不是事实正确——正确答案是 A,它照样可能选成 B。官方自己也承认这一点。 |
| 无技术论文 | RLCD 只有博客描述,arXiv 无预印本,架构、参数量、训练算力全部未公开,外部无法验证「校准」声称。 |
| 不支持图像输入 | 目前纯文本。Google 拿 DiffusionGemma 演示的正是「补上视觉」的方向。 |
| 数学推理弱 | 需要一步步推导的数学任务,官方口径「顶多 GPT-4 水平」。 |
| 上下文 32K | 对超长文档(如整本书、超长日志)力不从心;且非英语场景 token 效率低(挪威语约 2.06 字符/token)。 |
| 校准不是一次性的 | 校准是在「你的流量分布」上统计成立的。输入分布一变,必须重新在自己的业务流量上测量。 |
| 置信度统计 ≠ 正确性保证 | confidence 是概率分布形状算出的统计量,不代表「这个答案一定对」。 |
| 定价可持续性存疑 | 官方自己承认「无法证明没补贴」,不过也预期价格只会降不会涨。 |
| 发布评测口径 | 官方明确不发布公共 benchmark 成绩(理由是防「benchmaxxing」),现有数字多为自家评测,独立验证还很少。 |
独立评测者 Lindfors 还发现一个反直觉现象:措辞越小心,校准反而变差(ECE 从 0.040 变到 0.116)。问题描述里加「passing mention / quotation」这类限定词,会让模型的概率系统没那么直白。写问题也是一门手艺。
9. 总结:Jevons 悖论与自动化大爆发
Jev 值不值得关注?我认为值得,但要用正确姿势:
Almeida 赌的是杰文斯悖论的 AI 版:当一次智能判断便宜到 0.04 美分、快到几十毫秒,代码里会生长出成千上万个微小的「智能突触」,一张超越人类想象的自动化网络就此形成。
这个赌注对不对,一年后见分晓。但对开发者来说,至少现在又多了一个快、便宜、且会老实告诉你「我没把握」 的新选择。
参考资料
- TypeSafe AI 官方博客:《Introducing System One Models & Jev》 — https://typesafe.ai/blog/introducing-system-one-models-and-jev
- AI Wiki:Jev (AI model) — https://aiwiki.ai/wiki/jev
- Emil Lindfors 独立评测:《An early-access test of TypeSafe’s Jev: calibrated judgments for half a cent》 — https://lindfors.no/pdf/a-first-look-at-typesafes-jev.pdf
- 量子位:《输出 token 永久免费!Jev 爆火后,开源版也跟着火了》 — http://m.toutiao.com/group/7687524383673303579/
- 36氪/新智元:《Jev 爆火硅谷,哑巴 AI 卷疯 14 万开发者》 — https://36kr.com/p/3991213552368393
- 36氪:《刷屏了,前 OpenAI 研究员做的 Jev,大家为啥抢着用?》 — https://36kr.com/p/3991165197188099
- 腾讯新闻:《ChatGPT 早期研究者做了一个「不会说话」的 AI,Jev 真是新范式吗?》 — http://news.qq.com/rain/a/20260918A058BW00
- MIT 科技评论:《AI 不一定要「聊天」,前 OpenAI 研究员研发只做决策的模型》 — https://mittrchina.com/news/detail/16964
- 科学网:《「System one」模型引爆 AI 圈:不生成文本,专为机器做快速决策》 — https://news.sciencenet.cn/htmlnews/2026/9/571794.shtm
- OSCHINA:《前 OpenAI 研究员发布 Jev 模型》 — https://www.oschina.net/news/502609/typesafe-ai-system-one-models-and-jev
- DEV Community:《How to Use Jev: A practical guide》 — https://dev.to/valyuai/how-to-use-jev-a-practical-guide-to-typesafes-system-one-model-g5e
- NoloWiz:《Jev vs LLMs: A Practical Introduction》 — https://nolowiz.com/jev-vs-llms-a-practical-introduction-to-typesafe-ais-system-one-model/
- Cloudflare AI Docs:Jev (typesafe) — https://developers.cloudflare.com/ai/models/typesafe/jev/
- LessWrong:《A non-generative model as a trusted monitor for AI Control》 — https://www.lesswrong.com/posts/d7pQicW8EhpPBDRqz/a-non-generative-model-as-a-trusted-monitor-for-ai-control
免责声明:文中性能、成本、准确率等数据除特别标注外均来自 TypeSafe 官方或第三方早期访问评测,截至 2026 年 9 月 20 日尚未有大规模独立复现;模型尚处早期访问阶段,数字可能随时变化。



