欢迎光临
我们一直在努力

Jev 刷屏硅谷:前 OpenAI 研究员打造的「哑巴 AI」,凭什么让 14 万开发者排队?

一句话看懂:Jev 是 TypeSafe AI 发布的首个 System One 模型——它不生成文本,只接收一段「程序状态 + 类型化问题」,然后在几十到几百毫秒内并行返回带校准概率的结构化决策。输入每百万 Token 只要 $0.042,输出 Token 永久免费。

Jev 核心工作流程示意


目录

  • 背景:教 AI 说话的人,为什么让 AI 闭嘴
  • 核心设计:System One——只做判断,不写作文
  • 训练方法:RLCD,第三条强化学习路线
  • 性能与成本:20-200 倍快,40-400 倍便宜
  • Jev vs 其他模型:一次正面 PK
  • 典型应用案例
  • 实战:API 调用示例
  • 局限与争议:不要把「零幻觉」神话
  • 总结:Jevons 悖论与自动化大爆发
  • 参考资料

  • 1. 背景:教 AI 说话的人,为什么让 AI 闭嘴

    2026 年 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 结束两年隐身,正式发布新模型 Jev,同时宣布其创办的初创公司 TypeSafe AI 浮出水面,种子轮融资 4000 万美元,由 DCVC 领投。

    Almeida 的履历相当硬核:他是 2022 年 InstructGPT 论文(Ouyang et al.)的第四作者,是 RLHF 的共同发明人之一,深度参与了 OpenAI 早期 RLHF 与 GPT-4 相关工作——可以说,今天 ChatGPT 背后的核心方法有他一份。

    而他这次的选择极具戏剧性:亲手教了 AI 小半辈子「好好说话」,转头就做了个「哑巴」模型。

    Almeida 在 X(原推特)上写道:

    After co-inventing ChatGPT, I kept asking myself: why have superhuman chat models not led to AGI? 我花了两年时间秘密研究新的训练方法(RLCD)和一种新类型的前沿 AI 模型——今天正式发布:Jev。

    • 20-200x faster(快 20-200 倍)
    • 40-400x cheaper(便宜 40-400 倍,输出 Token 免费)

    这条推文引爆全网:播放量 3700 万+,发布不到 36 小时就有 14 万开发者涌入内测,Vercel、Cloudflare、LangChain 等主流平台迅速集成,连 Google Gemma 官方账号都发了「DiffusionGemma as Jev」跟风蹭热度。

    为什么叫 Jev?

    名字来自经济学中的 杰文斯悖论(Jevons Paradox):蒸汽机效率越高,烧掉的煤反而越多。Almeida 的野心很直白——当 AI 决策的成本趋近于零、速度快到离谱时,开发者对 AI 决策的需求不会减少,而会像大爆炸一样席卷所有代码。

    为什么叫 System One?

    来自诺贝尔奖得主丹尼尔·卡尼曼《思考,快与慢》:系统 1 是快速、直觉式的本能判断,系统 2 是缓慢、深度的逻辑推理。Almeida 认为现在的 LLM 都在沿着系统 2 走(慢速、长文本推理),而 Jev 反其道而行之,专攻系统 1——高速直觉式决策。


    2. 核心设计:System One——只做判断,不写作文

    Jev 的定位是官方博客里那句话:

    Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out. (把 Jev 想成一个前沿智能函数调用:非结构化状态进,类型化概率决策出。)

    2.1 三种原语(Primitives)

    Jev 不生成任何自然语言,输出只有三种固定形状,官方文档称为「原语(Primitives)」:

    原语回答的问题返回内容已知限制
    Choice(选择) 从这些选项里选哪个? 选项 + 每个选项的概率 + 置信度 最多 255 个选项,建议补一个 other 兜底
    Score(评分) 在这个有序刻度上打几分? 分数(概率加权均值)+ 各级概率 + 置信度 至少 2 级、最多 10 级
    Noul(判断) 这个陈述是否成立? 0-1 之间的「是」概率 无独立置信度,可选 criteria 说明是与否的含义

    有趣的小知识:Noul 这个词是「binary (boulean)」倒过来拼的,官方自己也在 FAQ 里承认。

    每个答案都附带所有选项的概率分布 + 整体置信度。多个问题可以在一次请求里并行问同一个 state,官方表示「加问题几乎不增加响应时间」,因为问题是相互隔离的,不会出现长上下文导致的「context-rot(上下文腐烂)」。

    2.2 为什么「零类型错误」是数学上保证的

    因为 Jev 根本不解码文本 token,它只会给预先定义好的选项分配概率——你给它 A、B、C 三个选项,它物理上不可能输出一个 D。所以永远不会出现坏的 JSON、未转义的引号、非法的 key。

    LLM 逐字生成 vs Jev 并行决策

    2.3 采样方式:并行 vs 逐 token

    维度传统 LLMSystem One + Jev
    采样方式 顺序生成,一个 token 依赖上一个 token 并行采样,所有输出一次查询全部给出
    端到端延迟 3 – 329 秒(前沿模型) 70 – 500 毫秒(官方数据)
    输出 字符串,需要解析 + 校验 + 重试 类型安全的结构化值,拿来即用
    幻觉风险 可能跑偏、编造、拒答 选项之外编不出来(但可能选错,见第 8 节)

    3. 训练方法:RLCD,第三条强化学习路线

    Jev 的核心创新是新的训练方法:RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。TypeSafe 把它定位为继 RLHF、RLVR 之后的第三条强化学习路径。

    #mermaid-svg-LWyDGEz2Ck3dlGgw{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-LWyDGEz2Ck3dlGgw .error-icon{fill:#552222;}#mermaid-svg-LWyDGEz2Ck3dlGgw .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-LWyDGEz2Ck3dlGgw .marker{fill:#333333;stroke:#333333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .marker.cross{stroke:#333333;}#mermaid-svg-LWyDGEz2Ck3dlGgw svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-LWyDGEz2Ck3dlGgw p{margin:0;}#mermaid-svg-LWyDGEz2Ck3dlGgw .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster-label text{fill:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster-label span{color:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster-label span p{background-color:transparent;}#mermaid-svg-LWyDGEz2Ck3dlGgw .label text,#mermaid-svg-LWyDGEz2Ck3dlGgw span{fill:#333;color:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .node rect,#mermaid-svg-LWyDGEz2Ck3dlGgw .node circle,#mermaid-svg-LWyDGEz2Ck3dlGgw .node ellipse,#mermaid-svg-LWyDGEz2Ck3dlGgw .node polygon,#mermaid-svg-LWyDGEz2Ck3dlGgw .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .rough-node .label text,#mermaid-svg-LWyDGEz2Ck3dlGgw .node .label text,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape .label,#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape .label{text-anchor:middle;}#mermaid-svg-LWyDGEz2Ck3dlGgw .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .rough-node .label,#mermaid-svg-LWyDGEz2Ck3dlGgw .node .label,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape .label,#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape .label{text-align:center;}#mermaid-svg-LWyDGEz2Ck3dlGgw .node.clickable{cursor:pointer;}#mermaid-svg-LWyDGEz2Ck3dlGgw .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .arrowheadPath{fill:#333333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-LWyDGEz2Ck3dlGgw .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-LWyDGEz2Ck3dlGgw .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-LWyDGEz2Ck3dlGgw .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster text{fill:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw .cluster span{color:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-LWyDGEz2Ck3dlGgw .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-LWyDGEz2Ck3dlGgw rect.text{fill:none;stroke-width:0;}#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape p,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-LWyDGEz2Ck3dlGgw .icon-shape .label rect,#mermaid-svg-LWyDGEz2Ck3dlGgw .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-LWyDGEz2Ck3dlGgw .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-LWyDGEz2Ck3dlGgw .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-LWyDGEz2Ck3dlGgw :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

    基础语言模型Pre-Trained Models

    post-training

    延伸

    另一条路

    第三条路

    GPT / BERTsLow Intelligence

    GPT-3 / LLaMaHigh Intelligence

    RLHFChat Models聊天模型

    RLVRReasoning Models推理模型 (o1/o3)

    InstructGPT / Grok / DeepSeek

    RLCDSystem One Models校准决策模型 (Jev)

    三条路线对比

    训练方法全称奖励什么产物
    RLHF 人类反馈强化学习 「人类看了很爽」的回复 ChatGPT、Claude 等聊天模型
    RLVR 可验证奖励强化学习 能被程序验证的结果(数学、代码) o1、o3 等推理模型
    RLCD 校准决策强化学习 「你给的概率要和实际命中率咬合」 Jev 等 System One 模型

    校准(Calibration)是什么意思?

    用 TypeSafe 原话:模型说 0.9,就必须有大约 90% 的时候是正确的。

    • 被模型标为 0.2 概率的结果,真实发生的比例应约等于 20%
    • 被模型标为 0.8 概率的结果,真实发生的比例应约等于 80%

    这就是「诚实的概率(epistemically honest probabilities)」。没有校准的置信度数字没有参考价值——而 RLHF 恰恰会奖励过度自信和听起来自信的幻觉。

    注意:截至 2026 年 9 月,TypeSafe 没有发表 RLCD 的技术论文(arXiv 上搜不到),方法细节不可外部验证。目前关于 RLCD 的描述全部来自官方博客、文档和 AI primer。这一条在圈内有不少讨论,详见第 8 节。


    4. 性能与成本:20-200 倍快,40-400 倍便宜

    4.1 官方核心数据

    指标数值说明
    端到端延迟 70 – 500 ms 官网演示 0.114s 完成 27 个问题
    输入价格 $0.042 / 百万 token($42/十亿 token) 对比 Claude Fable 5.1 的 $10/百万,低约 238 倍
    输出价格 免费(too cheap to meter) 没有逐字生成过程,就没有可计费的输出
    对比 LLM 速度 快 40-200 倍 官方声称,同智能水平
    对比 LLM 价格 便宜 40-400 倍 Almeida 推文口径
    工作流评测 快 193.6 倍、便宜 444.6 倍 官方 homepage,基于 4 个工作流评测
    上下文窗口 ~32K token(约 15 万英文字符) 所有问题共享请求预算

    4.2 官网「当面打脸」演示

    TypeSafe 官网放了一个并排对比 demo:同样 27 个问题、同样的输入,同时发起请求:

    TypeSafe JevGPT-5.6 Terra(默认 reasoning)
    耗时 0.114 秒 8.566 秒
    成本 $0.000081 $0.013880
    输出方式 27 个答案一次性全部给出 逐 token 生成,等待首个 token

    官网自己也承认这个 demo 做了有利于自己的选择:输入是短而紧凑的段落,27 个问题也被简化过。但「并行输出全部答案」与「逐 token 等待」的差距是实打实存在的。

    4.3 独立第三方评测:半美分跑完 24 份挪威语意见信

    开发者 Emil Lindfors(9 月 18 日)用自己的早期访问密钥做了独立测试:把 24 份挪威语公共听证意见书(鲑鱼资源税,语言杂乱、含 PDF 提取的归档码)发给 Jev 1.13,与 DeepSeek V4.1 Flash(OpenRouter,reasoning 开/关)对比:

    指标Jev 1.13DeepSeek(无推理)DeepSeek(有推理)
    立场判断(4 选) 20/24 20/24 22/24
    回应者类型(6 选) 21/23 22/23 23/23
    论据识别(192 个是非) 0.86 0.89 0.88
    内容深度评级(精确等级) 19/24 14/24 14/24
    成本(每 1000 份文档) $0.22 $1.31 $3.08
    中位延迟 0.32 s 2.7 s 26 s
    最慢请求 1.3 s 17.9 s 250 s

    关键结论(注意:参考标签由 Claude Fable 5.1 标注,只测一致性不测绝对正确性):

  • 语言能力 OK:Jev 读得懂杂乱的挪威语,12 页市政会议纪要里的诉求也能找到。
  • Score 原语是真优势:有序评级任务上 19/24 碾压 DeepSeek 的 14/24——这正是 Score 原语被设计来干的事。
  • 成本和速度碾压:Jev 读完 24 份文档只花了半美分;DeepSeek 开推理时写了 47000 个 thinking token,最慢一次花了 4 分钟思考一封 1800 字符的信。
  • 4.4 校准能力对比(这是最值钱的部分)

    RLCD 要买的就是「概率可信」。Lindfors 用 192 个是非论据判断做了个粗略校准检查:

    Jev 给的概率判断数量参考标签说「是」的比例
    0.0 – 0.1 14 0%
    0.1 – 0.3 56 4%
    0.3 – 0.7 41 34%
    0.7 – 0.9 38 97%
    0.9 – 1.0 43 98%

    方向完全正确,只是两端略保守。而 DeepSeek 开推理时,声称 0.7-0.9 的答案里参考标签只有 48% 同意——这就是「会说话的自信」和「校准过的自信」的区别。

    在实战中的用法:Jev 说 0.9 以上时基本可以放心自动执行(Stance 15 个里对 14 个,Respondent 20/20),低于 0.9 的丢给人或更慢的推理模型复核。这就是官方推荐的 confidence-gated routing(置信度门控路由)。


    5. Jev vs 其他模型:一次正面 PK

    5.1 官方对比:LLM vs System One

    这是 TypeSafe 官方博客的框架(注意:官方口径,立场偏自家):

    维度现有 LLMSystem One + Jev
    优化目标 人类偏好(RLHF)/ 可验证奖励(RLVR) 校准决策(RLCD)
    输入侧重 顺序消息 结构化程序状态
    输出 字符串,需解析 + 校验 类型安全结构值,定义在请求前
    采样 顺序逐 token 并行,一次查询全出
    成本 输入 $0.20-$10/百万 token,输出约 5 倍 输入 $0.042/百万,输出免费
    速度 端到端 3-329 秒 70-500ms
    置信度 过度自信、前后不一致 每次输出都带校准概率
    适合场景 聊天、Copilot、编码 Agent、可验证问题、Demo 智能 if 语句、Map-Reduce、实时应用、LLM 输出审核

    5.2 与当下主流模型对比总表

    对比项Jev 1.13GPT-5.6 TerraClaude Opus 5 / Sonnet 5DeepSeek V4 Flash
    类型 System One 决策模型 通用 LLM 通用 LLM 通用 LLM
    输出 结构化决策+概率 文本(可要求 JSON) 文本(可要求 JSON) 文本(可要求 JSON)
    端到端延迟 70-500ms 数秒-数十秒 数秒-数十秒 2.7s(无推理)/ 26s(推理)
    输入价格/百万 token $0.042 ~$2 ~$10(Fable 5.1) ~$0.2-0.6(Flash 级)
    输出价格/百万 token $0(免费) ~$12 ~$50 按 token 计费
    置信度 校准,随输出返回 无原生校准 无原生校准 无原生校准
    是否可能输出非法结构 不可能(数学保证) 可能,需解析校验 可能,需解析校验 可能,需解析校验
    能否写文章/聊天 不能
    上下文 32K token 大(百万级) 大(百万级)
    图像输入 不支持 支持 支持 支持

    核心判断:Jev 不是来替代 LLM 的,它是给软件当「判断单元」的。官方原话:Jev 和现有大模型的关系是「双核搭档」——LLM 在前面吭哧吭哧生成内容,Jev 在旁边花几十毫秒给产物打分、把关、路由。

    独立评测里 Jev 的 stance(立场判断)与 DeepSeek 打平(20/24),但成本和延迟低一个数量级以上;有序评级(Score)则明显领先。而在需要自由生成、长文本推理、图像理解的场景,Jev 完全不在讨论范围内。


    6. 典型应用案例

    6.1 客服工单自动路由(最典型的入门场景)

    把一封「炸毛的客诉邮件」丢给 Jev,一次请求并行问:

    • 该转哪个部门?(Choice:billing / technical / sales / other)
    • 用户是不是在要退款?(Noul)
    • 情绪激烈程度?(Score:1-5)
    • 需要人工介入吗?(Noul)

    软件拿到结果直接执行:if 退款概率 > 0.9 and 情绪评分 > 4 → 转人工加急。全程不需要任何人去读那封邮件。

    6.2 安全事件响应(官方演示过的完整流程)

    量子位报道中展示了 TypeSafe 官方演示的安全告警自动处理流水线:

    #mermaid-svg-mU7scdbS6oo62oxm{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-mU7scdbS6oo62oxm .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-mU7scdbS6oo62oxm .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-mU7scdbS6oo62oxm .error-icon{fill:#552222;}#mermaid-svg-mU7scdbS6oo62oxm .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-mU7scdbS6oo62oxm .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-mU7scdbS6oo62oxm .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-mU7scdbS6oo62oxm .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-mU7scdbS6oo62oxm .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-mU7scdbS6oo62oxm .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-mU7scdbS6oo62oxm .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-mU7scdbS6oo62oxm .marker{fill:#333333;stroke:#333333;}#mermaid-svg-mU7scdbS6oo62oxm .marker.cross{stroke:#333333;}#mermaid-svg-mU7scdbS6oo62oxm svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-mU7scdbS6oo62oxm p{margin:0;}#mermaid-svg-mU7scdbS6oo62oxm .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-mU7scdbS6oo62oxm .cluster-label text{fill:#333;}#mermaid-svg-mU7scdbS6oo62oxm .cluster-label span{color:#333;}#mermaid-svg-mU7scdbS6oo62oxm .cluster-label span p{background-color:transparent;}#mermaid-svg-mU7scdbS6oo62oxm .label text,#mermaid-svg-mU7scdbS6oo62oxm span{fill:#333;color:#333;}#mermaid-svg-mU7scdbS6oo62oxm .node rect,#mermaid-svg-mU7scdbS6oo62oxm .node circle,#mermaid-svg-mU7scdbS6oo62oxm .node ellipse,#mermaid-svg-mU7scdbS6oo62oxm .node polygon,#mermaid-svg-mU7scdbS6oo62oxm .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-mU7scdbS6oo62oxm .rough-node .label text,#mermaid-svg-mU7scdbS6oo62oxm .node .label text,#mermaid-svg-mU7scdbS6oo62oxm .image-shape .label,#mermaid-svg-mU7scdbS6oo62oxm .icon-shape .label{text-anchor:middle;}#mermaid-svg-mU7scdbS6oo62oxm .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-mU7scdbS6oo62oxm .rough-node .label,#mermaid-svg-mU7scdbS6oo62oxm .node .label,#mermaid-svg-mU7scdbS6oo62oxm .image-shape .label,#mermaid-svg-mU7scdbS6oo62oxm .icon-shape .label{text-align:center;}#mermaid-svg-mU7scdbS6oo62oxm .node.clickable{cursor:pointer;}#mermaid-svg-mU7scdbS6oo62oxm .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-mU7scdbS6oo62oxm .arrowheadPath{fill:#333333;}#mermaid-svg-mU7scdbS6oo62oxm .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-mU7scdbS6oo62oxm .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-mU7scdbS6oo62oxm .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-mU7scdbS6oo62oxm .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-mU7scdbS6oo62oxm .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-mU7scdbS6oo62oxm .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-mU7scdbS6oo62oxm .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-mU7scdbS6oo62oxm .cluster text{fill:#333;}#mermaid-svg-mU7scdbS6oo62oxm .cluster span{color:#333;}#mermaid-svg-mU7scdbS6oo62oxm div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-mU7scdbS6oo62oxm .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-mU7scdbS6oo62oxm rect.text{fill:none;stroke-width:0;}#mermaid-svg-mU7scdbS6oo62oxm .icon-shape,#mermaid-svg-mU7scdbS6oo62oxm .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-mU7scdbS6oo62oxm .icon-shape p,#mermaid-svg-mU7scdbS6oo62oxm .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-mU7scdbS6oo62oxm .icon-shape .label rect,#mermaid-svg-mU7scdbS6oo62oxm .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-mU7scdbS6oo62oxm .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-mU7scdbS6oo62oxm .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-mU7scdbS6oo62oxm :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

    1 Triage 分诊3 个读数:是否未授权?是否有记录解释?证据多强?

    2 Disposition 处置代码把读数转成close / quiesce / act

    3 Containment 遏制对事件状态跑 11 个读数:凭证、会话、邮件、持久化、进程、流量、横向移动

    4 Playbook 行动手册按严重级别分组执行动作:严重→隔离资产+撤销凭证高→轻遏制+杀进程中→监控+限权低→静默+记录

    不符合任何分组→ 紧急升级人工

    每个步骤都是 Jev 输出概率 → 代码根据阈值决策,无人值守。

    6.3 实时游戏决策:AI 打《毁灭战士》

    TypeSafe 放出的演示:让 Jev 实时玩《毁灭战士》,每秒做 10 次决策,一小时算力成本仅约 7 美元。还有维基百科超链寻路——从几千个链接里每次挑选最可能通向目标页的链接(Choice 上限 255 个选项正好用上)。

    6.4 代码审查(PR 评审)

    36氪报道的开发者用例:用 Jev 审 PR,一次 7 万分之一美元,审 1000 个 PR 才花 7 美分;同样的活交给 Claude Opus 5 要烧掉约 14.5 美元。

    6.5 LLM 输出验证 / Guardrail(官方主推场景)

    Jev 的「双核搭档」玩法:LLM 生成内容 → Jev 打分(是否合规、是否越狱、是否幻觉、是否应放行)→ 分数高放行,分数低打回重写。TypeSafe 官方 SEC 文件 cookbook 报告:置信度 ≥0.9 时 30 个里对 27 个。

    6.6 Map-Reduce 大数据处理

    官方推荐的场景之一:对 PB 级数据逐条跑结构化问题,把每条记录变成特征/标签/判断,再做聚合。单条 70-500ms、单次半美分级成本,让这种「把智能铺满每一行数据」成为可能。


    7. 实战:API 调用示例

    说明:Jev 目前是 early access(早期访问),需在 typesafe.ai 官网登记 waitlist。以下示例根据官方文档、Cloudflare 集成文档和社区教程整理,接口字段以官方最新 SDK 为准。

    7.1 安装与初始化

    # Python SDK
    pip install typesafe-sdk

    # 或 npm
    npm install typesafe-sdk

    from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

    # 自动读取环境变量 TYPESAFE_API_KEY
    client = TypeSafeClient(model="jev-latest")

    7.2 一个请求问三种问题(Noul + Choice + Score 混合)

    以客服工单为例——一次调用,并行返回多个决策:

    from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

    ticket = (
    "I was charged twice for order A-104. I've asked three times now. "
    "Please refund the duplicate charge or I'm switching to a competitor."
    )

    with TypeSafeClient() as client:
    result = client.system_one(
    state=ticket,
    questions={
    # Choice:该转哪个部门?
    "department": Choice(
    instructions="Which team should handle this support request?",
    criteria={
    "billing": "Charges, invoices, refunds, or subscriptions",
    "technical": "Product bugs, outages, or integrations",
    "account": "Login, password, profile, or security issues",
    "other": "Requests that do not fit the other departments",
    },
    ),
    # Noul:用户是不是在要求退款?
    "refund_requested": Noul(
    instructions="Is the customer asking for a refund or money back?"
    ),
    # Noul:是否情绪激烈/有流失风险?
    "churn_risk": Noul(
    instructions="Is the customer threatening to leave or escalate?"
    ),
    # Score:紧急程度 0-5
    "urgency": Score(
    instructions="Rate the urgency of this request.",
    legend={
    "0": "No time pressure",
    "3": "Needs attention today",
    "5": "Immediate action required",
    },
    ),
    },
    )

    print(result.choices["department"].choice) # billing
    print(result.nouls["refund_requested"].noul) # 0.98
    print(result.nouls["churn_risk"].noul) # 0.93
    print(result.scores["urgency"].score) # 3.8

    7.3 JavaScript / TypeScript

    import { TypeSafeClient } from "typesafe-sdk";

    const client = new TypeSafeClient({ model: "jev-latest" });

    const result = await client.system_one({
    state: "My running shoes arrived in the wrong size. Can I swap them for a size 10?",
    questions: {
    department: {
    type: "choice",
    instructions: "Which team should handle this?",
    criteria: {
    returns: "Exchanges, refunds, wrong or damaged items",
    shipping: "Delivery status, delays, lost packages",
    billing: "Charges, invoices, payment problems",
    },
    },
    refund: {
    type: "noul",
    instructions: "Is the customer asking for a refund?",
    },
    },
    });

    console.log(result.answers.refund); // { type: 'noul', noul: 0.98 }

    7.4 原生 HTTP 调用(不依赖 SDK)

    curl https://api.typesafe.ai/v1/systemone \\
    -H "Authorization: Bearer $TYPESAFE_API_KEY" \\
    -H "Content-Type: application/json" \\
    -d '{
    "model": "jev-latest",
    "state": "My card was charged twice for the same subscription. Please fix this.",
    "questions": {
    "refund": {
    "type": "noul",
    "instructions": "Is the customer asking for money back?"
    },
    "department": {
    "type": "choice",
    "instructions": "Which team should handle this support request?",
    "criteria": {
    "billing": "Charges, invoices, refunds, or subscriptions",
    "technical": "Product bugs, outages, or integrations",
    "other": "Anything else"
    }
    }
    }
    }'

    典型响应(社区实测截图整理):

    {
    "model": "jev-1.13.0",
    "answers": {
    "department": {
    "type": "choice",
    "choice": "billing",
    "confidence": 1.0,
    "probabilities": {
    "billing": 0.98,
    "technical": 0.01,
    "other": 0.01
    }
    },
    "refund": {
    "type": "noul",
    "noul": 0.99
    }
    },
    "usage": {
    "input_tokens": 292,
    "output_tokens": 25
    },
    "evaluation_time_ms": 123
    }

    7.5 置信度门控模式(官方推荐架构)

    这是 Jev 官方文档主推的用法——用置信度分三档路由:

    #mermaid-svg-uZBn1caycsoJcfGC{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-uZBn1caycsoJcfGC .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-uZBn1caycsoJcfGC .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-uZBn1caycsoJcfGC .error-icon{fill:#552222;}#mermaid-svg-uZBn1caycsoJcfGC .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-uZBn1caycsoJcfGC .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-uZBn1caycsoJcfGC .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-uZBn1caycsoJcfGC .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-uZBn1caycsoJcfGC .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-uZBn1caycsoJcfGC .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-uZBn1caycsoJcfGC .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-uZBn1caycsoJcfGC .marker{fill:#333333;stroke:#333333;}#mermaid-svg-uZBn1caycsoJcfGC .marker.cross{stroke:#333333;}#mermaid-svg-uZBn1caycsoJcfGC svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-uZBn1caycsoJcfGC p{margin:0;}#mermaid-svg-uZBn1caycsoJcfGC .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-uZBn1caycsoJcfGC .cluster-label text{fill:#333;}#mermaid-svg-uZBn1caycsoJcfGC .cluster-label span{color:#333;}#mermaid-svg-uZBn1caycsoJcfGC .cluster-label span p{background-color:transparent;}#mermaid-svg-uZBn1caycsoJcfGC .label text,#mermaid-svg-uZBn1caycsoJcfGC span{fill:#333;color:#333;}#mermaid-svg-uZBn1caycsoJcfGC .node rect,#mermaid-svg-uZBn1caycsoJcfGC .node circle,#mermaid-svg-uZBn1caycsoJcfGC .node ellipse,#mermaid-svg-uZBn1caycsoJcfGC .node polygon,#mermaid-svg-uZBn1caycsoJcfGC .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-uZBn1caycsoJcfGC .rough-node .label text,#mermaid-svg-uZBn1caycsoJcfGC .node .label text,#mermaid-svg-uZBn1caycsoJcfGC .image-shape .label,#mermaid-svg-uZBn1caycsoJcfGC .icon-shape .label{text-anchor:middle;}#mermaid-svg-uZBn1caycsoJcfGC .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-uZBn1caycsoJcfGC .rough-node .label,#mermaid-svg-uZBn1caycsoJcfGC .node .label,#mermaid-svg-uZBn1caycsoJcfGC .image-shape .label,#mermaid-svg-uZBn1caycsoJcfGC .icon-shape .label{text-align:center;}#mermaid-svg-uZBn1caycsoJcfGC .node.clickable{cursor:pointer;}#mermaid-svg-uZBn1caycsoJcfGC .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-uZBn1caycsoJcfGC .arrowheadPath{fill:#333333;}#mermaid-svg-uZBn1caycsoJcfGC .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-uZBn1caycsoJcfGC .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-uZBn1caycsoJcfGC .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-uZBn1caycsoJcfGC .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-uZBn1caycsoJcfGC .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-uZBn1caycsoJcfGC .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-uZBn1caycsoJcfGC .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-uZBn1caycsoJcfGC .cluster text{fill:#333;}#mermaid-svg-uZBn1caycsoJcfGC .cluster span{color:#333;}#mermaid-svg-uZBn1caycsoJcfGC div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-uZBn1caycsoJcfGC .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-uZBn1caycsoJcfGC rect.text{fill:none;stroke-width:0;}#mermaid-svg-uZBn1caycsoJcfGC .icon-shape,#mermaid-svg-uZBn1caycsoJcfGC .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-uZBn1caycsoJcfGC .icon-shape p,#mermaid-svg-uZBn1caycsoJcfGC .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-uZBn1caycsoJcfGC .icon-shape .label rect,#mermaid-svg-uZBn1caycsoJcfGC .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-uZBn1caycsoJcfGC .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-uZBn1caycsoJcfGC .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-uZBn1caycsoJcfGC :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

    高(> 0.9)

    中(0.7 – 0.9)

    低(< 0.7)

    Jev 输出决策 + 概率

    置信度?

    自动执行无人值守

    确认制通知用户确认后执行

    升级转人工 / 转慢速推理模型

    THRESHOLD_AUTO = 0.9
    THRESHOLD_CONFIRM = 0.7

    def route(action_decision, destructive=False):
    # 破坏性操作提高门槛
    auto_t = THRESHOLD_AUTO if not destructive else 0.97
    if action_decision.confidence >= auto_t:
    return "AUTO_EXECUTE"
    if action_decision.confidence >= THRESHOLD_CONFIRM:
    return "ASK_CONFIRM"
    return "ESCALATE_HUMAN"

    设计要点:

    • 破坏性操作(删库、退款、封号)比只读操作(分类、打标)设置更高的自动执行门槛
    • 除了官方返回的 confidence,你也可以自己从原始概率分布算(分布集中在单一选项 = 高置信)
    • 多个独立判断拆成多个 question 并行问,比让模型一次性写长分析可靠得多

    8. 局限与争议:不要把「零幻觉」神话

    Jev 火得越快,质疑声也越多。客观列一下目前已知的短板和争议:

    局限 / 争议具体说明
    「零幻觉」要打折 Jev 保证的是类型正确(不会输出选项外的东西),不是事实正确——正确答案是 A,它照样可能选成 B。官方自己也承认这一点。
    无技术论文 RLCD 只有博客描述,arXiv 无预印本,架构、参数量、训练算力全部未公开,外部无法验证「校准」声称。
    不支持图像输入 目前纯文本。Google 拿 DiffusionGemma 演示的正是「补上视觉」的方向。
    数学推理弱 需要一步步推导的数学任务,官方口径「顶多 GPT-4 水平」。
    上下文 32K 对超长文档(如整本书、超长日志)力不从心;且非英语场景 token 效率低(挪威语约 2.06 字符/token)。
    校准不是一次性的 校准是在「你的流量分布」上统计成立的。输入分布一变,必须重新在自己的业务流量上测量。
    置信度统计 ≠ 正确性保证 confidence 是概率分布形状算出的统计量,不代表「这个答案一定对」。
    定价可持续性存疑 官方自己承认「无法证明没补贴」,不过也预期价格只会降不会涨。
    发布评测口径 官方明确不发布公共 benchmark 成绩(理由是防「benchmaxxing」),现有数字多为自家评测,独立验证还很少。

    独立评测者 Lindfors 还发现一个反直觉现象:措辞越小心,校准反而变差(ECE 从 0.040 变到 0.116)。问题描述里加「passing mention / quotation」这类限定词,会让模型的概率系统没那么直白。写问题也是一门手艺。


    9. 总结:Jevons 悖论与自动化大爆发

    Jev 值不值得关注?我认为值得,但要用正确姿势:

  • 它不是「更强的 ChatGPT」,而是一种新的计算原语——「智能 if 语句」。判断 LLM 用「写得好不好」衡量,判断 Jev 要用「决策准不准、概率诚不诚实、延迟够不够低」衡量。
  • 真正的护城河是校准。所有 LLM 都能做分类,但 Jev 是唯一把「诚实概率」作为训练目标、且类型安全由架构保证的公开模型。这让置信度门控、无人值守自动化第一次有了可靠的依据。
  • 最大的变量是生态。14 万开发者涌入 + Vercel/Cloudflare/LangChain 集成 + 大厂跟风(DiffusionGemma),说明「决策模型」这个品类可能真的踩中了需求。
  • 风险同样明确:无论文、无独立基准、无视觉、定价可持续性未知。早期访问阶段,把它当「值得评估的新选项」而不是「已经验证的生产基座」。
  • Almeida 赌的是杰文斯悖论的 AI 版:当一次智能判断便宜到 0.04 美分、快到几十毫秒,代码里会生长出成千上万个微小的「智能突触」,一张超越人类想象的自动化网络就此形成。

    这个赌注对不对,一年后见分晓。但对开发者来说,至少现在又多了一个快、便宜、且会老实告诉你「我没把握」 的新选择。


    参考资料

    • TypeSafe AI 官方博客:《Introducing System One Models & Jev》 — https://typesafe.ai/blog/introducing-system-one-models-and-jev
    • AI Wiki:Jev (AI model) — https://aiwiki.ai/wiki/jev
    • Emil Lindfors 独立评测:《An early-access test of TypeSafe’s Jev: calibrated judgments for half a cent》 — https://lindfors.no/pdf/a-first-look-at-typesafes-jev.pdf
    • 量子位:《输出 token 永久免费!Jev 爆火后,开源版也跟着火了》 — http://m.toutiao.com/group/7687524383673303579/
    • 36氪/新智元:《Jev 爆火硅谷,哑巴 AI 卷疯 14 万开发者》 — https://36kr.com/p/3991213552368393
    • 36氪:《刷屏了,前 OpenAI 研究员做的 Jev,大家为啥抢着用?》 — https://36kr.com/p/3991165197188099
    • 腾讯新闻:《ChatGPT 早期研究者做了一个「不会说话」的 AI,Jev 真是新范式吗?》 — http://news.qq.com/rain/a/20260918A058BW00
    • MIT 科技评论:《AI 不一定要「聊天」,前 OpenAI 研究员研发只做决策的模型》 — https://mittrchina.com/news/detail/16964
    • 科学网:《「System one」模型引爆 AI 圈:不生成文本,专为机器做快速决策》 — https://news.sciencenet.cn/htmlnews/2026/9/571794.shtm
    • OSCHINA:《前 OpenAI 研究员发布 Jev 模型》 — https://www.oschina.net/news/502609/typesafe-ai-system-one-models-and-jev
    • DEV Community:《How to Use Jev: A practical guide》 — https://dev.to/valyuai/how-to-use-jev-a-practical-guide-to-typesafes-system-one-model-g5e
    • NoloWiz:《Jev vs LLMs: A Practical Introduction》 — https://nolowiz.com/jev-vs-llms-a-practical-introduction-to-typesafe-ais-system-one-model/
    • Cloudflare AI Docs:Jev (typesafe) — https://developers.cloudflare.com/ai/models/typesafe/jev/
    • LessWrong:《A non-generative model as a trusted monitor for AI Control》 — https://www.lesswrong.com/posts/d7pQicW8EhpPBDRqz/a-non-generative-model-as-a-trusted-monitor-for-ai-control

    免责声明:文中性能、成本、准确率等数据除特别标注外均来自 TypeSafe 官方或第三方早期访问评测,截至 2026 年 9 月 20 日尚未有大规模独立复现;模型尚处早期访问阶段,数字可能随时变化。

    赞(0)
    未经允许不得转载:171主机测评 » Jev 刷屏硅谷:前 OpenAI 研究员打造的「哑巴 AI」,凭什么让 14 万开发者排队?
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址