一、发生了什么
9 月 8 日,27 岁研究员 Jacob Coxon 在 X 上宣布从 Anthropic 辞职。他称自己过去三年先后在 OpenAI 和 Anthropic 做预训练研究,「两家公司都没有负起应有的责任」,正在全速冲向能自我改进的超级智能,「拿我们的生命当赌注」(来源:Axios)。这条帖子至今浏览量已超 1.7 亿次(来源:AI 安全中心 CAIS 简报 #81)。随后 Anthropic 对齐科学负责人 Evan Hubinger 公开附和:团队内部确实有人认真认为失控 AI 可能杀死全人类,他个人对未来十年的估计是「超过 10%」。9 月 12 日,Dario Amodei 发文呼吁全行业给前沿能力提升踩刹车,Altman 与马斯克先后表态赞同;黄仁勋和特朗普则公开唱反调(来源:中国新闻社、BusinessToday、CAIS)。
二、技术拆解:吵的其实是 RSI
把传播噪音剥掉,这场争论的技术内核只有一个词:递归自我改进(Recursive Self-Improvement,RSI)——把模型研发本身交给模型:用 AI 做架构搜索、生成训练数据、优化训练代码、编排实验,下一版模型由这一版造出来。一旦这条曲线启动,能力迭代的速度会脱离人类审查的节奏,对齐工作永远在追上一代的尾巴。
为什么是现在吵?背景是训练规模刚跨过一道坎:GPT-6 Astra 用超过 10 万块 GPU 完成训练(来源:央广网,9 月 16 日),前沿实验的成本与复杂度已经到了「只有 AI 能管理 AI 自己的训练」的量级。
Hubinger 的表态里有一句最容易被忽略的限定:当前已部署的商用模型风险仍然可控,他真正担心的是 RSI 之后——「AI 被用来造更聪明的 AI」这条路一旦走通,人类来不及对齐。
三方立场摆在一起看更清楚:
| 警告 | Coxon / Hubinger | RSI 是主要风险源,先约束自我改进速度 |
| 减速 | Amodei(9-12《We Must Pace the Frontier》) | 三步走:独立评估员常驻实验室 → 民主阵营共同安全标准 → 国际协调 |
| 继续冲 | OpenAI 首席科学家 Pachocki | RSI「是我们相信的唯一能留在前沿的方式」(来源:CAIS) |
Amodei 方案里还有个容易漏掉的细节:减速的前提是防「蒸馏」——他建议控制芯片出口、打击用美国模型做蒸馏的行为(来源:CAIS)。
三、我的判断
第一,传播把最重要的限定句淹没了。 Hubinger 明明说的是「当前商用模型可控、怕的是 RSI 之后」,到热搜里只剩「十年内灭人类」。技术人读原始表述,别读二传——这句限定才是判断风险层级的关键。
第二,「减速」嘴上容易,账本上难。 同一周的新闻:Anthropic 冲刺约 2 万亿美元估值 IPO(二季度营收 115 亿美元)、智谱完成约 50 亿美元融资、DeepSeek 被曝筹备科创板(来源:证券时报等媒体报道)。每家的资本结构都要求继续加速,Amodei 的三步计划没有回答「谁先停」——这是个博弈论问题,不是安全问题。
第三,警告可能是真的,传播链路同样是策划出来的。 Axios 挖出 Coxon 在 Anthropic 实际只工作了四个多月,那篇宣言是他和几位朋友在共享文档里反复打磨措辞、并安排了第一轮转发的;马斯克先说「达里奥是对的」,几天后又改口质疑原帖是一场「心理战」。这两件事同时成立:内部担忧是真的,传播是运营出来的。
四、对开发者的启示
上周《本周 AI 观察:五件事指向同一个转向,模型竞争下移到 Flash 层》里写过 GPT-6 Astra 发布 8 天就暂停 200 美元档新订阅,当时的判断偏产能,现在看安全叙事可能也是变量之一;而《开源大模型出海开始收费:许可证里的三条路线与真实影响》里讲的许可证分化,正是这次 Amodei 想打击的蒸馏路线的前传。
这个专栏每天一篇 AI 技术解读,关注不迷路。
你们公司的 AI 功能现在压在哪家的模型上?如果它明天宣布延迟发布,你的降级方案是什么?
专注 AI 工程化实践与出海外贸技术





