8 月 28 日,腾讯混元发布并开源新一代旗舰 Hy4 preview:770B 总参数、49B 激活、1M 上下文、Apache 2.0 协议。官方推特只有一句话的姿态:“去用它,告诉我们哪里有问题。”
这场发布有两处反常。
第一,别家旗舰发布都附一整页 SWE-bench / Terminal-Bench 表格,Hy4 的官方新闻稿里没有公开基准跑分表——唯一的评测数据是一场腾讯内部的盲测。
第二,新闻稿里藏着一句很少有大厂敢写的话:Hy4 preview “参与了它自己的开发过程”——包括训练方法、数据策略和推理系统的优化。这不是措辞夸张,是明确的"递归自我改进"主张。
这篇文章把能查证的数据全部摆出来:内部盲测的 2.99 分、第三方榜单上的 65.7%,以及那句"自训练"声明到底该怎么读。
懒人版:30 秒看完结论
| 规格是什么 | 770B 总参 / 49B 激活 MoE,1M 上下文,Apache 2.0 开源,170 个权重文件 |
| 跑分多少 | 官方没发公开跑分表;唯一第三方数据是 SWE-bench Pro 65.7%(总榜第 7、开源权重第 2) |
| 赢了 GLM-5.3 和 Kimi K3 吗 | 腾讯内部盲测 2.99 vs 2.92(GLM-5.3)vs 2.94(Kimi K3)——⚠️ 内部评测,险胜 0.05~0.07 分 |
| "参与自己的训练"是营销吗 | 半真半实验:官方自报"自主优化推理系统,吞吐 +31.8%",baseline 未披露,无第三方验证 |
| 多少钱 | 输入 ¥6 / 输出 ¥18 每百万 tokens(国际价 $0.834/$2.501),缓存命中 ¥0.3 |
| 便宜吗 | 比 GLM-5.3(≈¥10/¥31)便宜约 40%;比 GLM-5.3-Flash(≈¥1/¥3.6)贵 6 倍——旗舰价,不是性价比价 |
| 白嫖窗口 | WorkBuddy / CodeBuddy 上免费两周;Hy3 免费延长到 9 月 30 日 |
一、163 位专家的盲测:赢是赢了,赢多少要看清
先看官方给的核心评测:腾讯组织了一场内部盲测,163 位专家评审、203 项真实工程任务,结果——
- Hy4 preview:2.99 / 4.00
- GLM-5.3:2.92
- Kimi K3:2.94
Hy4 胜出。但两个细节必须放大:
第一,胜负差距是 0.05~0.07 分。 官方新闻稿自己的措辞是"略微领先"(slightly ahead)——4 分制下不到 0.1 分的差距,翻译成体感就是"互有胜负"。"开源第一梯队"成立,"碾压友商"不成立,这个距离读者应该知道。
第二,评审是腾讯自己的 163 位专家。 ⚠️ 这是厂商内部评测:任务集未公开,评审全部来自腾讯,GLM 和 Kimi 的调用配置(思考档位、工具环境)也未披露。按老规矩,这类数据只能当"方向性参考",不能当选型依据。对比一周前智谱发 GLM-5.3-Flash 时的做法——直接上 Terminal-Bench、DeepSWE、HLE 一整页公开基准——腾讯这次选择了完全不同的评测叙事:不比公开榜,比"真实生产力任务的专家体感"。
这个选择本身是个信号:公开基准在 2026 年的信任度已经低到连大厂发布都开始绕开它了。
二、唯一的第三方硬数据:SWE-bench Pro 65.7%,开源第 2
官方不发跑分,第三方榜单替它发了。BenchLM 的 SWE-bench Pro 榜单(2026 年 8 月 28 日数据验证,覆盖 65 个模型)上,Hy4 preview 的位置是:
| 1 | Claude Mythos 5 | Anthropic | 闭源 | 80.3% |
| 2 | Claude Fable 5 | Anthropic | 闭源 | 80% |
| 3 | Claude Opus 5 | Anthropic | 闭源 | 79.2% |
| 6 | Qwen3.8 Max | 阿里 | 开源权重 | 67.7% |
| 7 | Hy4 preview | 腾讯 | 开源权重 | 65.7% |
| 8 | Ornith-1.5-397B | Ornith | 开源权重 | 65.1% |
| 9 | Grok 4.5 | xAI | 闭源 | 64.7% |
| 10 | GPT-5.6 Sol | OpenAI | 闭源 | 64.6% |
三个读数:
另外注意:上代 Hy3 发布时公布的 SWE-Bench 分数是 74.4%,看着比 Hy4 的 65.7% 高——但那是不同口径的榜单(SWE-bench 系列有 Verified / Pro 多个难度不同的 split),不能横比。别被"越更新分数越低"的错觉骗了。
三、整场发布最大胆的一句话:“它参与了自己的训练”
新闻稿后半段有一段容易被快讯略过的内容,值得全文转述:
Hy4 preview 参与了自身的开发过程——首次参与训练方法、数据策略、评测框架和底层算子的自动化优化。模型提出方案、运行实验、根据结果迭代,产出的代码、日志和反馈进入下一轮探索。这建立了一个早期阶段的递归自我改进循环。
还有一条配套声明:Hy4 preview 自主分析了推理系统的瓶颈,对算子融合和通信优化做了多轮迭代,端到端吞吐相比 baseline 提升 31.8%。
怎么读这两段?
激进的部分:“递归自我改进”(recursive self-improvement)是 AI 安全讨论里最敏感的词之一。一家大厂在官方发布里明确使用它,且描述的是自家模型优化自家训练管线和推理栈——这在一年前的旗舰发布里还只存在于实验室 talk。哪怕只是"早期阶段",措辞上的跨越是真实的。
要打折的部分:⚠️ +31.8% 是官方自报数据,baseline 是什么(vLLM 默认配置?自家上一版推理栈?)没有披露,无第三方复现。而且"模型提出方案、跑实验"的自动化程度有多高——是模型自主循环,还是工程师大量在环——新闻稿的表述留足了模糊空间。把它理解为"AI 辅助的基础设施优化,效率增益显著"是稳妥的;理解为"模型开始自我进化"就过度演绎了。
但即便打折,这也是 2026 年开源发布里第一次有厂商把这个方向写进正式新闻稿。方向比数字重要。
四、"为生产力而生"的定位,和一笔价格账
Hy4 的定位词是"生产力"——不是 agent,不是推理,是生产力。具体拆开是四块:
- 软件工程:长上下文开发任务的理解、规划、调试、验证,前端视觉质量
- 办公:复杂工作环境理解、金融分析、跨文档协同,覆盖"信息处理 → 文档/表格/演示文稿产出"全流程
- 游戏开发:一句自然语言生成可玩原型,与游戏引擎协作,多轮迭代复杂项目(腾讯的老本行)
- 科研:AI 研发、分子动力学、凝聚态物理、基础数学
这个定位和它的训练数据是绑定死的:官方明说训练数据由腾讯软件工程、游戏、金融、安全领域的专家"共创",并且和 CodeBuddy、WorkBuddy 两款内部产品深度共同设计。翻译一下:这不是先做模型再找场景,是拿着自家产品的真实工作流喂出来的模型。
价格账本(每百万 tokens):
| Hy4 preview | ¥6 | ¥18 | 缓存命中 ¥0.3 |
| GLM-5.3 | ≈¥10 | ≈¥31 | $1.40/$4.40 |
| GLM-5.3-Flash | ≈¥1.1 | ≈¥3.6 | $0.15/$0.50,发布期五折更低 |
| 上代 Hy3 | ¥1 | ¥4 | 快慢融合小旗舰 |
三个读数:比同级开源旗舰 GLM-5.3 便宜约 40%,"实惠"在旗舰圈内成立;比 Flash 档模型贵 6 倍,别拿它当性价比模型用;比自家上代贵 6 倍,旗舰定位上移明显。
想零成本试的话:WorkBuddy 和 CodeBuddy 上免费两周,Hy3 的免费期也延长到了 9 月 30 日。API 走腾讯云 TokenHub 或 OpenRouter。部署侧的细节:思考档位只有 high 和 no_think 两档——能彻底关思考,但没有中间档。
五、大棋局:8 月开源大战,和"preview-first"的行业新常态
把时间线拉远看这场发布:
- 4 月 23 日:Hy3 preview(295B-A21B)匿名亮相
- 7 月 6 日:Hy3 正式发布,¥1/¥4 定价主打性价比
- 8 月 14 日:智谱 GLM-5.3 发布(开源编程旗舰)
- 8 月 26 日:智谱 GLM-5.3-Flash 认领匿名模型 Ox Alpha
- 8 月 28 日:Hy4 preview 发布,直接对标 GLM-5.3 / Kimi K3
- 近期:官方预告 Hy4 系列下一批模型即将上线
两个行业信号:
"preview-first"成了 2026 年旗舰发布的标准动作。 智谱用匿名模型在 OpenRouter 公测 6 天才认领,腾讯直接把 “preview” 写进正式型号名、公开征求反馈。共同逻辑:公开基准信任崩塌后,厂商改为让真实用户在发布前就完成大规模摩擦测试——跑分可以被质疑,10 万开发者的体感很难集体造假。
模型-产品共研成了大厂的差异化武器。 智谱绑定 Coding Plan 和 ZCode,腾讯绑定 CodeBuddy/WorkBuddy/元宝/ima。开源权重是获客入口,真正的护城河是"模型和自家生产力产品的协同迭代"。另外别忘了财报背景:腾讯此前明确说过训练混元是资本支出项——770B 的 Apache 2.0 全开源,等于把这笔资本支出的一部分直接赠送给全社会,换生态位。
六、总结
Hy4 preview 是一份"三明治"式的发布:
- 可验证的:770B-A49B、1M 上下文、Apache 2.0、SWE-bench Pro 65.7% 开源第 2、比 GLM-5.3 便宜 40% 的旗舰定价、两周免费窗口。这些构成了它"开源第一梯队"的底座,成色扎实。
- 要打折的:内部盲测险胜 GLM-5.3/Kimi K3 的 0.05 分——方向有参考价值,数字没有。
- 要盯住的:"递归自我改进"和 +31.8% 自优化吞吐。这是全篇最值得持续追踪的声明——如果后续有第三方复现或技术报告披露细节,它就是大事;如果再无下文,就当一次措辞实验。
对开发者的建议很直接:这两周免费,别刷帖子了,拿你手头最的真实工程任务去 WorkBuddy/CodeBuddy 跑一遍。preview 的意思就是——腾讯自己也想知道它到底几斤几两。
数据来源:腾讯官方新闻稿(tencent.com,2026-08-28)、Hugging Face 模型卡 tencent/Hy4-preview(Apache 2.0,配置细节)、BenchLM SWE-bench Pro 榜单(2026-08-28 验证,含其编辑审计说明)、腾讯混元官方 X 账号、IT之家/央广网/新浪财经/财联社/中新经纬(2026-08-28 发布报道)、新京报(Hy3 定价,2026-07-06)、businessanalytics(Hy3 SWE-Bench 74.4%,口径未注明)。内部盲测与吞吐提升均为腾讯自报口径,未经独立验证。






