欢迎光临
我们一直在努力

腾讯 Hy4 开源:770B 旗舰,和一句“它参与了自己的训练“

8 月 28 日,腾讯混元发布并开源新一代旗舰 Hy4 preview:770B 总参数、49B 激活、1M 上下文、Apache 2.0 协议。官方推特只有一句话的姿态:“去用它,告诉我们哪里有问题。”

这场发布有两处反常。

第一,别家旗舰发布都附一整页 SWE-bench / Terminal-Bench 表格,Hy4 的官方新闻稿里没有公开基准跑分表——唯一的评测数据是一场腾讯内部的盲测。

第二,新闻稿里藏着一句很少有大厂敢写的话:Hy4 preview “参与了它自己的开发过程”——包括训练方法、数据策略和推理系统的优化。这不是措辞夸张,是明确的"递归自我改进"主张。

这篇文章把能查证的数据全部摆出来:内部盲测的 2.99 分、第三方榜单上的 65.7%,以及那句"自训练"声明到底该怎么读。


懒人版:30 秒看完结论

你想知道的一句话回答
规格是什么 770B 总参 / 49B 激活 MoE,1M 上下文,Apache 2.0 开源,170 个权重文件
跑分多少 官方没发公开跑分表;唯一第三方数据是 SWE-bench Pro 65.7%(总榜第 7、开源权重第 2)
赢了 GLM-5.3 和 Kimi K3 吗 腾讯内部盲测 2.99 vs 2.92(GLM-5.3)vs 2.94(Kimi K3)——⚠️ 内部评测,险胜 0.05~0.07 分
"参与自己的训练"是营销吗 半真半实验:官方自报"自主优化推理系统,吞吐 +31.8%",baseline 未披露,无第三方验证
多少钱 输入 ¥6 / 输出 ¥18 每百万 tokens(国际价 $0.834/$2.501),缓存命中 ¥0.3
便宜吗 比 GLM-5.3(≈¥10/¥31)便宜约 40%;比 GLM-5.3-Flash(≈¥1/¥3.6)贵 6 倍——旗舰价,不是性价比价
白嫖窗口 WorkBuddy / CodeBuddy 上免费两周;Hy3 免费延长到 9 月 30 日

一、163 位专家的盲测:赢是赢了,赢多少要看清

先看官方给的核心评测:腾讯组织了一场内部盲测,163 位专家评审、203 项真实工程任务,结果——

  • Hy4 preview:2.99 / 4.00
  • GLM-5.3:2.92
  • Kimi K3:2.94

Hy4 胜出。但两个细节必须放大:

第一,胜负差距是 0.05~0.07 分。 官方新闻稿自己的措辞是"略微领先"(slightly ahead)——4 分制下不到 0.1 分的差距,翻译成体感就是"互有胜负"。"开源第一梯队"成立,"碾压友商"不成立,这个距离读者应该知道。

第二,评审是腾讯自己的 163 位专家。 ⚠️ 这是厂商内部评测:任务集未公开,评审全部来自腾讯,GLM 和 Kimi 的调用配置(思考档位、工具环境)也未披露。按老规矩,这类数据只能当"方向性参考",不能当选型依据。对比一周前智谱发 GLM-5.3-Flash 时的做法——直接上 Terminal-Bench、DeepSWE、HLE 一整页公开基准——腾讯这次选择了完全不同的评测叙事:不比公开榜,比"真实生产力任务的专家体感"。

这个选择本身是个信号:公开基准在 2026 年的信任度已经低到连大厂发布都开始绕开它了。


二、唯一的第三方硬数据:SWE-bench Pro 65.7%,开源第 2

官方不发跑分,第三方榜单替它发了。BenchLM 的 SWE-bench Pro 榜单(2026 年 8 月 28 日数据验证,覆盖 65 个模型)上,Hy4 preview 的位置是:

排名模型厂商权重分数
1 Claude Mythos 5 Anthropic 闭源 80.3%
2 Claude Fable 5 Anthropic 闭源 80%
3 Claude Opus 5 Anthropic 闭源 79.2%
6 Qwen3.8 Max 阿里 开源权重 67.7%
7 Hy4 preview 腾讯 开源权重 65.7%
8 Ornith-1.5-397B Ornith 开源权重 65.1%
9 Grok 4.5 xAI 闭源 64.7%
10 GPT-5.6 Sol OpenAI 闭源 64.6%

三个读数:

  • 开源阵营第 2,仅次于 Qwen3.8 Max(差 2 个点),压过 Grok 4.5 和 GPT-5.6 Sol——"开源第一梯队"的说法成立。
  • 和闭源前沿有 14 个点的断层。Claude 三兄弟在 80% 一档,所有开源模型在 68% 以下。开源追赶闭源的故事在 coding 这个单项上还没发生。
  • ⚠️ 这个榜单本身要打折读:BenchLM 编辑注明各厂商分数的 setup(脚手架、工具预算、重试策略)不完全可比,差距小的时候只能看方向;OpenAI 7 月的审计还估计这个基准约 30% 的任务有问题。没有任何单一基准能决定选型,SWE-bench Pro 也不例外。
  • 另外注意:上代 Hy3 发布时公布的 SWE-Bench 分数是 74.4%,看着比 Hy4 的 65.7% 高——但那是不同口径的榜单(SWE-bench 系列有 Verified / Pro 多个难度不同的 split),不能横比。别被"越更新分数越低"的错觉骗了。


    三、整场发布最大胆的一句话:“它参与了自己的训练”

    新闻稿后半段有一段容易被快讯略过的内容,值得全文转述:

    Hy4 preview 参与了自身的开发过程——首次参与训练方法、数据策略、评测框架和底层算子的自动化优化。模型提出方案、运行实验、根据结果迭代,产出的代码、日志和反馈进入下一轮探索。这建立了一个早期阶段的递归自我改进循环。

    还有一条配套声明:Hy4 preview 自主分析了推理系统的瓶颈,对算子融合和通信优化做了多轮迭代,端到端吞吐相比 baseline 提升 31.8%。

    怎么读这两段?

    激进的部分:“递归自我改进”(recursive self-improvement)是 AI 安全讨论里最敏感的词之一。一家大厂在官方发布里明确使用它,且描述的是自家模型优化自家训练管线和推理栈——这在一年前的旗舰发布里还只存在于实验室 talk。哪怕只是"早期阶段",措辞上的跨越是真实的。

    要打折的部分:⚠️ +31.8% 是官方自报数据,baseline 是什么(vLLM 默认配置?自家上一版推理栈?)没有披露,无第三方复现。而且"模型提出方案、跑实验"的自动化程度有多高——是模型自主循环,还是工程师大量在环——新闻稿的表述留足了模糊空间。把它理解为"AI 辅助的基础设施优化,效率增益显著"是稳妥的;理解为"模型开始自我进化"就过度演绎了。

    但即便打折,这也是 2026 年开源发布里第一次有厂商把这个方向写进正式新闻稿。方向比数字重要。


    四、"为生产力而生"的定位,和一笔价格账

    Hy4 的定位词是"生产力"——不是 agent,不是推理,是生产力。具体拆开是四块:

    • 软件工程:长上下文开发任务的理解、规划、调试、验证,前端视觉质量
    • 办公:复杂工作环境理解、金融分析、跨文档协同,覆盖"信息处理 → 文档/表格/演示文稿产出"全流程
    • 游戏开发:一句自然语言生成可玩原型,与游戏引擎协作,多轮迭代复杂项目(腾讯的老本行)
    • 科研:AI 研发、分子动力学、凝聚态物理、基础数学

    这个定位和它的训练数据是绑定死的:官方明说训练数据由腾讯软件工程、游戏、金融、安全领域的专家"共创",并且和 CodeBuddy、WorkBuddy 两款内部产品深度共同设计。翻译一下:这不是先做模型再找场景,是拿着自家产品的真实工作流喂出来的模型。

    价格账本(每百万 tokens):

    模型输入输出备注
    Hy4 preview ¥6 ¥18 缓存命中 ¥0.3
    GLM-5.3 ≈¥10 ≈¥31 $1.40/$4.40
    GLM-5.3-Flash ≈¥1.1 ≈¥3.6 $0.15/$0.50,发布期五折更低
    上代 Hy3 ¥1 ¥4 快慢融合小旗舰

    三个读数:比同级开源旗舰 GLM-5.3 便宜约 40%,"实惠"在旗舰圈内成立;比 Flash 档模型贵 6 倍,别拿它当性价比模型用;比自家上代贵 6 倍,旗舰定位上移明显。

    想零成本试的话:WorkBuddy 和 CodeBuddy 上免费两周,Hy3 的免费期也延长到了 9 月 30 日。API 走腾讯云 TokenHub 或 OpenRouter。部署侧的细节:思考档位只有 high 和 no_think 两档——能彻底关思考,但没有中间档。


    五、大棋局:8 月开源大战,和"preview-first"的行业新常态

    把时间线拉远看这场发布:

    • 4 月 23 日:Hy3 preview(295B-A21B)匿名亮相
    • 7 月 6 日:Hy3 正式发布,¥1/¥4 定价主打性价比
    • 8 月 14 日:智谱 GLM-5.3 发布(开源编程旗舰)
    • 8 月 26 日:智谱 GLM-5.3-Flash 认领匿名模型 Ox Alpha
    • 8 月 28 日:Hy4 preview 发布,直接对标 GLM-5.3 / Kimi K3
    • 近期:官方预告 Hy4 系列下一批模型即将上线

    两个行业信号:

    "preview-first"成了 2026 年旗舰发布的标准动作。 智谱用匿名模型在 OpenRouter 公测 6 天才认领,腾讯直接把 “preview” 写进正式型号名、公开征求反馈。共同逻辑:公开基准信任崩塌后,厂商改为让真实用户在发布前就完成大规模摩擦测试——跑分可以被质疑,10 万开发者的体感很难集体造假。

    模型-产品共研成了大厂的差异化武器。 智谱绑定 Coding Plan 和 ZCode,腾讯绑定 CodeBuddy/WorkBuddy/元宝/ima。开源权重是获客入口,真正的护城河是"模型和自家生产力产品的协同迭代"。另外别忘了财报背景:腾讯此前明确说过训练混元是资本支出项——770B 的 Apache 2.0 全开源,等于把这笔资本支出的一部分直接赠送给全社会,换生态位。


    六、总结

    Hy4 preview 是一份"三明治"式的发布:

    • 可验证的:770B-A49B、1M 上下文、Apache 2.0、SWE-bench Pro 65.7% 开源第 2、比 GLM-5.3 便宜 40% 的旗舰定价、两周免费窗口。这些构成了它"开源第一梯队"的底座,成色扎实。
    • 要打折的:内部盲测险胜 GLM-5.3/Kimi K3 的 0.05 分——方向有参考价值,数字没有。
    • 要盯住的:"递归自我改进"和 +31.8% 自优化吞吐。这是全篇最值得持续追踪的声明——如果后续有第三方复现或技术报告披露细节,它就是大事;如果再无下文,就当一次措辞实验。

    对开发者的建议很直接:这两周免费,别刷帖子了,拿你手头最的真实工程任务去 WorkBuddy/CodeBuddy 跑一遍。preview 的意思就是——腾讯自己也想知道它到底几斤几两。

    数据来源:腾讯官方新闻稿(tencent.com,2026-08-28)、Hugging Face 模型卡 tencent/Hy4-preview(Apache 2.0,配置细节)、BenchLM SWE-bench Pro 榜单(2026-08-28 验证,含其编辑审计说明)、腾讯混元官方 X 账号、IT之家/央广网/新浪财经/财联社/中新经纬(2026-08-28 发布报道)、新京报(Hy3 定价,2026-07-06)、businessanalytics(Hy3 SWE-Bench 74.4%,口径未注明)。内部盲测与吞吐提升均为腾讯自报口径,未经独立验证。

    赞(0)
    未经允许不得转载:171主机测评 » 腾讯 Hy4 开源:770B 旗舰,和一句“它参与了自己的训练“
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址