欢迎光临
我们一直在努力

五年过去,Transformer 的「改进」依然大多不可复现:腾讯这篇审计论文,给整个社区泼了盆冷水

有人把 2021 年那篇著名的「Transformer 改进大多没用」的审计论文,在 2026 年用 1B 到 3B 的模型重做了一遍。换了更大的尺度、换了更靠谱的指标、加了更严的统计门槛之后——结果惊人地一致:20 个这几年被反复提及的 Transformer 改进里,最后能站得住脚的,只有 2 个。

而且这 2 个里面,还有 1 个在 3B 上直接训崩了。

如果你做过模型架构的对照实验,或者读到过某篇 paper 信誓旦旦说"我加了个 X,loss 降了、效果涨了"然后兴冲冲想抄进自己的项目——这篇文章你值得读完。因为它讲的不是"哪个 trick 好用",而是一件更扎心的事:我们这个领域,到底有多容易把噪声当成进步。

一、故事得从 2021 年那盆冷水说起

2017 年《Attention Is All You Need》之后,整个社区像打了鸡血。每个月都有新论文告诉你:把 LayerNorm 挪个位置、把 Softmax 换个非线性、给残差连接加个门控……模型就能更强。

但真正活下来、被大规模采用的改进,少得可怜。

2021 年,Google Research 的 Sharan Narang、Colin Raffel 等十几号人受不了了,写了一篇叫《Do Transformer Modifications Transfer Across Implementations and Applications?》的论文(arXiv:2102.11972,EMNLP 2021)。他们干了件特别朴素的事:把当时 40 多个被吹过的改进,全部塞进同一套代码、同一套训练配方里,在 T5-Base(约 2.2 亿参数)上公平地跑一遍。

结论很难堪:绝大多数改进在受控设定下根本没有提升;少数有效的,要么是极其微小的改动,要么是在他们自己的代码库里开发出来、换个实现就失灵的。

这篇论文从此成了一面照妖镜。每当有人说"我这个架构改进很牛",老炮们就会问一句:它能 transfer 吗?

可问题是——那都是 2021 年的事了。五年过去,世界变了三件事:

  • 模型变大了。 当年的 2.2 亿参数,今天看就是个玩具。1B–3B 才是现在开源小模型和受控架构实验的主场。
  • 指标变了。 当年大家盯着预训练的 perplexity 看。但现在我们知道,loss 低不代表下游任务强——这两者之间的关系,远比想象中脆弱。
  • 改进的菜单变了。 这几年冒出来一大批新东西:Softpick、SSMax、Differential Attention、HyperConnections……2021 年那份清单里压根没有。

于是腾讯的这支团队(Yang Zhao、Jiahao Lu 等共同一作,Jie Zhou 等通讯,2026 年 5 月 20 日挂上 arXiv)决定:在新的前提下,把这场审计重做一遍。

他们自己说得很清楚——这篇论文的贡献不是某个新架构,而是一套"协议升级"(the protocol update)。

二、他们到底做了什么:三个维度的全面升级

一句话概括:他们站在 Narang et al. 的肩膀上,把那场审计在尺度、指标、统计三个维度上同时拉满。
在这里插入图片描述
我们一个一个拆。

升级一:尺度从 2.2 亿拉到 1.2B–3B。 这是约 10 倍的放大,直接打到今天主流小模型的真实区间。很多在小模型上"看起来没事"的改动,到了这个尺度才会暴露问题。

升级二:指标从 perplexity 换成下游 CLIMB-12。 他们用 NVIDIA 的 CLIMB 协议放出的 CLIMB-Mix-400B 语料做预训练,主指标是 12 个真实下游任务的宏平均(记作 CLIMB-avg),覆盖 PIQA、ARC、HellaSwag、WinoGrande、MMLU、LAMBADA、TruthfulQA 等。评的是"会不会做题",而不是"loss 多低"。 后面你会看到,这个区别要命。

升级三:统计判据从"单种子点估计"换成"多种子噪声地板 + 多重检验校正"。 这是全文我最想让你抄走的部分,单独开一节讲。

为了保证公平,他们把能固定的全固定了:优化器、学习率调度、warmup、初始化、weight decay、数据 shuffle、tokenizer……20 个方法共享一模一样的配方。而且故意不给任何方法单独调参——因为一旦你为某个改动单独调了超参,你就重新引入了它本来要消除的混淆变量。所有 1.2B 模型都跑 44,000 步、每步 2²⁰ 个 token,约 23B token;AdamW,峰值学习率 3×10⁻⁴,cosine 衰减,bf16 + FP32 master weights。

他们甚至还在 A100 上用 bit-identical 的代码重训了一遍 1.2B 基线,CLIMB-avg 和主加速器对齐到小数点后第四位(0.4821 vs 0.4820),就为了排除"换块卡数值就不一样"这种混淆。

这种偏执,正是审计类论文的价值所在。

三、一场统计学的漏斗:20 进 2

来看主结果。这张图是整篇论文的灵魂:

在这里插入图片描述
在 1.2B 尺度上,20 个改进经过噪声地板筛选后:

  • 8 个落在基线的噪声范围内——也就是说,它们和基线在统计上根本无法区分。你以为的提升,其实是随机种子的抖动。
  • 6 个是名义上的退化者。
  • 6 个是名义上的改进者。

然后,关键的一步来了:Bonferroni 多重检验校正。

为什么要校正?因为你同时检验 19 个方法,就算它们全都和基线没差别,纯靠运气也会有几个"碰巧显著"。论文算了笔账:在 α=0.05 下,这种"家族错误率"高达约 62%。换句话说,不做校正,你有六成概率会捡到假阳性。

校正之后呢?6 个名义改进者里,只有 2 个活下来:

  • Softpick:CLIMB-avg = 0.4922,比基线高 0.009,z = +4.47,校正后 p ≈ 1.5×10⁻⁴。
  • HybridNorm:CLIMB-avg = 0.4896,高 0.007,z = +3.19,校正后 p ≈ 0.027。

⚠️ 这里有个容易传错的点:QK-Norm 没有通过校正。 它只是名义改进(z=+2.51),校正后 p=0.23,不显著。它在这篇论文里的角色,是被当成噪声地板的三个锚点配置之一(基线 / QK-Norm / Softpick),而不是"被验证有效的改进"。如果你看到别处说"这篇论文证明 QK-Norm 有效",那是误读。

四、噪声地板:到底多大的提升,才不是"运气"?

这是这篇论文方法论上最硬核、也最该被工程师内化的概念。

我们做实验时,习惯于跑一次、看个数、然后说"涨了 0.5 个点"。但你有没有问过自己:这 0.5 个点,换个随机种子还在不在?

腾讯团队的做法是:对基线、QK-Norm、Softpick 三个配置各跑 3 个独立随机种子,用种子之间的波动,量化出一个"噪声地板"——基线 CLIMB-avg 的标准差约 σ≈0.00208。于是 ±2σ 大约就是 ±0.0042 CLIMB。

任何小于这个幅度的"提升",都躺在噪声里,不配叫改进。

在这里插入图片描述

看这张图你就懂了。中间那条灰带就是噪声地板。

  • Softpick(z=+4.5)和 HybridNorm(z=+3.2)实打实地探出了灰带的上沿,而且扛住了多重检验——这才叫真改进。
  • QK-Norm(z=+2.5)刚冒头,但校正后就被打回去了。
  • 而 Sigmoid Attention 和 SSMax 呢?直接跌穿地板。尤其 Sigmoid Attention,Δ=−0.161,z≈−77.7,跌出了整张图的底部。

这套"噪声地板"思路,是这篇论文能比 2021 年原版更可信的根本原因。 它把"我觉得涨了"变成了"它在统计上显著地高于种子噪声"。

五、Loss 会骗人:验证损失几乎没变,下游却崩了

如果说上一节是方法论,这一节就是这篇论文最反直觉、最有杀伤力的发现。

我们来看两个失败者:Sigmoid Attention 和 SSMax。

如果你只看预训练的验证 loss,你会觉得它们"还行"——Sigmoid 的 loss 只比基线高了 2.4%,SSMax 只高了 3.0%。在一张 loss 排行榜上,它俩几乎就贴着基线。

但你把它们拉到真实的下游任务上一测:

在这里插入图片描述

Sigmoid Attention 的 CLIMB 准确率掉了整整 16 个百分点,SSMax 掉了 6 个百分点。

一个看起来"loss 只高了 2.4%"的改动,在真实任务上几乎是灾难。

这就是所谓的 loss–下游脱钩(decoupling)。论文进一步定位了原因:这种脱钩,在"注意力输出"类改动上被放大了好几倍。Sigmoid Attention 砍掉了 softmax 跨位置的归一化,直接在 LAMBADA 这种长程依赖任务上崩盘;SSMax 那个可学习的逐头温度,把长上下文里的 logits 放大到失控。

而相对地,残差侧的失败(比如 AttnRes,验证 loss 上升 13%)则是"loss 涨多少、下游掉多少"基本对得上——脱钩主要集中在注意力输出这条路径上。

这个发现的工程意义极其直接:如果你改的是注意力的输出(softmax 替换、注意力正则那一类),千万别只看 perplexity/loss 排名,它会把失败的改动伪装成"接近基线"。你必须上下游评测。

六、第二道过滤器:1.2B 能跑,不代表 3B 不炸

故事到这还没完。两个幸存者之一的 HybridNorm,在 1.2B 上是堂堂正正通过校正的改进者。但当作者把实验放大到 3B——

它在三个随机种子上,全部训练发散,loss 变成 NaN。

在这里插入图片描述

作者在 3B 上试了 13 个配置,10 个跑完、3 个炸了(HybridNorm、SSMax、HyperConnections)。而且这三个炸得都不冤,每一个都有可归因的理论脆弱性:

  • HybridNorm 含 Post-LN 成分,深层方差会累积增长。这事 Xiong et al. 在 2020 年就证明过:Post-LN 结构里靠近输出层的梯度很大,配上大学习率就不稳。28 层的 3B 栈越过了 24 层 1.2B 栈能扛住的阈值,在 2800–3500 步发散。
  • SSMax 的 softmax 替换导致 logit 爆炸,梯度范数从约 4000 步的 27,一路单调涨到 5600 步的 1578,5800 步 NaN。
  • HyperConnections 的多通道残差在 1.2B 上稳定,但在 3B 上从约 15000 步起梯度范数持续膨胀,18300 步 NaN。

注意图里那几个 X 标记:三个种子在同一个窗口集体失败。这说明它不是某次倒霉的随机噪声,而是机制性的不稳定。

更值得玩味的是:那 10 个在 3B 上跑完的方法,虽然都保住了 1.2B 上效应的正负号,但内部排名大洗牌(Spearman ρ=−0.27)。比如 QK-Norm+GeGLU 从 1.2B 的第 7 名飙到 3B 的第 1 名,Softpick 从第 1 跌到第 6。

这意味着:在某一个尺度上测出来的"相对排名",本身就不能跨尺度外推。 你在 1.2B 上挑出的"最佳改动",到 3B 可能既不是最好的,甚至可能直接训不动。

七、所以,这篇论文的独创性到底在哪?

读到这你应该明白了,它的价值不在于"发明了什么",而在于它把一套"如何不被自己骗"的科学方法,钉死成了可操作的协议。我把它的原创贡献提炼成三点:

1. 它把"噪声地板"引入了架构审计。 在它之前,大量架构论文是单种子、点估计的。它用多种子分布 + 多重检验校正,第一次给"这个改进到底显不显著"提供了一把统计标尺。结论是:20 个里有 8 个,所谓的提升其实在噪声里。

2. 它量化了 loss–下游脱钩,并定位到了"注意力输出"这条路径。 这不是泛泛地说"loss 不可靠",而是精确指出:脱钩在注意力输出类改动上被放大数倍,而残差侧改动的 loss 与下游基本同步。这是一个可以直接指导评测策略的发现。

3. 它把"跨尺度稳定性"立成了第二道独立的过滤器。 1.2B 显著 ≠ 3B 可用。HybridNorm 这个反例,单独就值回票价——它告诉你,统计显著性和工程可用性是两回事。

在这三点之上,它给 Narang et al. 的原始建议又追加了三条新协议(R5 多种子噪声地板、R6 对注意力输出类改动必做下游评测、R7 跨尺度稳定性检查)。

八、最实用的部分:做工程、做 ML,你能从这篇论文抄走什么?

这才是对我们这些天天写代码、调模型的人最有用的部分。我把它整理成一份架构改动验收清单,下次你想往项目里塞一个新 trick,或者评估别人论文的 claim 时,照着过一遍:

① 先问"它过得了噪声地板吗"。
别再单种子跑一次就下结论。至少为基线和候选方案各跑 3 个种子,算出基线的 σ。经验阈值:单尺度的提升如果小于约 2σ(这篇论文里约 0.005 CLIMB),基本可以判定为噪声。 这一步几乎零成本,却能帮你过滤掉一大半"假进步"。

② 涉及注意力输出的改动,永远别只看 loss。
softmax 替换、注意力正则、温度缩放这一类,loss 和下游会脱钩。必须上下游任务评测。 否则你会像看 Sigmoid Attention 一样,被一个"loss 只高 2.4%"的数字骗进一个掉 16 个点的坑。

③ 改动若动了归一化 / 残差结构,必须做跨尺度稳定性测试。
HybridNorm 这类含 Post-LN 成分的方案,在更深的栈上可能直接 NaN。上线前,至少在你的目标层数和峰值学习率下,跑过 cosine 峰值之后 3000+ 步,盯着梯度范数趋势看。危险信号很明确:梯度范数单调上升(像 SSMax 那样从 27 一路爬到 1578),就该拉警报了。

④ 评估外部论文的架构 claim 时,给证据分级。
如果一篇论文只给单种子、只报 perplexity、只在单一尺度验证——把它的证据等级直接下调。可以追问作者:在目标尺度上稳不稳定?增益是在哪个尺度测出来的?

⑤ 知道这套结论的边界在哪。
这非常重要。如果你的部署尺度远超 3B(比如几百 B 的 MoE),这篇论文的结论就不一定适用了。作者自己也明确说,HyperConnections(原报告在 671B MoE 上)、AttnRes(大 MoE)这类改动,在更大尺度上可能是有效的。“不可迁移"指的是"在固定的共享配方下、在 1–3B 区间、不能开箱即用地迁移”,不是"这些改动普遍无用"。 到了你自己的尺度,请以你自己尺度上的受控实验为准。

把这五条变成团队的肌肉记忆,你会少踩很多坑,也会对论文里那些漂亮数字多一份健康的怀疑。

写在最后

这篇论文最打动我的,不是它否定了多少改进,而是它示范了一种对待"进步"的态度。

我们这个领域太容易陷入一种叙事:每一个新 trick 都是突破,每一条下降的 loss 曲线都是胜利。但腾讯这支团队做的事,本质上是在反复确认一件事——在你宣布胜利之前,先问问自己:这是真的,还是噪声?换个种子还在吗?换个尺度还活着吗?在真实任务上呢?

五年前 Narang 他们泼的那盆冷水,今天看依然是凉的。但正是这种"扫兴"的、不浪漫的、偏执于受控变量的科学态度,才是一个领域真正成熟的标志。

做工程也好,做研究也好,愿我们都能多一点这样的偏执。

赞(0)
未经允许不得转载:171主机测评 » 五年过去,Transformer 的「改进」依然大多不可复现:腾讯这篇审计论文,给整个社区泼了盆冷水
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址