当“大力出奇迹”撞上“数据墙”,架构创新成为通往AGI的必经之路
引言:Transformer的盛世与隐忧
2017年,“Attention Is All You Need”一纸论文开启了Transformer的统治时代。近十年间,从BERT到GPT,从ViT到Sora,几乎所有里程碑式的AI突破都建立在Transformer架构之上。它如此成功,以至于我们几乎忘记了:任何技术垄断都终将被打破。
2026年,Transformer的统治地位正面临前所未有的挑战。这并非因为它“不够好”,而是因为它的“阿喀琉斯之踵”在极致追求下愈发凸显:
| 二次方复杂度 | 自注意力计算量随序列长度平方增长 | 处理百万级长文本时算力成本爆炸 |
| 推理显存墙 | KV Cache随序列长度线性增加 | 长上下文推理对显存需求极高 |
| 数据枯竭 | Chinchilla缩放定律指向的高质量数据逼近极限 | 模型性能边际收益递减 |
| 静态权重 | 训练后参数固定,无法持续学习 | 缺乏适应新任务的能力 |
正如复旦大学智慧城市研究中心高级研究员钱学胜所指出的:“Transformer架构的‘革命性’阶段可能已近尾声,正转向以工程优化为主导的‘精益化’阶段”。业界真正的期待,是在2026年看到脱离于Transformer的全新架构萌芽,为我们带来通向AGI的全新可能。
本文将系统梳理下一代模型架构的前沿探索:
- ✅ 混合架构的进化:线性层+注意力的“黄金比例”
- ✅ 全新范式的涌现:从类脑脉冲到液态智能
- ✅ 终极愿景的探索:Google Titans如何让模型“永生难忘”
- ✅ 未来的路线图:Transformer之后,路在何方?
一、混合架构:在效率与性能之间寻找“黄金比例”
1.1 为什么需要混合?
纯线性模型(如纯SSM)在“联想回忆”等任务上仍弱于注意力机制。纯注意力模型又受困于二次方复杂度。自然的选择是:在大部分层使用高效的线性层,仅在关键位置保留少量注意力层。
这种“混合架构”已成为2026年大模型设计的共识性方向。它试图在效率与性能之间找到那个“黄金比例”。
1.2 Qwen3-Next:Gated DeltaNet的规模化实践
阿里巴巴的Qwen3-Next是混合架构的代表性实践。
技术核心:利用Gated Delta规则更新隐状态,这是一种比传统RNN更高效的线性更新机制,能够更好地捕捉上下文信息。
实现策略:在Qwen3-Next中,75%的模块已替换为Gated DeltaNet,仅保留少量注意力层即可维持性能。这是一种典型的3:1混合策略——三层线性层,一层全注意力。
收益:推理复杂度直接从O(N2)O(N^2)O(N2)降至O(N)O(N)O(N),极大地提升了模型在长文本生成时的吞吐量。
1.3 Kimi Linear与DeepSeek的探索
月之暗面的Kimi Linear同样采用了混合策略,通过高效的线性层与全注意力层的组合,在长上下文处理上实现了突破。
深度求索则在DeepSeek V3.2中引入了稀疏注意力机制,通过只计算最重要的Token之间的相互作用,进一步降低计算开销。同时,其**多头潜在注意力(MLA)**显著减少了推理时的KV Cache占用。
1.4 混合架构的关键指标
| Qwen3-Next | Gated DeltaNet + 滑动窗口注意力 | ~25% | 推理复杂度O(N)O(N)O(N) |
| Kimi Linear | 线性层 + 注意力层 | 未公开 | 长上下文效率提升 |
| DeepSeek V3.2 | 稀疏注意力 + MLA | 可变 | KV Cache大幅缩减 |
混合架构的核心理念是:在保证模型“记忆能力”的同时,追求极致的“推理速度”。
二、全新范式的涌现:三条激进的探索路径
如果说混合架构是Transformer的“改良派”,那么以下三条路线就是彻底的“革命派”。它们试图从根本原理上重构神经网络。
2.1 类脑脉冲神经网络:向生物大脑取经
代表工作:中科院自动化所 SpikingBrain-1.0(瞬悉1.0)
核心思想:借鉴大脑神经元内部的复杂工作机制,提出“基于内生复杂性”的模型构架方式。传统Transformer依赖“外生复杂性”——通过堆叠参数和数据来提升智能;而脉冲神经网络则通过模拟神经元脉冲放电的动态过程,从结构本身产生智能。
技术突破:
- 理论根基:建立了脉冲神经元内生动力学与线性注意力模型之间的联系,揭示了现有线性注意力机制是树突计算的特殊简化形式
- 效率革命:SpikingBrain-7B模型在100万Token长度下,首个Token生成时间(TTFT)相比Transformer加速26.5倍,400万Token长度下加速超过100倍
- 国产自主:适配沐曦MetaX国产GPU集群,首次在国产算力上构建类脑大模型训练推理框架
- 极致稀疏:7B模型上实现超过69.15%的稀疏度,长序脉冲占比仅约1.85%
应用场景:法律/医学文档分析、复杂多智能体模拟、高能粒子物理实验、DNA序列分析、分子动力学轨迹等超长序列任务。
最新进展:中科院自动化所曾毅团队进一步提出基于多房室脉冲神经元的类脑脉冲世界模型,通过多分支树突计算实现长时序记忆,在视觉控制任务中性能比肩经典GRU架构模型。
2.2 液态神经网络:连续时间的智能流
代表工作:MIT CSAIL孵化企业 Liquid AI 的Liquid Foundation Models(LFM)
核心思想:将神经网络从“离散时间”解放出来,采用基于**常微分方程(ODE)**的“液态”计算。模型参数可以连续适应输入数据的时序和结构,像液体一样流动。
技术突破:
- 线性复杂度:通过线性递归单元(LRU)和状态空间模型(SSM),实现与序列长度线性相关的计算量
- 记忆墙突破:LFM-3B模型处理32k上下文仅需16GB内存,而同等规模Llama需要48GB以上
- 性能对标:LFM 40.3B混合专家模型在专项推理基准上超越Llama 3.1-170B
- 模态无关:将数据视为连续流而非离散Token,天然适配机器人、医疗监控等实时场景
商业化进展:Shopify已集成LFM提供低于20ms的搜索推荐服务;仓库机器人基于LFM实时导航,本地运行在AMD Ryzen AI处理器上。
未来方向:LFM2系列将探索“无限上下文”——一次处理整个视频库或数年传感器数据的能力。
2.3 扩散语言模型:并行生成的“超级学习者”
代表工作:Google Gemini Diffusion(预期)、arXiv论文《Diffusion Language Models are Super Data Learners》
核心思想:与自回归模型的“逐字生成”不同,扩散模型采用并行生成——整段文本从模糊噪声中同时显现,经过数次“去噪”迭代后变得清晰。
核心优势:
- 推理速度:Google暗示其扩散模型“明显快于我们目前最快的模型”
- 数据效率:当高质量数据稀缺时,扩散模型是“更好的学习者”
关键发现:论文《Diffusion Language Models are Super Data Learners》揭示了一个重要现象——当进行多Epoch训练时,文本扩散模型的表现可能超越标准自回归模型。
实验数据:一个10亿参数的扩散模型,仅通过反复训练10亿Token(很小的数据量),在HellaSwag和MMLU基准上分别达到>56%和>33%的准确率。
致命缺陷:由于并行生成特性,扩散模型无法在响应链中整合工具调用,这使其作为智能体时面临巨大挑战。
2.4 三条激进路线的对比
| 核心原理 | 脉冲放电动态 | 常微分方程连续流 | 迭代去噪并行生成 |
| 复杂度 | 线性/常数 | 线性 | 二次方(但可并行) |
| 长序列优势 | 百万级Token加速100倍 | 无限上下文愿景 | 适合多Epoch训练 |
| 工具调用 | 可集成 | 可集成 | 先天缺陷 |
| 硬件适配 | 国产GPU | CPU/NPU友好 | 传统GPU |
| 成熟度 | 实验室突破 | 商业化初期 | 研发阶段 |
三、终极愿景:让模型“永生难忘”
3.1 Google Titans:当模型拥有“记忆”
2026年初,Google发布了名为 “Titans” 的架构研究,目标是解决大模型最根本的痛点——健忘。
核心设计:
- 短期记忆:Transformer和注意力机制负责处理当前上下文
- 长期记忆:深度神经网络(而非RNN)负责存储历史信息
- 惊喜度指标:专门关注包含意外词汇的文本片段,决定哪些信息值得记住
- 自适应遗忘:通过衰减机制,让模型忘记不再需要的信息
技术路线:Google还提供了MIRAS作为实现蓝图,包括记忆架构、注意力偏置、遗忘与更新机制三大模块。
优化目标:不再使用传统的均方误差或点积,而是优化非欧几里得度量,基于Huber损失、广义范数或概率映射提供三种示例模型。
3.2 持续学习:从“一次性训练”到“终身学习”
中金研报指出,持续学习和模型记忆是2026年大模型的重要突破方向。
核心问题:解决大模型的“灾难性遗忘”——当学习新任务时,旧知识被覆盖。
解决方案:让模型具备选择性记忆机制,根据任务的时间跨度和重要性动态调整学习和记忆的方式,从而实现持续学习甚至终身学习。
Google提出的Nested Learning等算法,正是在这一方向的探索。
3.3 原生统一多模态:商汤NEO-unify的激进实验
2026年3月,商汤科技联合南洋理工大学发布了NEO-unify,这是一套真正实现“原生、统一、端到端”的多模态模型架构。
最核心的突破:彻底砍掉了视觉编码器(VE)和变分自编码器(VAE),不再通过“组件拼凑”来实现感知与生成,回归第一性原理,直接以近乎无损的像素和文字作为原生输入。
技术实现:
- MoT架构:混合变换器(Mixture-of-Transformer),统一实现视觉与语言的深度融合
- 无编码器设计:越过视觉表征争论,摆脱预训练先验与规模定律瓶颈
- 高效利用:在保持高保真细节恢复的同时,显著提升数据与算力利用效率
实验数据:NEO-unify(2B)在MS COCO 2017上取得31.56 PSNR和0.85 SSIM,接近Flux VAE的32.65和0.91。
范式意义:NEO-unify标志着多模态AI正在从“模态连接”进化为“原生统一智能体”。
四、演进路线图:从2026到2030
4.1 技术路线的分层定位
综合以上探索,我们可以勾勒出下一代模型架构的演进图谱:
┌─────────────────────────────────────────────────────────────┐
│ 终极愿景 │
│ Titans / 持续学习 / 世界模型 │
│ 让AI真正“理解并记住” │
└─────────────────────────────────────────────────────────────┘
▲
│
┌─────────────────────────────────────────────────────────────┐
│ 全新范式探索 │
│ ┌─────────────────┐ ┌─────────────────┐ ┌─────────────┐ │
│ │ 类脑脉冲 │ │ 液态网络 │ │ 原生多模态 │ │
│ │ (SpikingBrain) │ │ (Liquid AI) │ │ (NEO-unify) │ │
│ └─────────────────┘ └─────────────────┘ └─────────────┘ │
│ 从根本原理上重构神经网络 │
└─────────────────────────────────────────────────────────────┘
▲
│
┌─────────────────────────────────────────────────────────────┐
│ 混合架构(当下主流) │
│ Qwen3-Next │ Kimi Linear │ DeepSeek V3.2 │ GLM-4.7 │
│ 75%线性+25%注意力 │ MLA+稀疏注意力 │ MoE+线性层 │
│ 在效率与性能间寻找“黄金比例” │
└─────────────────────────────────────────────────────────────┘
▲
│
┌─────────────────────────────────────────────────────────────┐
│ Transformer(统治基石) │
│ 2017-2026,统治近十年的架构 │
└─────────────────────────────────────────────────────────────┘
4.2 时间线预测
| 2026-2027 | 混合架构主流化 | 线性层+注意力成为新常态,效率大幅提升 |
| 2027-2028 | 全新范式规模化 | 类脑脉冲/液态网络突破关键性能瓶颈 |
| 2028-2030 | 终极愿景落地 | Titans类持续学习架构成为AGI基座 |
4.3 关键观测指标
- 推理效率:单位Token的推理成本能否持续下降
- 长序列能力:能否高效处理百万级甚至无限上下文
- 持续学习:模型能否在不遗忘旧知识的情况下学习新任务
- 物理理解:世界模型能否真正内化物理规律
五、本系列回顾
| 01 | AI的paradigm shift:为什么2026年是“世界模型”元年? | 世界模型概念、背景、意义 |
| 02 | 拆解世界模型:它是如何理解物理规律的? | 技术架构、代表产品、前沿突破 |
| 03 | 多智能体系统(MAS):决定AI应用上限的“TCP/IP” | MCP、A2A、ADK、三者协同 |
| 04 | 从Copilot到AI Scientist:AI如何重塑科研范式? | AI Scientist系统、效率革命、挑战与反思 |
| 05 | 具身智能的“出清”之年:人形机器人如何走出实验室? | 行业出清、技术突破、场景落地、资本格局 |
| 06 | 下一代模型架构:Transformer之后的路在何方? | 混合架构、类脑脉冲、液态网络、扩散模型、Titans |
结语:Transformer之后,是什么?
2026年,我们正站在一个关键的历史节点。Transformer的统治地位第一次面临系统性挑战——不是来自某个单一“杀手”,而是来自多条战线的“围攻”:
- 混合架构用更聪明的方式延续其生命
- 类脑脉冲从生物大脑中寻找新灵感
- 液态网络用连续时间重构计算
- 扩散模型在数据稀缺时代展现潜力
- Titans让模型拥有真正的记忆
正如Sebastian Raschka所言:“Transformer在未来仍将保持其在SOTA性能方面的地位。但情况确实会发生一些微调。” 这种“微调”不是修修补补,而是一场从根基开始的演进。
当高质量数据接近枯竭,当算力成本成为瓶颈,当长序列需求不断攀升——架构创新不再是“锦上添花”,而是通往AGI的必经之路。
下一个十年,谁将接过Transformer的王冠?是类脑脉冲的“内生复杂性”,还是液态网络的“连续智能”,抑或我们尚未想象到的全新范式?
答案正在2026年的实验室中孕育。
参考资料:
(本文为系列文章第六篇,共六篇。感谢一路相伴,AI新范式的探索永无止境!)



