欢迎光临
我们一直在努力

2026年5月20日最新人工智能发展报告:从大模型到智能体的范式跃迁

目录

    • 摘要
  • 1 引言:人工智能发展的历史性转折
    • 1.1 从感知智能到认知智能的跨越
    • 1.2 2025—2026年AI发展的宏观图景
  • 2 大语言模型的理论基础与架构演进
    • 2.1 Transformer架构的核心机制与数学原理
    • 2.2 缩放定律:从经验规律到理论框架
    • 2.3 后Transformer架构:状态空间模型与混合架构
    • 2.4 训练范式:从预训练到后训练的深化
  • 3 多模态智能:从感知到认知的统一
    • 3.1 多模态大语言模型的架构范式
    • 3.2 视觉理解的深层挑战
    • 3.3 视频理解与时空建模
    • 3.4 多模态统一表征的理论基础
  • 4 推理与对齐:让AI学会思考与守规矩
    • 4.1 思维链推理的理论基础
    • 4.2 推理时计算:以计算换精度
    • 4.3 RLHF与对齐技术的演进
    • 4.4 安全对齐的深层困境
  • 5 智能体AI:从工具到自主决策
    • 5.1 智能体AI的定义与特征
    • 5.2 智能体的架构设计
    • 5.3 多智能体系统与协作
    • 5.4 智能体AI的产业落地
  • 6 AI驱动的科学发现与产业变革
    • 6.1 AI for Science:从AlphaFold到科学发现引擎
    • 6.2 AI在药物研发中的变革性作用
    • 6.3 AI产业格局与投资趋势
    • 6.4 AI算力基础设施的演进
  • 7 全球AI治理与安全框架
    • 7.1 EU AI Act:全球首部综合性AI法规
    • 7.2 全球AI治理的多极格局
    • 7.3 AI安全研究的前沿方向
    • 7.4 负责任AI的测量差距
  • 8 展望与挑战:通向通用人工智能之路
    • 8.1 通用人工智能的理论争鸣
    • 8.2 具身智能与世界模型
    • 8.3 神经符号融合:连接主义与符号主义的再统一
    • 8.4 可持续AI:效率与公平的双重挑战
    • 8.5 未来展望
  • 参考文献

博主智算菩萨,专注于人工智能、Python编程、音视频处理及UI窗体程序设计等方向。致力于以通俗易懂的方式拆解前沿技术,从零基础入门到高阶实战,陪伴开发者共同成长。目前已开设五大技术专栏,累计发布多篇原创技术文章,深受读者好评。

📌 专栏导航

  • 人工智能前沿知识(已更144篇):深度剖析Transformer架构、生成式AI、强化学习、具身智能、神经符号系统、大模型及智能体(Agent)技术,系统性解析AI核心技术体系与前沿趋势。
  • Python基础小白编程(已更232篇):从零开始,以保姆式教程讲解变量、数据类型、流程控制、函数等核心语法,配有大量实战代码与避坑指南,真正做到学以致用。
  • 机器学习与深度学习(125篇):系统化拆解线性模型、决策树、随机森林、梯度提升树、神经网络等算法原理与工程实践,覆盖从公式推导到代码实现的全链路内容。
  • 音频、图像与视频处理理论与实战(81篇):涵盖FFmpeg多媒体处理、audio_shop开源工具、ComfyUI-WanVideoWrapper视频生成等实用技术,从基础操作到高级应用一应俱全。
  • UI窗体程序设计实战(78篇):深入讲解UI设计、动态窗体生成、游戏UI框架设计等实战技巧,提供从配置到编码的完整解决方案。 智算菩萨,以代码为经,以算法为纬,在人工智能的星辰大海中,做你前行路上最可靠的导航者。本人最常用的AI对话工具是AIGCBAR。

摘要

2025年至2026年初,人工智能领域经历了自深度学习爆发以来最为深刻的范式变革。大语言模型从单纯的文本生成工具演化为具备复杂推理能力的智能系统,多模态融合技术实现了视觉、语言与行动的统一表征,智能体(Agentic AI)架构的崛起标志着AI从被动响应走向自主决策,而AI驱动的科学发现正在重塑从药物研发到材料科学的研究范式。与此同时,全球AI治理框架加速落地,EU AI Act的阶段性实施为世界提供了首个综合性AI监管范本。本报告基于截至2026年5月的最新学术文献、产业数据与政策文件,系统梳理人工智能在理论基础、核心技术、产业应用与治理安全四个维度上的最新进展,旨在为研究者与决策者提供全面、深入的技术参考。


1 引言:人工智能发展的历史性转折

1.1 从感知智能到认知智能的跨越

人工智能的发展历程可以追溯到1956年达特茅斯会议,但真正引发全球性变革的转折点发生在2012年——AlexNet在ImageNet竞赛中的突破性表现标志着深度学习时代的开启。此后十余年间,卷积神经网络(CNN)在图像识别领域不断刷新纪录,循环神经网络(RNN)及其变体LSTM在序列建模中取得长足进步,生成对抗网络(GAN)则为AI的创造力打开了新维度。然而,这些系统本质上仍停留在"感知智能"的层面:它们能够识别模式、分类数据、生成逼真的样本,却无法进行逻辑推理、规划决策或理解因果关系。

2017年,Vaswani等人提出的Transformer架构以自注意力机制(Self-Attention)取代了传统的循环结构,从根本上改变了序列建模的范式。Transformer的核心创新在于其并行化计算能力和对长距离依赖的高效捕获,这为后续大语言模型的诞生奠定了架构基础。2020年,Kaplan等人发现的神经语言模型缩放定律(Scaling Laws)揭示了模型性能与计算量、参数量和数据量之间的幂律关系,为系统性地提升模型能力提供了理论指导。同年,GPT-3以1750亿参数的规模展示了少样本学习的惊人能力,标志着大语言模型时代的正式到来。

2022年底ChatGPT的发布将大语言模型推入了公众视野,引发了全球范围的AI热潮。然而,彼时的语言模型仍存在明显的局限性:推理能力薄弱、事实性错误频发、缺乏对多模态信息的理解。进入2025年,一系列技术突破从根本上改变了这一局面。OpenAI的o1系列模型首次将"思维链"(Chain-of-Thought, CoT)推理内化为模型的核心能力,DeepSeek R1则证明了通过纯强化学习可以在开源模型中涌现出高级推理能力。到2026年初,AI系统已经能够在数学竞赛、编程挑战和科学推理等任务上达到甚至超越人类专家水平,这标志着人工智能正在从感知智能向认知智能实现实质性跨越。

1.2 2025—2026年AI发展的宏观图景

根据斯坦福大学人类中心人工智能研究所(HAI)发布的《2026年AI指数报告》,全球AI市场在2025年达到了约3909亿美元的规模,预计2026年将增长至5395亿美元。美国在AI私人投资领域以2859亿美元遥遥领先,是中国124亿美元的23倍以上。生成式AI工具对美国消费者的年价值估计已达到1720亿美元,每位用户的中位价值在2025至2026年间增长了三倍。这些数据不仅反映了AI技术的商业化成熟度,更揭示了AI正在从实验室走向经济社会的各个角落。

#mermaid-svg-JQ1qTAMQXRsURJPH{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-JQ1qTAMQXRsURJPH .error-icon{fill:#552222;}#mermaid-svg-JQ1qTAMQXRsURJPH .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-JQ1qTAMQXRsURJPH .marker{fill:#333333;stroke:#333333;}#mermaid-svg-JQ1qTAMQXRsURJPH .marker.cross{stroke:#333333;}#mermaid-svg-JQ1qTAMQXRsURJPH svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-JQ1qTAMQXRsURJPH p{margin:0;}#mermaid-svg-JQ1qTAMQXRsURJPH .edge{stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .section–1 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section–1 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section–1 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section–1 path{fill:hsl(240, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section–1 text{fill:#ffffff;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon–1{font-size:40px;color:#ffffff;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge–1{stroke:hsl(240, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth–1{stroke-width:17;}#mermaid-svg-JQ1qTAMQXRsURJPH .section–1 line{stroke:hsl(60, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:#ffffff;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-0 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-0 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-0 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-0 path{fill:hsl(60, 100%, 73.5294117647%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-0 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-0{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-0{stroke:hsl(60, 100%, 73.5294117647%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-0{stroke-width:14;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-0 line{stroke:hsl(240, 100%, 83.5294117647%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-1 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-1 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-1 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-1 path{fill:hsl(80, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-1 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-1{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-1{stroke:hsl(80, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-1{stroke-width:11;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-1 line{stroke:hsl(260, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-2 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-2 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-2 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-2 path{fill:hsl(270, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-2 text{fill:#ffffff;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-2{font-size:40px;color:#ffffff;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-2{stroke:hsl(270, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-2{stroke-width:8;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-2 line{stroke:hsl(90, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:#ffffff;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-3 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-3 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-3 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-3 path{fill:hsl(300, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-3 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-3{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-3{stroke:hsl(300, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-3{stroke-width:5;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-3 line{stroke:hsl(120, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-4 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-4 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-4 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-4 path{fill:hsl(330, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-4 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-4{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-4{stroke:hsl(330, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-4{stroke-width:2;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-4 line{stroke:hsl(150, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-5 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-5 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-5 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-5 path{fill:hsl(0, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-5 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-5{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-5{stroke:hsl(0, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-5{stroke-width:-1;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-5 line{stroke:hsl(180, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-6 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-6 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-6 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-6 path{fill:hsl(30, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-6 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-6{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-6{stroke:hsl(30, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-6{stroke-width:-4;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-6 line{stroke:hsl(210, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-7 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-7 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-7 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-7 path{fill:hsl(90, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-7 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-7{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-7{stroke:hsl(90, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-7{stroke-width:-7;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-7 line{stroke:hsl(270, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-8 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-8 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-8 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-8 path{fill:hsl(150, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-8 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-8{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-8{stroke:hsl(150, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-8{stroke-width:-10;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-8 line{stroke:hsl(330, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-9 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-9 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-9 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-9 path{fill:hsl(180, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-9 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-9{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-9{stroke:hsl(180, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-9{stroke-width:-13;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-9 line{stroke:hsl(0, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-10 rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-10 path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-10 circle,#mermaid-svg-JQ1qTAMQXRsURJPH .section-10 path{fill:hsl(210, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-10 text{fill:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .node-icon-10{font-size:40px;color:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-edge-10{stroke:hsl(210, 100%, 76.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .edge-depth-10{stroke-width:-16;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-10 line{stroke:hsl(30, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-JQ1qTAMQXRsURJPH .lineWrapper line{stroke:black;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled circle,#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:lightgray;}#mermaid-svg-JQ1qTAMQXRsURJPH .disabled text{fill:#efefef;}#mermaid-svg-JQ1qTAMQXRsURJPH .section-root rect,#mermaid-svg-JQ1qTAMQXRsURJPH .section-root path,#mermaid-svg-JQ1qTAMQXRsURJPH .section-root circle{fill:hsl(240, 100%, 46.2745098039%);}#mermaid-svg-JQ1qTAMQXRsURJPH .section-root text{fill:#ffffff;}#mermaid-svg-JQ1qTAMQXRsURJPH .icon-container{height:100%;display:flex;justify-content:center;align-items:center;}#mermaid-svg-JQ1qTAMQXRsURJPH .edge{fill:none;}#mermaid-svg-JQ1qTAMQXRsURJPH .eventWrapper{filter:brightness(120%);}#mermaid-svg-JQ1qTAMQXRsURJPH :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

2020

GPT-3发布

1750亿参数少样本学习

缩放定律论文

揭示幂律关系

2022

ChatGPT发布

引爆全球AI热潮

Stable Diffusion

开源图像生成

2023

GPT-4发布

多模态大模型

LLaMA开源

开源社区崛起

2024

EU AI Act立法

全球首部AI综合法规

Sora视频生成

视觉生成突破

2025

DeepSeek R1

开源推理模型

Agentic AI兴起

自主智能体范式

Blackwell GPU

算力基础设施升级

2026

Stanford AI Index

AI能力与治理差距扩大

世界模型初现

具身智能新范式

AI发展关键里程碑(2020—2026)

从技术范式来看,2025—2026年的AI发展呈现出三个显著特征:第一,从单模态到多模态的融合统一,视觉、语言、音频乃至行动被纳入统一的表征空间;第二,从被动工具到主动智能体的转变,AI系统开始具备自主规划、工具调用和持续学习的能力;第三,从规模扩张到效率优化的转向,在缩放定律边际效益递减的背景下,训练后优化(Post-training Optimization)、推理时计算(Inference-time Compute)和数据质量成为新的竞争焦点。这三个特征共同构成了当前AI发展的核心叙事,也将在本报告的后续章节中得到深入探讨。

2 大语言模型的理论基础与架构演进

2.1 Transformer架构的核心机制与数学原理

Transformer架构自2017年提出以来,一直是大规模语言模型的基石。其核心——缩放点积注意力(Scaled Dot-Product Attention)机制可以用如下公式表达:

Attention

(

Q

,

K

,

V

)

=

softmax

(

Q

K

T

d

k

)

V

\\text{Attention}(Q, K, V) = \\text{softmax}\\left(\\frac{QK^T}{\\sqrt{d_k}}\\right)V

Attention(Q,K,V)=softmax(dk

QKT)V

其中,

Q

R

n

×

d

k

Q \\in \\mathbb{R}^{n \\times d_k}

QRn×dk

K

R

m

×

d

k

K \\in \\mathbb{R}^{m \\times d_k}

KRm×dk

V

R

m

×

d

v

V \\in \\mathbb{R}^{m \\times d_v}

VRm×dv 分别代表查询(Query)、键(Key)和值(Value)矩阵,

d

k

d_k

dk 为键向量的维度。除以

d

k

\\sqrt{d_k}

dk

的目的是防止点积值过大导致softmax函数进入梯度极小的饱和区。多头注意力(Multi-Head Attention)则通过将

Q

Q

Q

K

K

K

V

V

V 投影到

h

h

h 个不同的子空间中并行计算注意力,再将结果拼接并线性变换:

MultiHead

(

Q

,

K

,

V

)

=

Concat

(

head

1

,

,

head

h

)

W

O

\\text{MultiHead}(Q, K, V) = \\text{Concat}(\\text{head}_1, \\ldots, \\text{head}_h)W^O

MultiHead(Q,K,V)=Concat(head1,,headh)WO

head

i

=

Attention

(

Q

W

i

Q

,

K

W

i

K

,

V

W

i

V

)

\\text{head}_i = \\text{Attention}(QW_i^Q, KW_i^K, VW_i^V)

headi=Attention(QWiQ,KWiK,VWiV)

其中

W

i

Q

R

d

model

×

d

k

W_i^Q \\in \\mathbb{R}^{d_{\\text{model}} \\times d_k}

WiQRdmodel×dk

W

i

K

R

d

model

×

d

k

W_i^K \\in \\mathbb{R}^{d_{\\text{model}} \\times d_k}

WiKRdmodel×dk

W

i

V

R

d

model

×

d

v

W_i^V \\in \\mathbb{R}^{d_{\\text{model}} \\times d_v}

WiVRdmodel×dv

W

O

R

h

d

v

×

d

model

W^O \\in \\mathbb{R}^{hd_v \\times d_{\\text{model}}}

WORhdv×dmodel 为可学习的投影矩阵。多头机制使模型能够同时关注不同位置的不同表征子空间中的信息,显著增强了模型的表达能力。

Transformer的位置编码(Positional Encoding)是另一个关键设计。原始论文采用正弦-余弦位置编码:

P

E

(

p

o

s

,

2

i

)

=

sin

(

p

o

s

10000

2

i

/

d

model

)

PE_{(pos, 2i)} = \\sin\\left(\\frac{pos}{10000^{2i/d_{\\text{model}}}}\\right)

PE(pos,2i)=sin(100002i/dmodelpos)

P

E

(

p

o

s

,

2

i

+

1

)

=

cos

(

p

o

s

10000

2

i

/

d

model

)

PE_{(pos, 2i+1)} = \\cos\\left(\\frac{pos}{10000^{2i/d_{\\text{model}}}}\\right)

PE(pos,2i+1)=cos(100002i/dmodelpos)

这种编码方式允许模型学习相对位置关系,因为对于任意固定偏移量

k

k

k

P

E

p

o

s

+

k

PE_{pos+k}

PEpos+k 可以表示为

P

E

p

o

s

PE_{pos}

PEpos 的线性函数。后续工作中,可学习位置编码(Learned Positional Embedding)、旋转位置编码(RoPE)和相对位置编码(ALiBi)等变体被提出,分别在不同场景下展现出优势。RoPE通过将位置信息融入查询和键的旋转矩阵中,实现了对相对位置的高效编码,已成为当前主流大模型的标配。

2.2 缩放定律:从经验规律到理论框架

缩放定律(Scaling Laws)是大语言模型发展中最具指导意义的经验规律之一。Kaplan等人在2020年的开创性工作中发现,语言模型的交叉熵损失

L

L

L 与模型参数量

N

N

N、数据集大小

D

D

D 和训练计算量

C

C

C 之间存在幂律关系:

L

(

N

)

=

(

N

c

N

)

α

N

,

α

N

0.076

L(N) = \\left(\\frac{N_c}{N}\\right)^{\\alpha_N}, \\quad \\alpha_N \\approx 0.076

L(N)=(NNc)αN,αN0.076

L

(

D

)

=

(

D

c

D

)

α

D

,

α

D

0.095

L(D) = \\left(\\frac{D_c}{D}\\right)^{\\alpha_D}, \\quad \\alpha_D \\approx 0.095

L(D)=(DDc)αD,αD0.095

L

(

C

)

=

(

C

c

C

)

α

C

,

α

C

0.050

L(C) = \\left(\\frac{C_c}{C}\\right)^{\\alpha_C}, \\quad \\alpha_C \\approx 0.050

L(C)=(CCc)αC,αC0.050

其中

N

c

N_c

Nc

D

c

D_c

Dc

C

c

C_c

Cc 为常数。这些幂律关系在超过六个数量级的范围内成立,表明模型性能的提升是高度可预测的。

2022年,Hoffmann等人(Chinchilla论文)对缩放定律进行了重要修正。他们发现,给定计算预算

C

C

C,最优模型参数量

N

opt

N_{\\text{opt}}

Nopt 和最优训练数据量

D

opt

D_{\\text{opt}}

Dopt 应当近似等比例缩放:

N

opt

(

C

)

C

0.50

,

D

opt

(

C

)

C

0.50

N_{\\text{opt}}(C) \\propto C^{0.50}, \\quad D_{\\text{opt}}(C) \\propto C^{0.50}

Nopt(C)C0.50,Dopt(C)C0.50

这意味着此前许多大模型(如GPT-3、Gopher等)在给定计算预算下处于"过参数化"状态——它们本应使用更少的参数和更多的训练数据。Chinchilla模型以700亿参数和1.4万亿训练token达到了与2800亿参数的Gopher相同的计算量,但性能显著更优,验证了这一结论。

然而,2025年的研究开始揭示缩放定律的边界。ACL 2025上发表的"Revisiting Scaling Laws for Language Models"一文通过对400多个模型的系统实验发现,在特定任务(尤其是需要特定技能的任务)上,缩放定律存在"子缩放"(Sub-scaling)现象:当模型规模超过某一阈值后,性能提升的速率会显著放缓。这表明,单纯的规模扩张可能无法持续带来等比例的能力提升,训练后优化技术(如强化学习对齐、知识蒸馏等)的重要性日益凸显。

缩放定律版本核心结论最优参数-数据比代表模型
Kaplan et al. (2020) 损失与参数/数据/计算呈幂律 参数优先 GPT-3
Chinchilla (2022) 参数与数据等比例缩放 约1:20 (参数:token) Chinchilla, LLaMA
Sub-scaling (2025) 特定技能存在缩放瓶颈 任务依赖 GPT-4o, Claude 3.5

2.3 后Transformer架构:状态空间模型与混合架构

尽管Transformer架构在过去数年中占据主导地位,但其自注意力机制的二次计算复杂度

O

(

n

2

)

O(n^2)

O(n2) 在处理超长序列时成为严重瓶颈。2023年,Gu和Dao提出的Mamba模型引入了选择性状态空间模型(Selective State Space Model, S6),以线性复杂度

O

(

n

)

O(n)

O(n) 实现了与Transformer相当甚至更优的建模能力,引发了"后Transformer"架构的广泛讨论。

状态空间模型(SSM)的连续形式由如下线性时不变系统描述:

d

h

(

t

)

d

t

=

A

h

(

t

)

+

B

x

(

t

)

\\frac{dh(t)}{dt} = Ah(t) + Bx(t)

dtdh(t)=Ah(t)+Bx(t)

y

(

t

)

=

C

h

(

t

)

+

D

x

(

t

)

y(t) = Ch(t) + Dx(t)

y(t)=Ch(t)+Dx(t)

其中

h

(

t

)

R

N

h(t) \\in \\mathbb{R}^N

h(t)RN 为隐状态,

x

(

t

)

R

x(t) \\in \\mathbb{R}

x(t)R 为输入,

y

(

t

)

R

y(t) \\in \\mathbb{R}

y(t)R 为输出,

A

R

N

×

N

A \\in \\mathbb{R}^{N \\times N}

ARN×N

B

R

N

×

1

B \\in \\mathbb{R}^{N \\times 1}

BRN×1

C

R

1

×

N

C \\in \\mathbb{R}^{1 \\times N}

CR1×N

D

R

1

×

1

D \\in \\mathbb{R}^{1 \\times 1}

DR1×1 为系统参数。离散化后,该系统可以通过递推高效计算:

h

t

=

A

ˉ

h

t

1

+

B

ˉ

x

t

h_t = \\bar{A}h_{t-1} + \\bar{B}x_t

ht=Aˉht1+Bˉxt

y

t

=

C

h

t

+

D

x

t

y_t = Ch_t + Dx_t

yt=Cht+Dxt

Mamba的关键创新在于使

B

B

B

C

C

C 和步长

Δ

\\Delta

Δ 成为输入依赖的(即"选择性的"),从而使模型能够根据输入内容动态调整信息流动——这一特性与Transformer中注意力权重的动态计算异曲同工。2025年发表在Nature Scientific Reports上的研究进一步提出了Transformer-Mamba混合架构,在医学影像报告生成等任务中取得了优于单一架构的效果,表明两种范式的融合可能是未来的重要方向。

2.4 训练范式:从预训练到后训练的深化

大语言模型的训练流程通常分为预训练(Pre-training)和后训练(Post-training)两个阶段。预训练阶段通过在海量文本数据上最小化自回归损失来学习语言的统计规律:

L

pretrain

=

t

=

1

T

log

p

θ

(

x

t

x

<

t

)

\\mathcal{L}_{\\text{pretrain}} = -\\sum_{t=1}^{T} \\log p_\\theta(x_t | x_{<t})

Lpretrain=t=1Tlogpθ(xtx<t)

后训练阶段则通过监督微调(SFT)、强化学习从人类反馈(RLHF)和直接偏好优化(DPO)等技术,将预训练模型对齐到人类意图和安全规范上。2025年以来,后训练的重要性急剧上升,一个关键趋势是"推理时计算"(Inference-time Compute)的引入:通过在推理阶段分配额外的计算资源(如多次采样、验证、搜索等),模型可以在不增加参数量的情况下显著提升推理质量。这一范式的代表包括OpenAI的o系列模型和DeepSeek R1,它们通过在推理时生成详细的思维链来分解复杂问题,实现了数学和编程任务上的突破性表现。

3 多模态智能:从感知到认知的统一

3.1 多模态大语言模型的架构范式

多模态大语言模型(Multimodal Large Language Models, MLLMs)旨在将视觉、听觉、语言等不同模态的信息统一到同一表征空间中,使模型能够像人类一样跨模态地感知、理解和推理。当前主流的MLLM架构可以分为三类:融合型架构、对齐型架构和统一型架构。

融合型架构以Flamingo、LLaVA为代表,其核心思路是将预训练的视觉编码器(如CLIP的ViT)与预训练的语言模型通过可训练的"桥接层"(Bridge Layer)连接。视觉编码器将输入图像编码为视觉token序列,桥接层将这些视觉token映射到语言模型的嵌入空间中,语言模型则负责融合视觉和语言信息进行推理。这种架构的优势在于可以充分利用已有的预训练模型,训练成本较低;劣势在于视觉和语言模态之间的对齐可能不够深入。

对齐型架构以CLIP、ALIGN为代表,通过对比学习(Contrastive Learning)将视觉和语言编码器映射到共享的嵌入空间中。其训练目标可以形式化为:

L

contrastive

=

1

N

i

=

1

N

log

exp

(

sim

(

v

i

,

t

i

)

/

τ

)

j

=

1

N

exp

(

sim

(

v

i

,

t

j

)

/

τ

)

\\mathcal{L}_{\\text{contrastive}} = -\\frac{1}{N}\\sum_{i=1}^{N}\\log\\frac{\\exp(\\text{sim}(v_i, t_i)/\\tau)}{\\sum_{j=1}^{N}\\exp(\\text{sim}(v_i, t_j)/\\tau)}

Lcontrastive=N1i=1Nlogj=1Nexp(sim(vi,tj)/τ)exp(sim(vi,ti)/τ)

其中

v

i

v_i

vi

t

i

t_i

ti 分别为第

i

i

i 个样本的视觉和文本嵌入,

sim

(

,

)

\\text{sim}(\\cdot, \\cdot)

sim(,) 为相似度函数(通常为余弦相似度),

τ

\\tau

τ 为温度参数。对比学习使匹配的图文对在嵌入空间中靠近,不匹配的对远离,从而实现跨模态对齐。

统一型架构是2025年以来的前沿方向,以GPT-4o、Gemini为代表。这类架构不再区分视觉编码器和语言模型,而是将所有模态的输入统一token化后输入同一个Transformer中处理。这种"原生多模态"(Native Multimodal)设计避免了模态间信息传递的瓶颈,理论上能够实现更深层次的跨模态理解。2024年发表在arXiv上的综述论文"A Comprehensive Survey and Guide to Multimodal Large Language Models"系统梳理了MLLM的架构演进,指出统一型架构代表了多模态建模的未来方向。

#mermaid-svg-gdQoo1bzn45NBbKq{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-gdQoo1bzn45NBbKq .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-gdQoo1bzn45NBbKq .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-gdQoo1bzn45NBbKq .error-icon{fill:#552222;}#mermaid-svg-gdQoo1bzn45NBbKq .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-gdQoo1bzn45NBbKq .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-gdQoo1bzn45NBbKq .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-gdQoo1bzn45NBbKq .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-gdQoo1bzn45NBbKq .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-gdQoo1bzn45NBbKq .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-gdQoo1bzn45NBbKq .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-gdQoo1bzn45NBbKq .marker{fill:#333333;stroke:#333333;}#mermaid-svg-gdQoo1bzn45NBbKq .marker.cross{stroke:#333333;}#mermaid-svg-gdQoo1bzn45NBbKq svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-gdQoo1bzn45NBbKq p{margin:0;}#mermaid-svg-gdQoo1bzn45NBbKq .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-gdQoo1bzn45NBbKq .cluster-label text{fill:#333;}#mermaid-svg-gdQoo1bzn45NBbKq .cluster-label span{color:#333;}#mermaid-svg-gdQoo1bzn45NBbKq .cluster-label span p{background-color:transparent;}#mermaid-svg-gdQoo1bzn45NBbKq .label text,#mermaid-svg-gdQoo1bzn45NBbKq span{fill:#333;color:#333;}#mermaid-svg-gdQoo1bzn45NBbKq .node rect,#mermaid-svg-gdQoo1bzn45NBbKq .node circle,#mermaid-svg-gdQoo1bzn45NBbKq .node ellipse,#mermaid-svg-gdQoo1bzn45NBbKq .node polygon,#mermaid-svg-gdQoo1bzn45NBbKq .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-gdQoo1bzn45NBbKq .rough-node .label text,#mermaid-svg-gdQoo1bzn45NBbKq .node .label text,#mermaid-svg-gdQoo1bzn45NBbKq .image-shape .label,#mermaid-svg-gdQoo1bzn45NBbKq .icon-shape .label{text-anchor:middle;}#mermaid-svg-gdQoo1bzn45NBbKq .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-gdQoo1bzn45NBbKq .rough-node .label,#mermaid-svg-gdQoo1bzn45NBbKq .node .label,#mermaid-svg-gdQoo1bzn45NBbKq .image-shape .label,#mermaid-svg-gdQoo1bzn45NBbKq .icon-shape .label{text-align:center;}#mermaid-svg-gdQoo1bzn45NBbKq .node.clickable{cursor:pointer;}#mermaid-svg-gdQoo1bzn45NBbKq .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-gdQoo1bzn45NBbKq .arrowheadPath{fill:#333333;}#mermaid-svg-gdQoo1bzn45NBbKq .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-gdQoo1bzn45NBbKq .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-gdQoo1bzn45NBbKq .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-gdQoo1bzn45NBbKq .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-gdQoo1bzn45NBbKq .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-gdQoo1bzn45NBbKq .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-gdQoo1bzn45NBbKq .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-gdQoo1bzn45NBbKq .cluster text{fill:#333;}#mermaid-svg-gdQoo1bzn45NBbKq .cluster span{color:#333;}#mermaid-svg-gdQoo1bzn45NBbKq div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-gdQoo1bzn45NBbKq .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-gdQoo1bzn45NBbKq rect.text{fill:none;stroke-width:0;}#mermaid-svg-gdQoo1bzn45NBbKq .icon-shape,#mermaid-svg-gdQoo1bzn45NBbKq .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-gdQoo1bzn45NBbKq .icon-shape p,#mermaid-svg-gdQoo1bzn45NBbKq .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-gdQoo1bzn45NBbKq .icon-shape rect,#mermaid-svg-gdQoo1bzn45NBbKq .image-shape rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-gdQoo1bzn45NBbKq .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-gdQoo1bzn45NBbKq .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-gdQoo1bzn45NBbKq :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

统一型架构

图像

统一Tokenizer

文本

音频

统一Transformer

多模态输出

对齐型架构

图像

视觉编码器

文本

文本编码器

对比学习

共享嵌入空间

融合型架构

图像

视觉编码器ViT/CLIP

桥接层Q-Former/MLP

文本

语言模型

输出

3.2 视觉理解的深层挑战

尽管MLLM在图像描述、视觉问答等任务上取得了显著进展,但2025年发表在Nature Machine Intelligence上的研究"Visual Cognition in Multimodal Large Language Models"揭示了当前模型在视觉认知方面的深层不足。该研究从直觉物理(Intuitive Physics)、因果推理(Causal Reasoning)和直觉心理学(Intuitive Psychology)三个维度评估了MLLM的视觉认知能力,发现模型在需要理解物理规律、因果关系和他人意图的任务上表现远不如人类。

这一发现具有重要的理论意义。它表明,当前的MLLM虽然在模式匹配和统计关联方面表现出色,但尚未真正理解视觉场景中的因果结构和物理约束。例如,当被问及"如果松开手中的杯子会发生什么"时,模型可能基于训练数据中的统计规律给出正确答案(“杯子会掉落”),但它并不理解重力、支撑力等物理概念。这种"知其然而不知其所以然"的局限性是通向通用人工智能的重要障碍。

3.3 视频理解与时空建模

视频理解是2025—2026年多模态AI的重要前沿。与静态图像不同,视频包含丰富的时间维度信息,要求模型能够理解动作的时序关系、因果关系和物理规律。Sora等视频生成模型的出现表明,基于扩散模型(Diffusion Model)的视频生成已经能够产生视觉上逼真的长视频,但生成质量并不等同于理解深度。

视频理解的核心挑战在于时空建模的效率问题。一段

T

T

T 帧的视频,若每帧包含

H

×

W

H \\times W

H×W 个patch,则总token数为

T

×

H

×

W

T \\times H \\times W

T×H×W,这对标准Transformer的注意力机制构成了巨大的计算挑战。当前的主流解决方案包括:时空注意力分解(将3D注意力分解为空间注意力和时间注意力的级联)、稀疏注意力(只关注关键帧或关键区域)和基于状态空间模型的时序建模。2025年的研究表明,Mamba架构在长视频理解任务中展现出了显著的计算效率优势,其线性复杂度使其能够处理数千帧的视频序列而不会出现显存溢出。

3.4 多模态统一表征的理论基础

多模态统一表征的理论基础可以追溯到多视图学习(Multi-view Learning)和模态不变表征(Modality-invariant Representation)的研究。其核心假设是:不同模态是对同一底层语义的不同"观察",因此存在一个共享的语义空间,使得不同模态的等价语义在该空间中被映射到相近的位置。

形式化地,设

f

v

:

V

Z

f_v: \\mathcal{V} \\to \\mathcal{Z}

fv:VZ

f

t

:

T

Z

f_t: \\mathcal{T} \\to \\mathcal{Z}

ft:TZ 分别为视觉和文本编码器,

Z

\\mathcal{Z}

Z 为共享语义空间。理想情况下,对于语义等价的图文对

(

v

,

t

)

(v, t)

(v,t),应有:

d

(

f

v

(

v

)

,

f

t

(

t

)

)

<

d

(

f

v

(

v

)

,

f

t

(

t

)

)

t

t

d(f_v(v), f_t(t)) < d(f_v(v), f_t(t')) \\quad \\forall t' \\neq t

d(fv(v),ft(t))<d(fv(v),ft(t))t=t

其中

d

(

,

)

d(\\cdot, \\cdot)

d(,) 为距离度量。对比学习通过最大化匹配对的相似度、最小化非匹配对的相似度来逼近这一目标。然而,2025年的研究表明,简单的对比对齐可能导致"语义塌缩"(Semantic Collapse)问题——模型可能只学习到模态间的浅层对应关系(如"狗"的图像和"狗"的文本),而无法捕获更深层的语义结构。为解决这一问题,研究者提出了基于知识蒸馏、互信息和因果推理的更深层次对齐方法。

4 推理与对齐:让AI学会思考与守规矩

4.1 思维链推理的理论基础

思维链(Chain-of-Thought, CoT)推理是2025年AI领域最重要的技术突破之一。其核心思想是:通过让模型在给出最终答案之前先生成中间推理步骤,可以显著提升模型在复杂推理任务上的表现。Wei等人在2022年的工作中首次系统性地证明了CoT提示的有效性,而2025年的o1和DeepSeek R1则将CoT从"提示工程"提升为"模型内化能力"。

CoT推理的理论基础可以从计算复杂性的角度理解。考虑一个需要

k

k

k 步推理的问题,直接输出答案要求模型在单次前向传播中完成所有推理步骤,这等价于要求模型在固定深度的计算图中表达

k

k

k 步推理——当

k

k

k 较大时,这可能导致表达瓶颈。而CoT推理将

k

k

k 步推理分散到

k

k

k 次自回归步骤中,每次只需完成一步推理,从而降低了对单步计算深度的要求。

更形式化地,设直接推理的计算图为

G

d

G_d

Gd,CoT推理的计算图为

G

c

G_c

Gc

G

d

G_d

Gd 的深度为

O

(

1

)

O(1)

O(1) 但宽度需要

O

(

k

)

O(k)

O(k),而

G

c

G_c

Gc 的深度为

O

(

k

)

O(k)

O(k) 但每步宽度仅为

O

(

1

)

O(1)

O(1)。在Transformer架构中,自回归生成的机制天然支持

G

c

G_c

Gc 的计算模式,这使得CoT推理能够有效利用模型的序列生成能力来扩展推理深度。

4.2 推理时计算:以计算换精度

推理时计算(Inference-time Compute)是2025年AI推理研究的核心概念。其基本思想是:在推理阶段分配更多的计算资源(如生成多个候选答案、进行验证和选择、执行搜索等),可以在不增加模型参数量的情况下显著提升输出质量。

设模型参数量为

N

N

N,推理时分配的计算量为

C

infer

C_{\\text{infer}}

Cinfer,则模型的有效能力可以近似为:

Capability

(

N

,

C

infer

)

f

(

N

)

g

(

C

infer

)

\\text{Capability}(N, C_{\\text{infer}}) \\approx f(N) \\cdot g(C_{\\text{infer}})

Capability(N,Cinfer)f(N)g(Cinfer)

其中

f

(

N

)

f(N)

f(N) 为模型规模决定的基础能力,

g

(

C

infer

)

g(C_{\\text{infer}})

g(Cinfer) 为推理时计算带来的增益。研究表明,

g

(

C

infer

)

g(C_{\\text{infer}})

g(Cinfer) 在一定范围内近似满足对数增长:

g

(

C

infer

)

log

(

C

infer

)

g(C_{\\text{infer}}) \\propto \\log(C_{\\text{infer}})

g(Cinfer)log(Cinfer)

这意味着推理时计算可以带来显著的性能提升,但边际效益递减。在实际应用中,推理时计算的策略包括:多数投票(Majority Voting)、最佳N选一(Best-of-N)、验证器引导搜索(Verifier-guided Search)和树搜索(Tree Search)等。

DeepSeek R1的训练过程是推理时计算范式的一个典型案例。该模型通过纯强化学习(不依赖监督微调)训练,在训练过程中自发涌现了自我反思(Self-reflection)、验证(Verification)和回溯(Backtracking)等高级推理行为。其训练采用了组相对策略优化(Group Relative Policy Optimization, GRPO),避免了传统PPO算法中对价值模型的依赖:

L

GRPO

=

E

[

A

i

σ

clip

(

π

θ

(

o

i

q

)

π

θ

old

(

o

i

q

)

,

1

ϵ

,

1

+

ϵ

)

]

\\mathcal{L}_{\\text{GRPO}} = -\\mathbb{E}\\left[\\frac{A_i}{\\sigma}\\cdot\\text{clip}\\left(\\frac{\\pi_\\theta(o_i|q)}{\\pi_{\\theta_{\\text{old}}}(o_i|q)}, 1-\\epsilon, 1+\\epsilon\\right)\\right]

LGRPO=E[σAiclip(πθold(oiq)πθ(oiq),1ϵ,1+ϵ)]

其中

A

i

A_i

Ai 为组内相对优势,通过同一问题的多个采样结果相对比较计算得出。

4.3 RLHF与对齐技术的演进

强化学习从人类反馈(Reinforcement Learning from Human Feedback, RLHF)是大语言模型对齐的核心技术。其标准流程包括三个阶段:(1)监督微调(SFT),在高质量人工标注数据上微调预训练模型;(2)奖励模型训练(Reward Modeling, RM),基于人类偏好数据训练一个奖励函数;(3)强化学习优化,使用PPO等算法最大化奖励模型的输出。

奖励模型的训练基于Bradley-Terry偏好模型。给定一对回答

(

y

w

,

y

l

)

(y_w, y_l)

(yw,yl),其中

y

w

y_w

yw 被人类标注为优于

y

l

y_l

yl,奖励模型

r

ϕ

r_\\phi

rϕ 的训练损失为:

L

RM

=

E

(

x

,

y

w

,

y

l

)

[

log

σ

(

r

ϕ

(

x

,

y

w

)

r

ϕ

(

x

,

y

l

)

)

]

\\mathcal{L}_{\\text{RM}} = -\\mathbb{E}_{(x, y_w, y_l)}\\left[\\log\\sigma\\left(r_\\phi(x, y_w) – r_\\phi(x, y_l)\\right)\\right]

LRM=E(x,yw,yl)[logσ(rϕ(x,yw)rϕ(x,yl))]

其中

σ

(

)

\\sigma(\\cdot)

σ() 为sigmoid函数。在强化学习阶段,模型通过最大化奖励同时约束与参考策略的KL散度来优化:

max

π

θ

E

x

D

,

y

π

θ

(

x

)

[

r

ϕ

(

x

,

y

)

β

D

KL

(

π

θ

(

x

)

π

ref

(

x

)

)

]

\\max_{\\pi_\\theta} \\mathbb{E}_{x \\sim \\mathcal{D}, y \\sim \\pi_\\theta(\\cdot|x)}\\left[r_\\phi(x, y) – \\beta \\cdot D_{\\text{KL}}(\\pi_\\theta(\\cdot|x) \\| \\pi_{\\text{ref}}(\\cdot|x))\\right]

πθmaxExD,yπθ(x)[rϕ(x,y)βDKL(πθ(x)πref(x))]

其中

β

\\beta

β 为KL惩罚系数,用于防止模型偏离参考策略过远。

2025年,RLHF技术经历了重要演进。直接偏好优化(Direct Preference Optimization, DPO)绕过了奖励模型训练阶段,直接从偏好数据中优化策略模型:

L

DPO

=

E

(

x

,

y

w

,

y

l

)

[

log

σ

(

β

log

π

θ

(

y

w

x

)

π

ref

(

y

w

x

)

β

log

π

θ

(

y

l

x

)

π

ref

(

y

l

x

)

)

]

\\mathcal{L}_{\\text{DPO}} = -\\mathbb{E}_{(x, y_w, y_l)}\\left[\\log\\sigma\\left(\\beta\\log\\frac{\\pi_\\theta(y_w|x)}{\\pi_{\\text{ref}}(y_w|x)} – \\beta\\log\\frac{\\pi_\\theta(y_l|x)}{\\pi_{\\text{ref}}(y_l|x)}\\right)\\right]

LDPO=E(x,yw,yl)[logσ(βlogπref(ywx)πθ(ywx)βlogπref(ylx)πθ(ylx))]

DPO的理论优势在于其隐式地定义了一个与RLHF等价的奖励函数,同时避免了强化学习训练的不稳定性。2025年发表在ACM Computing Surveys上的综述"RLHF Deciphered"系统分析了RLHF的强化学习原理,指出了当前方法在奖励模型泛化性、偏好数据质量和训练稳定性方面的挑战。

2025年发表在arXiv上的综述"Alignment and Safety in Large Language Models"(119页)进一步全面梳理了LLM对齐的实用技术、训练协议和实证发现,指出当代LLM对齐研究既取得了显著进步,也面临持续挑战——包括红队测试(Red-teaming)中的越狱攻击、对齐税(Alignment Tax)导致的性能下降,以及多语言对齐的不均衡性等问题。

4.4 安全对齐的深层困境

安全对齐面临的一个根本性困境是"对齐的局限性"(Limitations of Alignment)。2025年发表在PMC上的论文"Helpful, Harmless, Honest? Sociotechnical Limits of AI Alignment"从社会技术系统的角度分析了RLHF方法的局限,指出:第一,人类偏好本身存在不一致性和偏见,基于有缺陷的偏好信号训练的模型可能放大这些偏见;第二,RLHF优化的是"有用性"(Helpfulness)和"无害性"(Harmlessness),但两者之间存在内在张力——过度追求无害可能导致模型拒绝合理请求(过度拒绝问题),而过度追求有用则可能产生有害输出;第三,对齐是动态的——社会规范和价值观随时间演变,静态的对齐训练无法适应这种变化。

对齐方法核心机制优势局限性
SFT 监督微调 简单高效 泛化性有限
RLHF (PPO) 奖励模型+强化学习 对齐效果好 训练不稳定、奖励黑客
DPO 直接偏好优化 无需奖励模型 偏好数据质量敏感
RLAIF AI反馈替代人类反馈 可扩展性强 可能传播模型偏见
Constitutional AI 宪法原则自我修正 减少人类标注 宪法设计依赖专家

#mermaid-svg-P3CuXovomto89C1B{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-P3CuXovomto89C1B .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-P3CuXovomto89C1B .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-P3CuXovomto89C1B .error-icon{fill:#552222;}#mermaid-svg-P3CuXovomto89C1B .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-P3CuXovomto89C1B .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-P3CuXovomto89C1B .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-P3CuXovomto89C1B .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-P3CuXovomto89C1B .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-P3CuXovomto89C1B .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-P3CuXovomto89C1B .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-P3CuXovomto89C1B .marker{fill:#333333;stroke:#333333;}#mermaid-svg-P3CuXovomto89C1B .marker.cross{stroke:#333333;}#mermaid-svg-P3CuXovomto89C1B svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-P3CuXovomto89C1B p{margin:0;}#mermaid-svg-P3CuXovomto89C1B .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-P3CuXovomto89C1B .cluster-label text{fill:#333;}#mermaid-svg-P3CuXovomto89C1B .cluster-label span{color:#333;}#mermaid-svg-P3CuXovomto89C1B .cluster-label span p{background-color:transparent;}#mermaid-svg-P3CuXovomto89C1B .label text,#mermaid-svg-P3CuXovomto89C1B span{fill:#333;color:#333;}#mermaid-svg-P3CuXovomto89C1B .node rect,#mermaid-svg-P3CuXovomto89C1B .node circle,#mermaid-svg-P3CuXovomto89C1B .node ellipse,#mermaid-svg-P3CuXovomto89C1B .node polygon,#mermaid-svg-P3CuXovomto89C1B .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-P3CuXovomto89C1B .rough-node .label text,#mermaid-svg-P3CuXovomto89C1B .node .label text,#mermaid-svg-P3CuXovomto89C1B .image-shape .label,#mermaid-svg-P3CuXovomto89C1B .icon-shape .label{text-anchor:middle;}#mermaid-svg-P3CuXovomto89C1B .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-P3CuXovomto89C1B .rough-node .label,#mermaid-svg-P3CuXovomto89C1B .node .label,#mermaid-svg-P3CuXovomto89C1B .image-shape .label,#mermaid-svg-P3CuXovomto89C1B .icon-shape .label{text-align:center;}#mermaid-svg-P3CuXovomto89C1B .node.clickable{cursor:pointer;}#mermaid-svg-P3CuXovomto89C1B .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-P3CuXovomto89C1B .arrowheadPath{fill:#333333;}#mermaid-svg-P3CuXovomto89C1B .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-P3CuXovomto89C1B .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-P3CuXovomto89C1B .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-P3CuXovomto89C1B .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-P3CuXovomto89C1B .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-P3CuXovomto89C1B .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-P3CuXovomto89C1B .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-P3CuXovomto89C1B .cluster text{fill:#333;}#mermaid-svg-P3CuXovomto89C1B .cluster span{color:#333;}#mermaid-svg-P3CuXovomto89C1B div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-P3CuXovomto89C1B .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-P3CuXovomto89C1B rect.text{fill:none;stroke-width:0;}#mermaid-svg-P3CuXovomto89C1B .icon-shape,#mermaid-svg-P3CuXovomto89C1B .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-P3CuXovomto89C1B .icon-shape p,#mermaid-svg-P3CuXovomto89C1B .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-P3CuXovomto89C1B .icon-shape rect,#mermaid-svg-P3CuXovomto89C1B .image-shape rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-P3CuXovomto89C1B .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-P3CuXovomto89C1B .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-P3CuXovomto89C1B :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

传统路线

DPO路线

AI反馈路线

存在漏洞

通过验证

预训练模型

SFT监督微调

选择对齐策略

收集人类偏好数据

训练奖励模型

RLHF/PPO优化

收集偏好对数据

直接偏好优化

AI生成偏好数据

RLAIF/Constitutional AI

对齐后模型

红队测试与评估

部署

5 智能体AI:从工具到自主决策

5.1 智能体AI的定义与特征

智能体AI(Agentic AI)是2025年最引人注目的技术趋势之一。Gartner将智能体AI列为2025年最重要的战略技术趋势,预测到2028年33%的企业软件将包含智能体AI功能。IEEE在2025年发表的综述"Agentic AI: Autonomous Intelligence for Complex Goals"将智能体AI定义为:能够在最少人类干预下自主追求复杂目标的AI系统。与传统AI系统被动响应指令不同,智能体AI具备以下核心特征:

第一,自主性(Autonomy):智能体能够在没有人类持续指导的情况下独立规划和执行任务。这要求模型具备将复杂目标分解为子目标、制定执行计划、监控执行进度和动态调整策略的能力。自主性的实现依赖于大语言模型的推理能力和工具调用能力的结合——模型需要理解何时需要调用外部工具(如搜索引擎、代码执行器、数据库等),如何解读工具返回的结果,以及如何根据结果调整后续行动。

第二,反应性(Reactivity):智能体能够感知环境变化并及时做出响应。在多轮交互场景中,智能体需要根据用户的反馈、工具的输出或环境的状态变化来调整自己的行为。反应性要求模型具备实时推理和快速决策的能力。

第三,主动性(Proactivity):智能体不仅被动响应外部刺激,还能主动识别需要完成的任务、发现潜在的问题并提出解决方案。主动性是智能体区别于简单工具调用系统的关键特征——它意味着智能体具有"目标驱动"的行为模式,而非"指令驱动"。

第四,社交性(Sociality):在多智能体系统中,每个智能体需要与其他智能体或人类进行有效的协作和沟通。社交性要求模型具备理论心智(Theory of Mind)能力——即理解他人的意图、信念和知识状态,并据此调整自己的沟通策略。

5.2 智能体的架构设计

智能体AI的典型架构包含以下核心组件:

规划模块(Planning Module):负责将复杂目标分解为可执行的子任务序列。当前主流的规划方法包括ReAct(Reasoning + Acting)、Plan-and-Solve和Tree-of-Thought。ReAct方法交替执行推理步骤和行动步骤,使模型能够在推理过程中调用工具获取信息;Plan-and-Solve方法则先制定完整的计划,再逐步执行;Tree-of-Thought方法通过搜索多条推理路径来寻找最优解。

记忆模块(Memory Module):分为短期记忆和长期记忆。短期记忆存储当前对话的上下文信息,通常通过上下文窗口(Context Window)实现;长期记忆存储历史交互和知识,通常通过向量数据库(Vector Database)和检索增强生成(RAG)技术实现。长期记忆的检索过程可以形式化为:

Retrieve

(

q

)

=

TopK

m

M

sim

(

Embed

(

q

)

,

Embed

(

m

)

)

\\text{Retrieve}(q) = \\text{TopK}_{m \\in \\mathcal{M}} \\text{sim}(\\text{Embed}(q), \\text{Embed}(m))

Retrieve(q)=TopKmMsim(Embed(q),Embed(m))

其中

q

q

q 为当前查询,

M

\\mathcal{M}

M 为记忆库,

Embed

(

)

\\text{Embed}(\\cdot)

Embed() 为嵌入函数,

sim

(

,

)

\\text{sim}(\\cdot, \\cdot)

sim(,) 为相似度函数。

工具调用模块(Tool Use Module):使智能体能够与外部环境交互。工具调用的核心挑战在于工具选择的准确性和参数传递的正确性。当前的方法通常将工具描述作为系统提示的一部分输入模型,让模型通过函数调用(Function Calling)机制来选择和调用工具。

反思模块(Reflection Module):使智能体能够评估自身行为的效果并进行自我修正。反思能力是高级智能体的标志,它要求模型能够识别错误、分析原因并调整策略。DeepSeek R1中涌现的自我反思行为表明,通过强化学习训练的模型可以自发地发展出反思能力。

#mermaid-svg-P1vM3ThirlPDVf7n{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-P1vM3ThirlPDVf7n .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-P1vM3ThirlPDVf7n .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-P1vM3ThirlPDVf7n .error-icon{fill:#552222;}#mermaid-svg-P1vM3ThirlPDVf7n .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-P1vM3ThirlPDVf7n .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-P1vM3ThirlPDVf7n .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-P1vM3ThirlPDVf7n .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-P1vM3ThirlPDVf7n .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-P1vM3ThirlPDVf7n .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-P1vM3ThirlPDVf7n .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-P1vM3ThirlPDVf7n .marker{fill:#333333;stroke:#333333;}#mermaid-svg-P1vM3ThirlPDVf7n .marker.cross{stroke:#333333;}#mermaid-svg-P1vM3ThirlPDVf7n svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-P1vM3ThirlPDVf7n p{margin:0;}#mermaid-svg-P1vM3ThirlPDVf7n .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-P1vM3ThirlPDVf7n .cluster-label text{fill:#333;}#mermaid-svg-P1vM3ThirlPDVf7n .cluster-label span{color:#333;}#mermaid-svg-P1vM3ThirlPDVf7n .cluster-label span p{background-color:transparent;}#mermaid-svg-P1vM3ThirlPDVf7n .label text,#mermaid-svg-P1vM3ThirlPDVf7n span{fill:#333;color:#333;}#mermaid-svg-P1vM3ThirlPDVf7n .node rect,#mermaid-svg-P1vM3ThirlPDVf7n .node circle,#mermaid-svg-P1vM3ThirlPDVf7n .node ellipse,#mermaid-svg-P1vM3ThirlPDVf7n .node polygon,#mermaid-svg-P1vM3ThirlPDVf7n .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-P1vM3ThirlPDVf7n .rough-node .label text,#mermaid-svg-P1vM3ThirlPDVf7n .node .label text,#mermaid-svg-P1vM3ThirlPDVf7n .image-shape .label,#mermaid-svg-P1vM3ThirlPDVf7n .icon-shape .label{text-anchor:middle;}#mermaid-svg-P1vM3ThirlPDVf7n .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-P1vM3ThirlPDVf7n .rough-node .label,#mermaid-svg-P1vM3ThirlPDVf7n .node .label,#mermaid-svg-P1vM3ThirlPDVf7n .image-shape .label,#mermaid-svg-P1vM3ThirlPDVf7n .icon-shape .label{text-align:center;}#mermaid-svg-P1vM3ThirlPDVf7n .node.clickable{cursor:pointer;}#mermaid-svg-P1vM3ThirlPDVf7n .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-P1vM3ThirlPDVf7n .arrowheadPath{fill:#333333;}#mermaid-svg-P1vM3ThirlPDVf7n .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-P1vM3ThirlPDVf7n .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-P1vM3ThirlPDVf7n .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-P1vM3ThirlPDVf7n .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-P1vM3ThirlPDVf7n .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-P1vM3ThirlPDVf7n .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-P1vM3ThirlPDVf7n .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-P1vM3ThirlPDVf7n .cluster text{fill:#333;}#mermaid-svg-P1vM3ThirlPDVf7n .cluster span{color:#333;}#mermaid-svg-P1vM3ThirlPDVf7n div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-P1vM3ThirlPDVf7n .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-P1vM3ThirlPDVf7n rect.text{fill:none;stroke-width:0;}#mermaid-svg-P1vM3ThirlPDVf7n .icon-shape,#mermaid-svg-P1vM3ThirlPDVf7n .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-P1vM3ThirlPDVf7n .icon-shape p,#mermaid-svg-P1vM3ThirlPDVf7n .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-P1vM3ThirlPDVf7n .icon-shape rect,#mermaid-svg-P1vM3ThirlPDVf7n .image-shape rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-P1vM3ThirlPDVf7n .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-P1vM3ThirlPDVf7n .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-P1vM3ThirlPDVf7n :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

智能体架构

需要调整

任务完成

目标输入

规划模块ReAct/ToT/Plan-and-Solve

行动模块工具调用/代码执行

外部环境API/数据库/代码沙箱

观察结果

记忆模块短期:上下文窗口长期:向量数据库+RAG

反思模块自我评估与修正

输出结果

5.3 多智能体系统与协作

多智能体系统(Multi-Agent System, MAS)是智能体AI的重要研究方向。在MAS中,多个具有不同角色和专长的智能体通过协作完成复杂任务。典型的多智能体框架包括AutoGen、CrewAI和MetaGPT等,它们分别采用了不同的协作模式:

对话式协作:智能体通过多轮对话协调行动,如AutoGen中的AssistantAgent和UserProxyAgent交替发送消息来推进任务。

角色式协作:每个智能体被赋予特定角色(如产品经理、程序员、测试员),按照软件工程流程协作完成开发任务,如MetaGPT。

层级式协作:存在一个"管理者"智能体负责任务分配和结果整合,其他"工作者"智能体负责执行具体子任务。

多智能体系统的理论基础涉及博弈论、机制设计和社会选择理论。一个核心问题是:如何设计智能体间的交互协议,使得系统在全局上达到最优或近似最优的结果?这一问题与经济学中的"机制设计"问题高度相似——需要设计"激励相容"的规则,使每个智能体在追求自身目标的同时,也促进了全局目标的实现。

5.4 智能体AI的产业落地

根据PwC 2025年5月发布的AI智能体调查报告,35%的企业已经在核心业务中部署了AI智能体,68%的组织预计将在2026年前将自主或半自主AI智能体整合到核心运营中。然而,Gartner的调查也显示,只有15%的IT应用领导者正在考虑、试点或部署完全自主的AI智能体,这表明从"半自主"到"完全自主"的跨越仍面临重大挑战。

全球自主AI和自主智能体市场在2025年的估值超过86.2亿美元,预计将以高复合年增长率持续扩张。智能体AI在客户服务(128%的ROI)、销售线索转化(35%的提速)和软件开发等领域展现出显著的商业价值。然而,智能体AI的落地也面临可靠性、可解释性和安全性等挑战——当AI系统获得更大的自主权时,其错误决策的潜在影响也随之增大。

6 AI驱动的科学发现与产业变革

6.1 AI for Science:从AlphaFold到科学发现引擎

AI驱动的科学发现(AI for Science)是2025—2026年最令人振奋的AI应用方向之一。AlphaFold的传奇是这一领域的标志性成就:自2020年AlphaFold 2在CASP14竞赛中取得突破以来,该系统已经准确预测了超过2亿个蛋白质结构,被全球超过200万研究人员使用。2024年,DeepMind的Demis Hassabis和John Jumper因AlphaFold获得诺贝尔化学奖,标志着AI for Science获得了科学界最高荣誉的认可。

AlphaFold 2的核心技术是 Evoformer 架构和结构模块(Structure Module)。Evoformer 通过迭代更新成对表示(Pair Representation)和多重序列对齐表示(MSA Representation)来捕获氨基酸残基间的共进化信息,其注意力机制可以形式化为:

TriangleMultiplication

(

Z

)

=

LayerNorm

(

Z

(

Z

W

1

)

T

W

2

)

\\text{TriangleMultiplication}(Z) = \\text{LayerNorm}\\left(Z \\odot (Z W_1)^T W_2\\right)

TriangleMultiplication(Z)=LayerNorm(Z(ZW1)TW2)

其中

Z

Z

Z 为成对表示矩阵,

W

1

W_1

W1

W

2

W_2

W2 为可学习权重,

\\odot

为逐元素乘法。三角形乘法更新是AlphaFold的关键创新之一,它利用了蛋白质结构的三角不等式约束来传播几何信息。

AlphaFold 3进一步将预测范围从单一蛋白质扩展到蛋白质-配体复合物、蛋白质-核酸复合物等更复杂的分子系统。2025年发表在PMC上的综述指出,AlphaFold 2在单链蛋白质结构预测中达到了约92.4%的GDT分数,而AlphaFold 3在蛋白质-配体结合预测方面的精度也达到了实验方法可比的水平。

2025年,斯坦福HAI的AI指数报告首次设立了"AI in Science"和"AI in Medicine"独立章节,反映了AI在科学领域影响力的快速增长。AI for Science的应用已经从蛋白质结构预测扩展到药物发现、材料设计、气候建模和数学证明等多个领域,正在成为继实验科学、理论科学和计算科学之后的"第四科学范式"。

6.2 AI在药物研发中的变革性作用

药物研发是一个高成本、长周期、低成功率的过程——一款新药从发现到上市平均需要10—15年和20—30亿美元的投入,临床成功率仅约10%。AI技术正在从多个环节重塑这一过程:

靶点发现:通过分析基因组学、蛋白质组学和代谢组学等多组学数据,AI可以识别与疾病相关的潜在药物靶点。图神经网络(GNN)在蛋白质-蛋白质相互作用网络和基因调控网络的分析中展现出独特优势。

分子生成与优化:基于扩散模型和流匹配(Flow Matching)的分子生成方法能够在满足多重约束(如药效、选择性、药代动力学性质)的条件下生成候选分子。条件分子生成的目标函数可以表示为:

max

m

E

m

p

θ

[

i

w

i

s

i

(

m

)

]

\\max_{m} \\mathbb{E}_{m \\sim p_\\theta}\\left[\\sum_{i} w_i \\cdot s_i(m)\\right]

mmaxEmpθ[iwisi(m)]

其中

m

m

m 为生成的分子,

s

i

(

m

)

s_i(m)

si(m) 为第

i

i

i 个属性(如结合亲和力、溶解度等)的评分函数,

w

i

w_i

wi 为对应权重。

临床试验优化:AI可以辅助患者筛选、剂量优化和试验设计,提高临床试验的效率和成功率。2025年,多家AI药物研发公司的候选药物进入了临床II期试验,标志着AI药物研发从概念验证走向实际产出。

6.3 AI产业格局与投资趋势

2025年,全球AI投资达到了创纪录的2258亿美元,远超2021年的1149亿美元和2024年的1144亿美元。美国在AI私人投资方面以2859亿美元遥遥领先,中国为124亿美元。全球数据中心建设投资预计到2028年将达到2.9万亿美元,AI已成为经济增长的结构性驱动力。

指标2023年2024年2025年2026年(预测)
全球AI市场规模 1890亿美元 3909亿美元 5395亿美元
全球AI投资 1144亿美元 2258亿美元
美国AI私人投资 2859亿美元
中国AI私人投资 124亿美元
生成式AI消费者价值 1720亿美元/年

数据来源:Stanford HAI 2026 AI Index Report, Grand View Research, UNCTAD

AI产业的竞争格局呈现出"寡头主导、开源追赶"的特征。OpenAI、Google DeepMind、Anthropic等头部公司凭借巨额算力投入和顶尖人才储备,在基础模型能力上保持领先;Meta的LLaMA系列、DeepSeek等开源模型则通过社区协作快速缩小差距。2025年DeepSeek R1的发布是一个标志性事件——它以远低于OpenAI o1的训练成本达到了可比的推理能力,证明了在算法创新面前,算力优势并非不可逾越。

6.4 AI算力基础设施的演进

AI算力是大模型发展的物理基础。2025年,Nvidia的Blackwell架构GPU成为AI训练和推理的主力硬件。Blackwell架构采用了第二代Transformer引擎、第五代NVLink互连和RAS(可靠性、可用性、可维护性)功能,专为智能体AI和物理AI工作负载设计。Blackwell Ultra GPU预计在2025年下半年推出,后续的Rubin架构也已公布路线图。

Google的TPU(Tensor Processing Unit)也在持续演进。第七代TPU在性能上已与Nvidia Blackwell可比,专门为Gemini系列模型的训练和推理优化。TPU的核心优势在于其矩阵乘法单元(MXU)的专用设计和与Google云基础设施的深度集成,使其在大规模分布式训练中具有成本效率优势。

AI算力需求的增长速度远超摩尔定律的预测。2025年的大模型训练可能需要数万块GPU运行数周,总计算量达到

10

25

10^{25}

1025 FLOPS量级。这种算力需求的爆炸式增长带来了严峻的能源挑战——大型AI训练中心的电力消耗已相当于一个小型城市,碳排放问题日益受到关注。2025年以来,液冷技术、专用AI芯片和模型压缩技术成为缓解算力瓶颈的重要方向。

7 全球AI治理与安全框架

7.1 EU AI Act:全球首部综合性AI法规

欧盟人工智能法案(EU AI Act)于2024年8月1日正式成为法律,是全球首部综合性AI监管法规。该法案采用基于风险分级的监管框架,将AI系统分为四个风险等级:

不可接受风险(Unacceptable Risk):包括社会评分系统、实时远程生物识别(除特定执法场景外)和操纵人类行为的AI系统。此类系统自2025年2月起被禁止。

高风险(High Risk):包括用于招聘、信用评估、司法判决辅助等关键领域的AI系统。此类系统需满足严格的要求,包括数据治理、透明性、人类监督和定期审计。相关规定将于2026年8月全面执行。

有限风险(Limited Risk):包括聊天机器人、内容生成工具等。此类系统需满足透明性要求(如标注AI生成内容)。

最小风险(Minimal Risk):包括垃圾邮件过滤器、视频游戏AI等。此类系统基本不受监管。

EU AI Act还针对通用目的AI模型(GPAI Model)设立了专门条款,要求系统性风险模型(训练计算量超过

10

25

10^{25}

1025 FLOPS)进行额外的安全评估和缓解措施。GPAI模型条款于2025年8月生效。到2026年8月,大部分规则将全面执行,各成员国需在2026年8月2日前建立至少一个AI监管沙箱。

#mermaid-svg-HW6d1FtY4FSBs7mz{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-HW6d1FtY4FSBs7mz .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-HW6d1FtY4FSBs7mz .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-HW6d1FtY4FSBs7mz .error-icon{fill:#552222;}#mermaid-svg-HW6d1FtY4FSBs7mz .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-HW6d1FtY4FSBs7mz .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-HW6d1FtY4FSBs7mz .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-HW6d1FtY4FSBs7mz .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-HW6d1FtY4FSBs7mz .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-HW6d1FtY4FSBs7mz .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-HW6d1FtY4FSBs7mz .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-HW6d1FtY4FSBs7mz .marker{fill:#333333;stroke:#333333;}#mermaid-svg-HW6d1FtY4FSBs7mz .marker.cross{stroke:#333333;}#mermaid-svg-HW6d1FtY4FSBs7mz svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-HW6d1FtY4FSBs7mz p{margin:0;}#mermaid-svg-HW6d1FtY4FSBs7mz .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-HW6d1FtY4FSBs7mz .cluster-label text{fill:#333;}#mermaid-svg-HW6d1FtY4FSBs7mz .cluster-label span{color:#333;}#mermaid-svg-HW6d1FtY4FSBs7mz .cluster-label span p{background-color:transparent;}#mermaid-svg-HW6d1FtY4FSBs7mz .label text,#mermaid-svg-HW6d1FtY4FSBs7mz span{fill:#333;color:#333;}#mermaid-svg-HW6d1FtY4FSBs7mz .node rect,#mermaid-svg-HW6d1FtY4FSBs7mz .node circle,#mermaid-svg-HW6d1FtY4FSBs7mz .node ellipse,#mermaid-svg-HW6d1FtY4FSBs7mz .node polygon,#mermaid-svg-HW6d1FtY4FSBs7mz .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-HW6d1FtY4FSBs7mz .rough-node .label text,#mermaid-svg-HW6d1FtY4FSBs7mz .node .label text,#mermaid-svg-HW6d1FtY4FSBs7mz .image-shape .label,#mermaid-svg-HW6d1FtY4FSBs7mz .icon-shape .label{text-anchor:middle;}#mermaid-svg-HW6d1FtY4FSBs7mz .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-HW6d1FtY4FSBs7mz .rough-node .label,#mermaid-svg-HW6d1FtY4FSBs7mz .node .label,#mermaid-svg-HW6d1FtY4FSBs7mz .image-shape .label,#mermaid-svg-HW6d1FtY4FSBs7mz .icon-shape .label{text-align:center;}#mermaid-svg-HW6d1FtY4FSBs7mz .node.clickable{cursor:pointer;}#mermaid-svg-HW6d1FtY4FSBs7mz .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-HW6d1FtY4FSBs7mz .arrowheadPath{fill:#333333;}#mermaid-svg-HW6d1FtY4FSBs7mz .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-HW6d1FtY4FSBs7mz .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-HW6d1FtY4FSBs7mz .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-HW6d1FtY4FSBs7mz .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-HW6d1FtY4FSBs7mz .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-HW6d1FtY4FSBs7mz .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-HW6d1FtY4FSBs7mz .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-HW6d1FtY4FSBs7mz .cluster text{fill:#333;}#mermaid-svg-HW6d1FtY4FSBs7mz .cluster span{color:#333;}#mermaid-svg-HW6d1FtY4FSBs7mz div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-HW6d1FtY4FSBs7mz .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-HW6d1FtY4FSBs7mz rect.text{fill:none;stroke-width:0;}#mermaid-svg-HW6d1FtY4FSBs7mz .icon-shape,#mermaid-svg-HW6d1FtY4FSBs7mz .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-HW6d1FtY4FSBs7mz .icon-shape p,#mermaid-svg-HW6d1FtY4FSBs7mz .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-HW6d1FtY4FSBs7mz .icon-shape rect,#mermaid-svg-HW6d1FtY4FSBs7mz .image-shape rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-HW6d1FtY4FSBs7mz .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-HW6d1FtY4FSBs7mz .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-HW6d1FtY4FSBs7mz :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

关键时间节点

2024年8月法案生效

2025年2月禁止条款执行

2025年8月GPAI条款生效

2026年8月大部分规则执行

2027年2月剩余义务生效

GPAI模型条款

通用目的AI模型

系统性风险模型计算量>10^25 FLOPS

额外安全评估与缓解措施

非系统性风险模型基本透明性要求

EU AI Act风险分级框架

不可接受风险2025年2月禁止

高风险2026年8月全面执行

有限风险透明性义务

最小风险基本不受监管

7.2 全球AI治理的多极格局

EU AI Act的实施为全球AI治理提供了首个综合性范本,但世界各国的AI治理路径存在显著差异,形成了多极格局:

美国:采取"行业自律+部门监管"的模式。2023年拜登政府发布的AI行政令要求大型AI系统分享安全测试结果,但该行政令在2025年初被特朗普政府撤销。美国目前缺乏联邦层面的综合性AI立法,监管主要依靠现有法律框架(如FTC对AI歧视的执法、FDA对医疗AI的审批等)和行业自律承诺。

中国:采用"分级分类+算法备案"的模式。2023年实施的《生成式人工智能服务管理暂行办法》要求生成式AI服务提供者进行算法备案、安全评估和内容标注。中国的AI治理强调"发展与安全并重",在鼓励AI创新的同时注重内容安全和数据主权。

英国:采用"亲创新+原则性"的模式。2023年AI安全峰会后,英国主张通过现有监管机构而非新设机构来监管AI,强调灵活性和适应性。

这种多极格局带来了"监管套利"的风险——AI公司可能将研发和部署转移到监管较宽松的地区。为应对这一挑战,G7广岛AI进程、联合国AI咨询委员会等国际机制正在推动AI治理的协调与互认。

7.3 AI安全研究的前沿方向

2025年,AI安全研究呈现出从"对齐"向"全面安全"的扩展趋势。根据Anthropic对齐科学团队发布的"Recommendations for Technical AI Safety Research Directions"和Future of Life Institute的"AI Safety Index Report",当前AI安全研究的核心方向包括:

可解释性(Interpretability):理解模型内部表征和决策机制。机械可解释性(Mechanistic Interpretability)通过识别和修改模型内部的特定"特征"(Features)来理解模型行为,Anthropic的稀疏自编码器(Sparse Autoencoder)方法在这一方向上取得了重要进展。

可扩展监督(Scalable Oversight):当AI系统能力超越人类评估者时,如何确保其输出仍然安全可靠?辩论(Debate)、递归奖励建模(Recursive Reward Modeling)和AI辅助评估是当前的主要方法。

危险能力评估(Dangerous Capability Evaluation):前沿模型可能具备协助生物武器制造、网络攻击或大规模社会操纵等危险能力。2025年的研究表明,前沿模型在CBRN(化学、生物、放射、核)威胁方面的潜在能力有所提升,这要求建立系统性的危险能力评估框架。

对抗鲁棒性(Adversarial Robustness):越狱攻击(Jailbreak Attack)和提示注入攻击(Prompt Injection Attack)仍然是对齐系统的主要威胁。2025年AAAI会议上提出的SafeInfer方法通过上下文自适应的解码时安全策略来防御越狱攻击,代表了一种新的防御范式。

7.4 负责任AI的测量差距

斯坦福HAI 2026年AI指数报告揭示了一个令人警醒的发现:AI能力与AI治理准备度之间的差距正在扩大。虽然AI在技术指标上持续快速进步,但在安全性、公平性和透明性的测量和保障方面进展缓慢。具体而言:

在公平性方面,现有基准测试主要关注人口统计学偏差(如性别、种族偏差),但对更微妙的偏见形式(如文化偏见、认知偏见)缺乏有效的测量方法。在透明性方面,尽管越来越多的AI公司发布了系统卡片(System Cards)和技术报告,但这些文档的标准化程度和可审计性仍然不足。在安全性方面,红队测试的方法论和标准尚未统一,不同组织的测试结果难以比较。

这种"测量差距"(Measurement Gap)意味着,我们对AI系统潜在风险的理解可能严重滞后于AI能力的实际发展。建立标准化、可比较、可复现的AI安全评估体系,是当前AI治理领域最紧迫的任务之一。

8 展望与挑战:通向通用人工智能之路

8.1 通用人工智能的理论争鸣

通用人工智能(Artificial General Intelligence, AGI)是AI研究的终极目标,但对于AGI的定义、衡量标准和实现路径,学术界存在深刻分歧。一种观点认为,AGI是指能够在所有认知任务上达到或超越人类水平的AI系统;另一种观点则认为,AGI是指能够灵活学习和适应新任务的AI系统,不要求在所有领域都超越人类。

2025年,关于AGI时间线的预测更加分化。乐观派认为,基于当前大语言模型的缩放趋势和推理能力的突破,AGI可能在5—10年内实现;悲观派则指出,当前AI系统在因果推理、常识理解和物理世界交互方面的根本性局限,可能需要全新的理论突破才能克服。斯坦福HAI 2026年报告的发现——AI能力与治理准备度之间的差距正在扩大——也为AGI的讨论增添了紧迫感:即使AGI在技术上可行,我们是否在制度上做好了准备?

从理论角度看,通向AGI的核心挑战可以归纳为以下几个维度:

因果推理(Causal Reasoning):当前的大语言模型本质上是基于统计相关性的模式匹配器,它们无法区分相关性和因果性。Judea Pearl提出的因果层级理论(Causal Hierarchy)将因果推理分为三个层级:关联(Association)、干预(Intervention)和反事实(Counterfactual)。当前AI系统主要在关联层级运作,而真正的AGI需要能够在干预和反事实层级进行推理。

世界模型(World Model):人类能够构建关于物理世界如何运作的心智模型,并利用这一模型进行预测、规划和决策。2026年被认为是"大世界模型"(Large World Model)为机器人和多模态AI奠定基础的关键年份。世界模型的核心挑战在于如何从高维感官输入中学习紧凑、准确且可模拟的世界动态模型。

持续学习(Continual Learning):人类能够在学习新知识的同时保留旧知识,而当前的AI系统在持续学习方面面临"灾难性遗忘"(Catastrophic Forgetting)问题。实现持续学习需要开发新的学习算法和记忆机制,使模型能够在不重新训练的情况下不断积累知识。

#mermaid-svg-FHt2OZYUKYysGKjm{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-FHt2OZYUKYysGKjm .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-FHt2OZYUKYysGKjm .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-FHt2OZYUKYysGKjm .error-icon{fill:#552222;}#mermaid-svg-FHt2OZYUKYysGKjm .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-FHt2OZYUKYysGKjm .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-FHt2OZYUKYysGKjm .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-FHt2OZYUKYysGKjm .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-FHt2OZYUKYysGKjm .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-FHt2OZYUKYysGKjm .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-FHt2OZYUKYysGKjm .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-FHt2OZYUKYysGKjm .marker{fill:#333333;stroke:#333333;}#mermaid-svg-FHt2OZYUKYysGKjm .marker.cross{stroke:#333333;}#mermaid-svg-FHt2OZYUKYysGKjm svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-FHt2OZYUKYysGKjm p{margin:0;}#mermaid-svg-FHt2OZYUKYysGKjm .edge{stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .section–1 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section–1 path,#mermaid-svg-FHt2OZYUKYysGKjm .section–1 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section–1 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section–1 path{fill:hsl(240, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section–1 text{fill:#ffffff;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon–1{font-size:40px;color:#ffffff;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge–1{stroke:hsl(240, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth–1{stroke-width:17;}#mermaid-svg-FHt2OZYUKYysGKjm .section–1 line{stroke:hsl(60, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-0 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-0 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-0 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-0 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-0 path{fill:hsl(60, 100%, 73.5294117647%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-0 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-0{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-0{stroke:hsl(60, 100%, 73.5294117647%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-0{stroke-width:14;}#mermaid-svg-FHt2OZYUKYysGKjm .section-0 line{stroke:hsl(240, 100%, 83.5294117647%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-1 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-1 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-1 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-1 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-1 path{fill:hsl(80, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-1 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-1{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-1{stroke:hsl(80, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-1{stroke-width:11;}#mermaid-svg-FHt2OZYUKYysGKjm .section-1 line{stroke:hsl(260, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-2 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-2 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-2 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-2 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-2 path{fill:hsl(270, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-2 text{fill:#ffffff;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-2{font-size:40px;color:#ffffff;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-2{stroke:hsl(270, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-2{stroke-width:8;}#mermaid-svg-FHt2OZYUKYysGKjm .section-2 line{stroke:hsl(90, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-3 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-3 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-3 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-3 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-3 path{fill:hsl(300, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-3 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-3{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-3{stroke:hsl(300, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-3{stroke-width:5;}#mermaid-svg-FHt2OZYUKYysGKjm .section-3 line{stroke:hsl(120, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-4 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-4 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-4 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-4 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-4 path{fill:hsl(330, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-4 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-4{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-4{stroke:hsl(330, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-4{stroke-width:2;}#mermaid-svg-FHt2OZYUKYysGKjm .section-4 line{stroke:hsl(150, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-5 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-5 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-5 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-5 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-5 path{fill:hsl(0, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-5 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-5{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-5{stroke:hsl(0, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-5{stroke-width:-1;}#mermaid-svg-FHt2OZYUKYysGKjm .section-5 line{stroke:hsl(180, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-6 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-6 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-6 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-6 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-6 path{fill:hsl(30, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-6 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-6{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-6{stroke:hsl(30, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-6{stroke-width:-4;}#mermaid-svg-FHt2OZYUKYysGKjm .section-6 line{stroke:hsl(210, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-7 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-7 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-7 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-7 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-7 path{fill:hsl(90, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-7 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-7{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-7{stroke:hsl(90, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-7{stroke-width:-7;}#mermaid-svg-FHt2OZYUKYysGKjm .section-7 line{stroke:hsl(270, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-8 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-8 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-8 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-8 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-8 path{fill:hsl(150, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-8 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-8{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-8{stroke:hsl(150, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-8{stroke-width:-10;}#mermaid-svg-FHt2OZYUKYysGKjm .section-8 line{stroke:hsl(330, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-9 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-9 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-9 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-9 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-9 path{fill:hsl(180, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-9 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-9{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-9{stroke:hsl(180, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-9{stroke-width:-13;}#mermaid-svg-FHt2OZYUKYysGKjm .section-9 line{stroke:hsl(0, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-10 rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-10 path,#mermaid-svg-FHt2OZYUKYysGKjm .section-10 circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-10 polygon,#mermaid-svg-FHt2OZYUKYysGKjm .section-10 path{fill:hsl(210, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-10 text{fill:black;}#mermaid-svg-FHt2OZYUKYysGKjm .node-icon-10{font-size:40px;color:black;}#mermaid-svg-FHt2OZYUKYysGKjm .section-edge-10{stroke:hsl(210, 100%, 76.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .edge-depth-10{stroke-width:-16;}#mermaid-svg-FHt2OZYUKYysGKjm .section-10 line{stroke:hsl(30, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled,#mermaid-svg-FHt2OZYUKYysGKjm .disabled circle,#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:lightgray;}#mermaid-svg-FHt2OZYUKYysGKjm .disabled text{fill:#efefef;}#mermaid-svg-FHt2OZYUKYysGKjm .section-root rect,#mermaid-svg-FHt2OZYUKYysGKjm .section-root path,#mermaid-svg-FHt2OZYUKYysGKjm .section-root circle,#mermaid-svg-FHt2OZYUKYysGKjm .section-root polygon{fill:hsl(240, 100%, 46.2745098039%);}#mermaid-svg-FHt2OZYUKYysGKjm .section-root text{fill:#ffffff;}#mermaid-svg-FHt2OZYUKYysGKjm .section-root span{color:#ffffff;}#mermaid-svg-FHt2OZYUKYysGKjm .section-2 span{color:#ffffff;}#mermaid-svg-FHt2OZYUKYysGKjm .icon-container{height:100%;display:flex;justify-content:center;align-items:center;}#mermaid-svg-FHt2OZYUKYysGKjm .edge{fill:none;}#mermaid-svg-FHt2OZYUKYysGKjm .mindmap-node-label{dy:1em;alignment-baseline:middle;text-anchor:middle;dominant-baseline:middle;text-align:center;}#mermaid-svg-FHt2OZYUKYysGKjm :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

AGI核心挑战

因果推理

关联层级

干预层级

反事实层级

世界模型

物理世界模拟

长时程预测

具身交互验证

持续学习

避免灾难性遗忘

知识积累与更新

元学习能力

价值对齐

人类偏好学习

价值体系稳定性

可纠正性

系统架构

模块化与组合性

神经符号融合

能效与可持续性

8.2 具身智能与世界模型

具身智能(Embodied AI)是通向AGI的重要路径之一。其核心假设是:真正的智能需要通过与物理世界的交互来发展,而非仅仅从文本数据中学习。2025年在长任务连贯性方面取得了显著进展,最新模型能够自主运行约30分钟,但这仍然远低于实际应用所需的数小时乃至数天的自主运行能力。

具身智能的技术栈包括感知(Perception)、规划(Planning)、控制(Control)和学习(Learning)四个层次。感知层通过视觉、触觉和本体感觉传感器获取环境信息;规划层基于世界模型生成行动策略;控制层将高层策略转化为低层电机指令;学习层则通过与环境的交互持续优化世界模型和策略。

世界模型是具身智能的核心组件。一个理想的世界模型应当能够:

s

^

t

+

1

=

f

θ

(

s

t

,

a

t

)

\\hat{s}_{t+1} = f_\\theta(s_t, a_t)

s^t+1=fθ(st,at)

其中

s

t

s_t

st 为当前状态,

a

t

a_t

at 为当前动作,

s

^

t

+

1

\\hat{s}_{t+1}

s^t+1 为预测的下一状态,

f

θ

f_\\theta

fθ 为世界模型。然而,在高维连续状态空间中精确预测下一状态是极其困难的。当前的方法通常在隐空间(Latent Space)中构建世界模型,以降低预测的维度和复杂度:

z

^

t

+

1

=

g

θ

(

z

t

,

a

t

)

,

z

t

=

Enc

(

s

t

)

,

s

^

t

+

1

=

Dec

(

z

^

t

+

1

)

\\hat{z}_{t+1} = g_\\theta(z_t, a_t), \\quad z_t = \\text{Enc}(s_t), \\quad \\hat{s}_{t+1} = \\text{Dec}(\\hat{z}_{t+1})

z^t+1=gθ(zt,at),zt=Enc(st),s^t+1=Dec(z^t+1)

2025年发表在ResearchGate上的综述"A Survey of Embodied World Models"系统梳理了具身世界模型的最新进展,提出了新的技术分类体系,并指出当前世界模型在长期预测精度、分布外泛化和多模态融合方面仍面临重大挑战。

2026年4月,Generalist AI发布的GEN-1模型展示了具身基础模型的缩放潜力——在多个任务上达到了99%以上的成功率,任务完成速度最高提升3倍。SAE 2026世界大会上的"Embodied AI in Action"专题讨论也表明,具身AI正在从学术研究走向工业应用,特别是在自动驾驶、工业机器人和家庭服务机器人领域。

8.3 神经符号融合:连接主义与符号主义的再统一

AI研究的两大传统——连接主义(Connectionism)和符号主义(Symbolism)——长期以来被视为对立的范式。连接主义以神经网络为代表,强调从数据中学习;符号主义以逻辑推理为代表,强调基于规则的推理。然而,2025年以来的研究趋势表明,两者的融合可能是通向AGI的关键。

神经符号融合(Neuro-symbolic Integration)的核心动机在于:纯连接主义方法在泛化性、可解释性和数据效率方面存在根本局限,而纯符号主义方法在鲁棒性和可扩展性方面同样不足。融合方法试图将神经网络的学习能力与符号系统的推理能力相结合,实现"1+1>2"的效果。

当前神经符号融合的主要方法包括:

神经定理证明(Neural Theorem Proving):使用神经网络引导定理证明器的搜索策略,如AlphaProof和AlphaGeometry。2025年,AI在国际数学奥林匹克(IMO)级别的问题上取得了突破性进展,部分归功于神经搜索与符号验证的结合。

概率编程(Probabilistic Programming):将概率模型与编程语言结合,使模型能够表达和处理不确定性。概率编程语言(如Pyro、ProbLog)为神经符号系统提供了统一的推理框架。

可微推理(Differentiable Reasoning):将逻辑推理过程转化为可微计算图,使推理步骤可以通过梯度下降优化。这种方法在视觉推理和自然语言推理任务中展现出潜力。

8.4 可持续AI:效率与公平的双重挑战

AI的快速发展带来了两个不容忽视的可持续性挑战:环境可持续性和社会公平性。

在环境方面,大模型的训练和推理消耗大量电力和水资源。2025年,大型AI训练中心的电力需求已引起全球关注,多个国家开始评估AI基础设施对电网和碳排放的影响。模型压缩(如量化、剪枝、知识蒸馏)、高效架构设计(如Mamba、混合专家模型MoE)和绿色计算实践成为缓解环境压力的重要方向。混合专家模型(Mixture of Experts, MoE)通过只激活与输入相关的部分参数来降低推理成本:

MoE

(

x

)

=

i

=

1

N

g

i

(

x

)

E

i

(

x

)

\\text{MoE}(x) = \\sum_{i=1}^{N} g_i(x) \\cdot E_i(x)

MoE(x)=i=1Ngi(x)Ei(x)

其中

g

i

(

x

)

g_i(x)

gi(x) 为门控函数(通常为稀疏的,只选择Top-K个专家),

E

i

(

x

)

E_i(x)

Ei(x) 为第

i

i

i 个专家网络的输出。MoE架构使模型总参数量可以非常大(如万亿级),但每次推理只激活其中一小部分,从而在保持模型能力的同时显著降低计算成本。

在社会公平方面,AI红利的分配极不均衡。斯坦福HAI 2026年报告指出,美国AI私人投资是中国的23倍以上,全球南方国家在AI发展中进一步边缘化。AI对劳动力市场的影响也呈现分化态势:早期职业工作者在AI暴露度高的岗位(如软件开发、客户支持)中经历了显著的就业冲击,而高级职位的受影响程度相对较小。确保AI发展的包容性和公平性,不仅是伦理要求,也是AI技术可持续发展的社会基础。

8.5 未来展望

站在2026年5月的时间节点上,人工智能正处于一个充满机遇与挑战的十字路口。一方面,大语言模型的推理能力突破、多模态融合的深化、智能体AI的崛起和AI for Science的加速,共同推动着AI向更强大、更通用、更实用的方向演进;另一方面,安全对齐的深层困境、全球治理的碎片化、算力需求的不可持续性和社会公平的缺失,提醒我们技术进步本身并不等同于人类福祉的增进。

未来数年,以下几个方向值得特别关注:

第一,推理能力的持续突破。从o1到DeepSeek R1,推理模型证明了"以计算换精度"的可行性。未来,推理时计算的效率优化、多步推理的可靠性保障和跨领域推理的泛化能力将是关键研究方向。

第二,世界模型与具身智能的融合。2026年有望成为大世界模型为机器人技术奠定基础的关键年份。视觉-语言-行动(Vision-Language-Action, VLA)模型的统一训练将推动具身智能从实验室走向现实世界。

第三,AI治理的全球协调。EU AI Act的全面实施将为全球AI治理提供重要经验,但各国治理路径的差异和监管套利的风险要求建立更有效的国际协调机制。

第四,可持续AI的技术创新。从模型架构到训练算法,从硬件设计到数据中心运营,AI全链条的效率优化将成为与规模扩张同等重要的优先事项。

人工智能的未来,不仅取决于算法的进步和算力的增长,更取决于我们能否构建一个技术发展与社会福祉相协调的生态系统。这需要研究者、工程师、政策制定者和公众的共同努力——确保AI的力量被用于扩展人类的能力,而非替代人类的判断;增进人类的福祉,而非加剧社会的不平等。


参考文献

  • Zhao W X, Zhou K, Li J, et al. A Survey of Large Language Models. arXiv preprint arXiv:2303.18223, 2023. 链接

  • Mialon G, Fourrier R, Swift C, et al. Augmented Language Models: a Survey. Transactions on Machine Learning Research, 2023. 链接

  • Acharya J, Kuppan A, et al. Agentic AI: Autonomous Intelligence for Complex Goals—A Comprehensive Survey. IEEE Access, 2025. 链接

  • DeepSeek-AI et al. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv preprint arXiv:2501.12948, 2025. 链接

  • Song Y, Zhang J, et al. Alignment and Safety in Large Language Models. arXiv preprint arXiv:2507.19672, 2025. 链接

  • Stanford HAI. The 2026 AI Index Report. Stanford University, 2026. 链接

  • Hoffmann J, Borgeaud S, Mensch A, et al. Training Compute-Optimal Large Language Models. NeurIPS 2022 (Chinchilla). 链接

  • Wu J, Yang S, et al. A Comprehensive Survey and Guide to Multimodal Large Language Models. arXiv preprint arXiv:2411.06284, 2024. 链接

  • Kaplan J, McCandlish S, Henighan T, et al. Scaling Laws for Neural Language Models. arXiv preprint arXiv:2001.08361, 2020. 链接

  • Gu A, Dao T. Mamba: Linear-Time Sequence Modeling with Selective State Spaces. Conference on Neural Information Processing Systems, 2023. 链接

  • 赞(0)
    未经允许不得转载:171主机测评 » 2026年5月20日最新人工智能发展报告:从大模型到智能体的范式跃迁
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址