一、Scaling Law(规模定律)
Scaling Law是过去几年大模型成功的核心指导原则——更大的模型、更多的数据、更强的算力,带来更好的性能。
1.1 什么是Scaling Law
在一定范围内,模型性能随着计算量、数据量、参数量的增加而可预测地提升。
最早由OpenAI在2020年系统阐述:参数量、数据量、计算量扩大N倍,损失值以log(N)方式下降——边际收益递减,但持续投入就会持续提升。
1.2 Chinchilla最优训练法则
2022年DeepMind指出:之前的模型都太大了,数据太少了。
| GPT-3 | 175B | 300B tokens | 模型大,数据相对少 |
| Chinchilla | 70B | 1.4T tokens | 模型小一点,数据多很多 |
| LLaMA 2 | 70B | 2T tokens | 延续Chinchilla思路 |
核心启示:给定计算预算,模型参数量和训练数据量应按比例同步扩大(计算量翻倍,两者各扩约1.4倍)。
1.3 Scaling Law的局限
边际收益递减:性能翻倍可能需要十倍计算投入
能力涌现不可预测:新能力何时出现无法预知
数据瓶颈:高质量文本数据有限
核心洞察:规模不是万能的,但没有规模是万万不能的。
二、混合专家模型(MoE)
MoE让模型变大但不显著增加推理成本——每个token只使用模型中的一小部分参数。
2.1 稠密 vs 稀疏
| 参数总量 | 通常较小 | 可以非常大 |
| 每token使用参数 | 全部参数 | 一小部分专家 |
| 推理成本 | 与参数量成正比 | 相对可控 |
| 代表模型 | GPT-3、LLaMA | Mixtral、GPT-4 |
2.2 Mixtral 8x7B
2023年底Mistral AI发布:8个7B专家,每token选Top-2。
-
总参数量:47B
-
每token实际使用:~14B
-
效果:推理成本≈14B模型,性能≈70B模型
2.3 门控机制
门控网络决定每个token分给哪些专家,本身是可学习的。
核心挑战:负载均衡——防止门控网络总把大多数token分给少数专家。
解决方案:在损失函数中加入负载均衡损失,鼓励专家被均匀使用。
# MoE概念演示:门控网络选择专家
class MoEGate:
def select_experts(self, x):
scores = [expert_score(x) for expert in self.experts]
top_experts = sorted(range(len(scores)), key=lambda i: scores[i], reverse=True)[:self.top_k]
return top_experts # 返回Top-K专家索引
三、长上下文技术
3.1 核心挑战
| 计算复杂度 | Transformer自注意力O(n²),2K→128K计算量增4096倍 |
| 位置编码外推 | 超出训练长度时外推能力差 |
| 记忆效果 | 长文本中"中间内容"容易被忽略 |
3.2 RoPE外推方法
RoPE(旋转位置编码):把位置信息编码为旋转角度,自然编码相对位置。
| YaRN | 精细调整RoPE缩放因子 |
| LongRoPE | 渐进式扩展+微调,4K→128K |
3.3 稀疏注意力与状态空间模型
| 全注意力Transformer | O(n²) | GPT-3、LLaMA |
| 稀疏注意力(滑动窗口) | O(n) | Longformer、Mistral |
| 状态空间模型(Mamba) | O(n) | Mamba、Hyena |
Mamba的突破:选择性状态空间,复杂度O(n),理论上可处理无限长上下文。
四、推理时计算扩展
让模型在推理时也能"思考"更多步,用额外计算换取更好结果。
4.1 o1 / DeepSeek-R1思路
核心思想:让模型先生成"推理思维链",再给出最终答案。
就像做数学题:先在草稿纸上推导,确认正确后再整理答案。
4.2 慢思考 vs 快思考
| 系统1(快思考) | 直觉、快速 | 传统模型一次前向传播 |
| 系统2(慢思考) | 分析、努力思考 | o1等多步推理 |
4.3 推理扩展方法
| 思维链(CoT) | 一步步思考 | 简单有效 | 增加token消耗 |
| Best-of-N | 生成N个答案选最优 | 通用简单 | 成本高 |
| MCTS+LLM | 搜索最优思考路径 | 规划能力强 | 实现复杂 |
五、多模态大模型最新进展
5.1 模型演进
| GPT-4V | 图像理解 | 2023 |
| Gemini 1.0 | 多模态原生 | 2023 |
| Claude 3 | 视觉推理 | 2024 |
| Gemini 1.5 Pro | 长视频理解 | 2024 |
| GPT-4o | 实时多模态交互 | 2024 |
5.2 关键趋势
原生多模态训练:从训练一开始就同时处理文本、图像、音频
流畅交互:语音对话,实时理解图像和视频
视频理解突破:时序注意力,均匀采样关键帧
六、AI Agent研究前沿
6.1 世界模型
Agent对世界的"心理模型"——能回答:"如果我这样做,接下来会发生什么?"
6.2 具身智能(Embodied AI)
在物理或虚拟世界中拥有"身体"的AI:
-
机器人抓取物体
-
Minecraft搭建建筑
-
数字人环境交互
6.3 代码执行能力
代码是Agent的"万能工具":
-
需要计算→写Python
-
需要数据分析→写SQL/Pandas
-
需要自动化→写脚本调用API
核心挑战:如何把大模型的"知识"转化为现实中的"行动"。
七、小样本与零样本学习
7.1 In-Context Learning
不需要修改模型参数,只要在输入里给几个例子,模型就能学会新任务。
工作原理(多种解释):
-
隐式梯度下降
-
任务检索
-
贝叶斯推理
7.2 Instruction Tuning
收集大量"指令-任务"对微调模型,让模型更"听话"。
关键效果:泛化能力——在完全没见过的新任务上也能表现不错。
| 传统监督学习 | 大量标注数据 | 高价值任务 |
| 小样本学习 | 几个例子 | 新任务快速试做 |
| 零样本学习 | 只有指令 | 简单任务 |
| 思维链(CoT) | 带推理的例子 | 复杂推理 |
八、AI与科学发现
8.1 AlphaFold
解决了困扰生物学50年的"蛋白质折叠问题"——几分钟预测3D结构,之前需要几年。
8.2 AI for Mathematics
| 定理证明助手 | 帮助形式化证明 |
| 猜想发现 | 从数学对象中发现模式 |
| 符号推理 | 代数运算、推导 |
8.3 Drug Discovery
AI加速药物开发全流程:靶点发现→分子生成→ADMET预测→合成路线设计。
| 结构生物学 | 蛋白质结构预测 | AlphaFold |
| 数学 | 定理证明、猜想发现 | AlphaTensor |
| 药物开发 | 靶点发现、候选物设计 | 多家临床阶段 |
核心洞察:科学研究本质是"在巨大可能性空间中搜索"——AI擅长的正是海量数据和高维空间中的模式发现。
总结:前沿技术全景
| Scaling Law | 如何持续提升性能 | Chinchilla、LLaMA | 数据效率优化 |
| MoE | 降低大模型推理成本 | Mixtral 8x7B | 更智能的路由 |
| 长上下文 | 处理超长文本 | Mamba、RoPE外推 | 无限上下文 |
| 推理扩展 | 用计算换质量 | o1、Best-of-N | 自适应思考时长 |
| 多模态 | 理解和生成多模态 | GPT-4o、Gemini | 原生多模态 |
| AI Agent | 从"回答"到"行动" | 代码执行、世界模型 | 自主任务完成 |
| 科学发现 | 加速科研进程 | AlphaFold | AI科学家 |
不变的规律:
规模仍在起作用(Scaling Law未失效)
效率创新降低门槛(MoE、稀疏注意力)
推理时能力正在扩展(o1、MCTS)
多模态是不可避免的方向
AI正在从"工具"走向"伙伴"

