Agent 技术综述:从大语言模型到自主智能体
作者视角:人工智能科学家 / 系统研究者
一、引言:为什么 Agent 成为 AI 的下一阶段
在大语言模型(LLM)取得突破性进展之后,人工智能研究的重心正在从“会说话的模型”转向“会做事的系统”。单次 Prompt → 单次 Response 的范式,已经无法满足真实世界中 多步骤任务、长期目标、工具协作、环境交互 等复杂需求。
在这一背景下,Agent(智能体)成为连接“模型能力”与“现实任务”的关键技术形态。
简要来说:
LLM 是大脑,Agent 是有行动力的个体。
Agent 并非单一算法,而是一套系统范式(System Paradigm),其核心目标是:
让模型具备 感知 → 推理 → 规划 → 行动 → 反思 的闭环能力。
二、Agent 的定义与核心特征
2.1 经典定义
在人工智能领域,Agent 通常被定义为:
一个能够感知环境,并通过行动改变环境,以最大化某种目标函数的实体。
在 LLM 时代,这一定义被扩展为:
以大语言模型为认知核心,结合记忆、工具、规划与反馈机制的自主决策系统。
2.2 Agent 的五大核心能力
感知(Perception)
-
输入文本、图像、语音、状态信息
-
在多模态 Agent 中尤为重要
推理(Reasoning)
-
基于上下文进行分析、归因与假设
-
常见形式:CoT、ToT、Graph-of-Thought
规划(Planning)
-
将复杂目标拆解为可执行子任务
-
支持动态调整与条件分支
行动(Action / Tool Use)
-
调用 API、执行代码、搜索、写文件
-
行动空间是 Agent 与 LLM 的核心分水岭
反思(Reflection / Learning)
-
对失败与结果进行总结
-
更新记忆或策略
三、Agent 技术演进脉络
3.1 规则 Agent → 强化学习 Agent
-
早期 Agent:
-
基于 FSM / Rule-based System
-
可解释性强,但泛化能力弱
-
-
强化学习 Agent:
-
AlphaGo、DQN
-
优点:策略最优性
-
缺点:样本效率低、任务泛化差
-
3.2 LLM Agent 的出现(2022–至今)
LLM 的出现带来了关键变化:
-
推理能力内置于模型中
-
规划不再依赖显式搜索算法
-
自然语言成为通用中间表示
代表性工作:
-
ReAct(Reason + Act)
-
AutoGPT
-
BabyAGI
-
Voyager
四、LLM Agent 的典型架构
4.1 基础单 Agent 架构
┌─────────┐
│ Memory │◄──────┐
└────┬────┘ │
│ │
┌────▼────┐ ┌───▼────┐
│ LLM │──►│ Planner │
└────┬────┘ └───┬────┘
│ │
┌────▼────┐ ┌───▼────┐
│ Tools │◄──│ Executor│
└─────────┘ └────────┘
4.2 关键模块解析
(1)Planner(规划器)
-
将目标拆解为步骤
-
常见 Prompt 形态:
-
“请列出完成任务的步骤”
-
“如果失败,如何调整计划”
-
(2)Executor(执行器)
-
严格按照子任务调用工具
-
常见问题:幻觉式工具调用
(3)Memory(记忆系统)
-
短期记忆:Context Window
-
长期记忆:
-
Vector DB
-
Episodic Memory
-
五、推理与规划技术
5.1 Chain-of-Thought(CoT)
-
线性推理链
-
优点:简单、有效
-
缺点:不可回溯
5.2 Tree / Graph-of-Thought
-
并行探索多条推理路径
-
适用于复杂决策
-
计算成本高
5.3 Planning as Prompting
-
用自然语言表示“计划”
-
本质:
让 LLM 在 token 空间中模拟搜索
六、Multi-Agent 系统
6.1 为什么需要多 Agent
单 Agent 的瓶颈:
-
上下文受限
-
自我审查能力弱
多 Agent 优势:
-
分工协作
-
对抗与辩论
-
集体智能涌现
6.2 典型模式
Role-based Agent
-
Planner / Coder / Critic
Debate Agent
-
多模型投票
Society of Agents
-
模拟组织结构
七、Agent 的评测挑战
7.1 为什么传统 Benchmark 失效
-
单轮问答 ≠ 多步行为
-
正确答案 ≠ 好策略
7.2 新型评测维度
-
Task Success Rate
-
Tool Efficiency
-
Recovery Ability
-
Robustness under Perturbation
7.3 LLM-as-Judge
-
用模型评估模型
-
风险:
-
Bias
-
Reward Hacking
-
八、工程化挑战
可控性(Alignment)
成本与延迟
安全性(Tool Abuse)
可观测性与回放(Tracing / Replay)
LangGraph、AutoGen 等框架正在尝试解决这些问题。
九、未来研究方向
World Model + Agent
Self-Evolving Agent
Human-in-the-loop Agent
Agent × Robotics
Agent 的形式化理论
十、结语
Agent 并不是“给 LLM 套壳”,而是:
一次从模型中心主义 → 行为系统中心主义的范式转移。
它要求我们同时理解:
-
语言
-
推理
-
系统
-
工程
-
人类协作
未来的 AI,需要更可靠的 Agent 系统。





