👨⚕️ 主页: gis分享者 👨⚕️ 感谢各位大佬 点赞👍 收藏⭐ 留言📝 加关注✅! 👨⚕️ 收录于专栏:AI大模型原理和应用面试题 
文章目录
- 一、🍀回答重点
- 二、🍀扩展知识
-
- 2.1 ☘️ReAct 的工程实现
- 2.2 ☘️ReAct 的局限性
- 2.3 ☘️ReAct vs Plan-and-Execute
- 2.4 ☘️从 ReAct 到 Reflexion
- 三、🍀面试官追问
一、🍀回答重点
**ReAct(Reasoning + Acting)**是 2022 年由 Google 和普林斯顿大学提出的一种让大模型交替进行推理和行动的范式。核心思路是:让模型在执行每一步操作之前,先用自然语言\”想一想\”为什么要这么做,然后再去做,做完之后再根据结果\”想一想\”下一步该怎么办。
在 ReAct 出现之前,推理和行动是分开的。Chain-of-Thought 让模型一步步推理,但只停留在\”想\”的层面,不能真正去做事。纯 Action 模式让模型直接输出工具调用,但不会解释为什么这么做,出了问题也很难排查。
ReAct 把两者结合起来了。一个典型的 ReAct 步骤:Thought(我需要查一下用户提到的这个公司的最新财报)→ Action(调用搜索工具,关键词\”XX 公司 202x 年 Q1 财报\”)→ Observation(搜索返回了以下结果…)→ Thought(根据搜索结果,营收同比增长 15%,我现在可以回答用户了)。
这种范式让 Agent 更可靠的原因有两个。第一,推理过程是显式的,每一步决策都有 trace 可查,出了问题容易定位是哪一步推理出了偏差。第二,模型会基于观察结果动态调整策略,而不是一开始就制定一个死板的计划然后盲目执行。某个工具调用结果不符合预期,模型可以在下一个 Thought 中立刻调整方向。



