Agent 基本范式
一句话定位:Agent 的基本范式是感知 → 规划 → 执行 → 观察的闭环,而 ReAct 是这个闭环在 LLM 上的具体实现——让模型把”思考”和”行动”显式交替写出来,使决策过程可追踪、可干预。
1. 感知-规划-执行-观察闭环
- 感知(Perceive):接收当前任务、历史上下文、工具返回的观察结果,构成”当前状态”。
- 规划(Plan):基于当前状态决定下一步做什么(可能是直接回答,也可能是调用某个工具)。
- 执行(Act):真正调用工具/执行动作。
- 观察(Observe):拿到执行结果,反馈回感知环节,进入下一轮循环,直到任务完成或达到终止条件。
这个循环本质上和经典 AI 里的 Agent 定义(感知环境、决策、作用于环境)一致,只是”环境”换成了”工具 + 上下文”。
2. ReAct:让”思考”显式化
- 传统做法是模型直接输出最终答案(Act-only)或先长篇推理再给答案(Reason-only),两者都不利于纠错与追踪。
- ReAct(Reasoning + Acting):让模型交替输出
Thought(推理这一步该做什么)→Action(调用哪个工具、参数是什么)→Observation(工具返回结果)→ 下一轮Thought……直到给出Final Answer。 - 好处:
- 可追踪:每一步”为什么这么做”都写在 Thought 里,出错时能定位是哪一步推理错了还是工具调用错了。
- 可干预:可以在任意 Thought/Action 之间插入人工审核(对应 7.7 的 Human-in-the-loop)。
- 减少幻觉:把”凭空编答案”变成”基于真实 Observation 逐步推进”,降低模型编造事实的概率。
3. 面试落点
- 能画出这个闭环图,并指出 ReAct 相比”直接输出答案”多了哪些环节、解决了什么问题(可追踪性、可干预性)。
- 可迁移话术:这个闭环和大数据里的”任务调度器观察任务状态 → 决定下一步调度动作 → 执行 → 再观察”的思路是同构的,只是决策主体从规则/调度算法换成了 LLM。
参考:论文《ReAct: Synergizing Reasoning and Acting in Language Models》(Yao et al., 2022)