Agent 的逻辑:从"会聊天"到"会干活"差了哪几层

一句话结论:LLM + 工具调用 + 循环;聊天给答案,Agent 给结果

读之前建议先懂: LLM 是如何思考的?一切从"预测下一个词"开始、提示词的逻辑:为什么"怎么说"比"问什么"更能决定答案质量

当前判断

  1. 区别在”输出能否变成动作”——模型决策,系统执行。
  2. 错误会滚雪球:第 2 步的幻觉会成为第 5 步的”事实”。
  3. 三个真实瓶颈:工具质量、上下文管理、验证闭环。

一句话结论

Agent = LLM + 工具调用 + 循环:模型不再直接吐答案,而是”思考 → 调用工具 → 看结果 → 再思考”,直到把任务干完。聊天是给答案,Agent 是给结果。

逻辑链

普通对话:一次预测就结束 → Agent 把预测结果变成”动作指令”(搜索/写文件/调 API)→ 系统执行动作,把结果喂回上下文 → 模型基于新信息继续预测 → 循环直至任务完成 → 这就是 ReAct(推理+行动交替)的基本形态(Shunyu Yao, Jeffrey Zhao, Dian Yu, et al., ReAct: Synergizing Reasoning and Acting in Language Models, ICLR 2023)

展开

1. 差异就在”输出能否变成动作”

普通对话输出 Token 给人看;Agent 的输出是结构化的工具调用请求(工具名 + 参数),由外层系统真正执行。模型负责决策”调什么”,系统负责”执行什么”——权责分离。

2. 循环带来的能力与风险

能力:多步任务(查资料→整理→写报告→存文件)可以自主串联,人只给目标不给步骤。 风险:错误会滚雪球——第 2 步的幻觉会成为第 5 步的”事实”。所以成熟 Agent 系统都有护栏:步数上限、费用上限、关键动作人工确认。

3. Agent 质量的三个真实瓶颈

  1. 工具质量:模型再强,工具描述写得烂它也用不对(工具的”说明书”就是给模型的提示词,见 03-提示词的逻辑)
  2. 上下文管理:多步循环会迅速吃满窗口(见 02-上下文窗口),需要主动总结/丢弃策略
  3. 验证闭环:没有”检查自己成果”手段的 Agent,产出不可信

决策规则

条件(IF)动作(THEN)
想上 Agent先确认有可调用的工具;没有工具 = 没有 Agent
Agent 跑很多步必设三道护栏:步数上限、费用上限、写操作人工确认
Agent 产出不可信先补”验证闭环”(让它检查自己的成果),再考虑换模型

常见误区

现在就能做的事

相关页面

出处与置信度

引用点出处类型核验
ReAct 范式:推理与行动交替、可缓解幻觉与错误传播Shunyu Yao, Jeffrey Zhao, Dian Yu, et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023. arXiv:2210.03629[论文]✅ 已核验 2026-09-26
“输出能否变成动作”是 Agent 与聊天的分界由 01-llm是如何思考的 + 工具调用机制推导[推导]✅ 机制稳定
三个瓶颈(工具质量/上下文/验证闭环)工程实践共识 + 本页整理[共识]⚠️ 实践总结,非实验结论
具体 Agent 产品的能力与案例数据各产品官方文档[官方文档]⚠️ 待核验:迭代极快

延伸阅读:Anthropic, Building Effective Agents(工程博客,发布前建议实地访问补链接)。