Agent 的逻辑:从"会聊天"到"会干活"差了哪几层
一句话结论:LLM + 工具调用 + 循环;聊天给答案,Agent 给结果
读之前建议先懂: LLM 是如何思考的?一切从"预测下一个词"开始、提示词的逻辑:为什么"怎么说"比"问什么"更能决定答案质量
当前判断
- 区别在”输出能否变成动作”——模型决策,系统执行。
- 错误会滚雪球:第 2 步的幻觉会成为第 5 步的”事实”。
- 三个真实瓶颈:工具质量、上下文管理、验证闭环。
一句话结论
Agent = LLM + 工具调用 + 循环:模型不再直接吐答案,而是”思考 → 调用工具 → 看结果 → 再思考”,直到把任务干完。聊天是给答案,Agent 是给结果。
逻辑链
普通对话:一次预测就结束 → Agent 把预测结果变成”动作指令”(搜索/写文件/调 API)→ 系统执行动作,把结果喂回上下文 → 模型基于新信息继续预测 → 循环直至任务完成 → 这就是 ReAct(推理+行动交替)的基本形态(Shunyu Yao, Jeffrey Zhao, Dian Yu, et al., ReAct: Synergizing Reasoning and Acting in Language Models, ICLR 2023)
展开
1. 差异就在”输出能否变成动作”
普通对话输出 Token 给人看;Agent 的输出是结构化的工具调用请求(工具名 + 参数),由外层系统真正执行。模型负责决策”调什么”,系统负责”执行什么”——权责分离。
2. 循环带来的能力与风险
能力:多步任务(查资料→整理→写报告→存文件)可以自主串联,人只给目标不给步骤。 风险:错误会滚雪球——第 2 步的幻觉会成为第 5 步的”事实”。所以成熟 Agent 系统都有护栏:步数上限、费用上限、关键动作人工确认。
3. Agent 质量的三个真实瓶颈
- 工具质量:模型再强,工具描述写得烂它也用不对(工具的”说明书”就是给模型的提示词,见 03-提示词的逻辑)
- 上下文管理:多步循环会迅速吃满窗口(见 02-上下文窗口),需要主动总结/丢弃策略
- 验证闭环:没有”检查自己成果”手段的 Agent,产出不可信
决策规则
| 条件(IF) | 动作(THEN) |
|---|---|
| 想上 Agent | 先确认有可调用的工具;没有工具 = 没有 Agent |
| Agent 跑很多步 | 必设三道护栏:步数上限、费用上限、写操作人工确认 |
| Agent 产出不可信 | 先补”验证闭环”(让它检查自己的成果),再考虑换模型 |
常见误区
- ❌ “Agent = 更聪明的聊天机器人” —— 本质区别是行动力与循环;不接工具的”Agent”只是角色扮演
- ❌ “全自动最好” —— 目前最稳的形态是”人机混合”:AI 干活、人卡关键节点
- ❌ “Agent 能力只取决于模型” —— 工具生态与接口标准(如 08-MCP)至少占一半
现在就能做的事
- 体验一个真 Agent:任一 AI 编程工具(Claude Code / Cursor 等)里给一个多步任务,观察它的”思考→执行→修正”循环
- 设计你自己的第一个 Agent 任务:把”每周整理热点→写早报→存档”拆成工具序列——这正是本项目 TrendRadar 管线的思路
相关页面
- 03-提示词的逻辑 — Agent 的系统提示与工具描述都是提示词工程
- 02-上下文窗口 — 循环是上下文的头号杀手
- 08-MCP — 工具接入的标准化革命
- 09-token与计费逻辑 — Agent 循环会成倍放大 Token 费用
出处与置信度
| 引用点 | 出处 | 类型 | 核验 |
|---|---|---|---|
| ReAct 范式:推理与行动交替、可缓解幻觉与错误传播 | Shunyu Yao, Jeffrey Zhao, Dian Yu, et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023. arXiv:2210.03629 | [论文] | ✅ 已核验 2026-09-26 |
| “输出能否变成动作”是 Agent 与聊天的分界 | 由 01-llm是如何思考的 + 工具调用机制推导 | [推导] | ✅ 机制稳定 |
| 三个瓶颈(工具质量/上下文/验证闭环) | 工程实践共识 + 本页整理 | [共识] | ⚠️ 实践总结,非实验结论 |
| 具体 Agent 产品的能力与案例数据 | 各产品官方文档 | [官方文档] | ⚠️ 待核验:迭代极快 |
延伸阅读:Anthropic, Building Effective Agents(工程博客,发布前建议实地访问补链接)。