LLM 是如何思考的?一切从"预测下一个词"开始
一句话结论:模型只做一件事:按上文预测下一个词
当前判断
- 它不查答案,它在算概率。
- 能预测复杂文本的下一个词,隐含着必须理解这段文本。
- 上文跑偏,下文一路跑偏——它太信自己。
一句话结论
大语言模型(LLM)做的唯一一件事,是根据上文预测下一个词的概率——所有看似”思考”的能力,都是从这一个简单动作里层层叠加出来的。
逻辑链
文字被切成 Token → 模型把 Token 变成数字向量 → 几十层网络计算”每个候选词的概率” → 选出下一个词 → 把它接回上文重复此过程 → 海量训练让”预测”逐步逼近”理解” → 涌现出推理、写作、写代码等能力
展开
1. 它不是检索,是计算概率
很多人以为 ChatGPT 背后有个”答案库”,其实没有。模型内部是数千亿个参数(可以理解为 knobs 旋钮),训练过程就是不断调整这些旋钮,让”给定上文 → 预测下一个词”的错误越来越小——这个”读上文、输出下一个词”的架构就是 Transformer(Ashish Vaswani et al., Attention Is All You Need, NeurIPS 2017)。训练数据是互联网规模的文本,于是语言中的规律——语法、事实、风格、甚至逻辑关系——都被压缩进了这些参数里。
2. “智能”是副产品,但不是幻觉
早期研究者认为预测下一个词只能学会”语言表面”,学不会推理。实践证明错了:要把一段数学推理的后半句预测对,模型内部必须先”算出”前半段的逻辑。能预测复杂文本的下一个词,隐含着需要理解这段文本。这就是所谓”涌现能力”的来源。
3. 自回归:一个词一个词地往外蹦
LLM 生成文字是逐 Token 进行的:每生成一个词,把它接到上文,再预测下一个。这解释了很多日常现象——为什么 AI 打字是一个词一个词往外冒、为什么前几句话跑偏会一路跑偏(它太”信”自己的上文了)、为什么让它”先想再答”(思维链)效果好(给后面的预测铺了更好的上文)。
决策规则
| 条件(IF) | 动作(THEN) |
|---|---|
| 想知道”AI 能不能做到 X” | 先问:X 能否还原成”预测下一个词”?能 → 大概率可以;不能(如精确计算、实时事实)→ 别指望模型本身 |
| 答案开头就跑偏 | 别往下续,直接重开一轮并改写上文——自回归不会自我纠错 |
常见误区
- ❌ “AI 有一个数据库在查答案” —— 没有,事实知识以参数权重形式分布式存储,所以会有”记混”的时候(见 04-幻觉)
- ❌ “AI 真的像人一样思考” —— 机制完全不同:人是概念驱动,模型是概率驱动;但输出效果上有重叠区间
- ❌ “模型联网了才聪明” —— 联网搜索是外挂功能(见 05-RAG),模型本身的知识冻结在训练截止日
现在就能做的事
- 在任意 AI 对话里输入”请一步一步思考”,对比输出质量——直观体验”上文质量决定下文质量”
- 观察打字机式的逐词输出,理解自回归过程
相关页面
- 02-上下文窗口 — 预测的”视野”有多大,决定它记得多少
- 04-幻觉 — 概率驱动的必然代价
- 09-token与计费逻辑 — Token 不仅是原理单位,也是计费单位
出处与置信度
| 引用点 | 出处 | 类型 | 核验 |
|---|---|---|---|
| Transformer 架构、注意力机制 | Ashish Vaswani, Noam Shazeer, Niki Parmar, et al. Attention Is All You Need. NeurIPS 2017. arXiv:1706.03762 | [论文] | ✅ 已核验 2026-09-26 |
| 自回归逐 Token 生成、知识以参数权重分布式存储 | 业界共识(自 2017 年 Transformer 起为领域公共知识,无单一出处) | [共识] | ✅ 机制稳定 |
| “能预测复杂文本隐含必须理解” | 由本页机制推导(非实验结论,属解释性判断) | [推导] | ⚠️ 定性表述 |
延伸阅读(非本页主张的依据,仅供深入):
- Andrej Karpathy, [Intro to Large Language Models](YouTube 公开课,约 1 小时)
- 3Blue1Brown, But what is a GPT? 视频系列(可视化讲 Transformer)
本页为全站地基页:02-上下文窗口、03-提示词的逻辑、04-幻觉、09-token与计费逻辑 均由本页机制推导而来。