LLM 是如何思考的?一切从"预测下一个词"开始

一句话结论:模型只做一件事:按上文预测下一个词

当前判断

  1. 它不查答案,它在算概率。
  2. 能预测复杂文本的下一个词,隐含着必须理解这段文本。
  3. 上文跑偏,下文一路跑偏——它太信自己。

一句话结论

大语言模型(LLM)做的唯一一件事,是根据上文预测下一个词的概率——所有看似”思考”的能力,都是从这一个简单动作里层层叠加出来的。

逻辑链

文字被切成 Token → 模型把 Token 变成数字向量 → 几十层网络计算”每个候选词的概率” → 选出下一个词 → 把它接回上文重复此过程 → 海量训练让”预测”逐步逼近”理解” → 涌现出推理、写作、写代码等能力

展开

1. 它不是检索,是计算概率

很多人以为 ChatGPT 背后有个”答案库”,其实没有。模型内部是数千亿个参数(可以理解为 knobs 旋钮),训练过程就是不断调整这些旋钮,让”给定上文 → 预测下一个词”的错误越来越小——这个”读上文、输出下一个词”的架构就是 Transformer(Ashish Vaswani et al., Attention Is All You Need, NeurIPS 2017)。训练数据是互联网规模的文本,于是语言中的规律——语法、事实、风格、甚至逻辑关系——都被压缩进了这些参数里。

2. “智能”是副产品,但不是幻觉

早期研究者认为预测下一个词只能学会”语言表面”,学不会推理。实践证明错了:要把一段数学推理的后半句预测对,模型内部必须先”算出”前半段的逻辑。能预测复杂文本的下一个词,隐含着需要理解这段文本。这就是所谓”涌现能力”的来源。

3. 自回归:一个词一个词地往外蹦

LLM 生成文字是逐 Token 进行的:每生成一个词,把它接到上文,再预测下一个。这解释了很多日常现象——为什么 AI 打字是一个词一个词往外冒、为什么前几句话跑偏会一路跑偏(它太”信”自己的上文了)、为什么让它”先想再答”(思维链)效果好(给后面的预测铺了更好的上文)。

决策规则

条件(IF)动作(THEN)
想知道”AI 能不能做到 X”先问:X 能否还原成”预测下一个词”?能 → 大概率可以;不能(如精确计算、实时事实)→ 别指望模型本身
答案开头就跑偏别往下续,直接重开一轮并改写上文——自回归不会自我纠错

常见误区

现在就能做的事

相关页面

出处与置信度

引用点出处类型核验
Transformer 架构、注意力机制Ashish Vaswani, Noam Shazeer, Niki Parmar, et al. Attention Is All You Need. NeurIPS 2017. arXiv:1706.03762[论文]✅ 已核验 2026-09-26
自回归逐 Token 生成、知识以参数权重分布式存储业界共识(自 2017 年 Transformer 起为领域公共知识,无单一出处)[共识]✅ 机制稳定
“能预测复杂文本隐含必须理解”由本页机制推导(非实验结论,属解释性判断)[推导]⚠️ 定性表述

延伸阅读(非本页主张的依据,仅供深入):

本页为全站地基页:02-上下文窗口、03-提示词的逻辑、04-幻觉、09-token与计费逻辑 均由本页机制推导而来。