RAG:给 AI 外挂一个"随查随用"的资料库
一句话结论:先检索、后生成:让模型开卷考试
读之前建议先懂: LLM 是如何思考的?一切从"预测下一个词"开始、上下文窗口:AI 的"工作记忆"为什么有限,又为什么越来越不够用
当前判断
- 检索质量决定上限——捞错资料,答得再流畅也是错。
- RAG 大幅减少幻觉,但不消灭它。
- 知识可更新、可溯源、成本远低于微调。
一句话结论
RAG(检索增强生成)= 先检索、后生成:回答前先把相关资料从你的知识库里捞出来塞进上下文,让模型”开卷考试”而不是凭记忆答题。这个思路 2020 年被正式提出并命名(Patrick Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, NeurIPS 2020),如今已是知识库类应用的事实标准架构。
逻辑链
模型知识冻结在训练截止日(见 01-llm是如何思考的)→ 你的私域知识它根本没见过 → 硬问必幻觉(见 04-幻觉)→ 把资料切块 → 用语义相似度找出相关几块 → 塞进上下文窗口 → 模型依据给定资料作答 → 答案可溯源、幻觉锐减
展开
1. 核心零件:Embedding(语义坐标)
每段文字被转成一串数字(向量),语义相近的文本在数学上距离也近。“公司报销流程”和”差旅费怎么报”字面不同、向量相近——这是比关键词搜索聪明的根本原因。
2. 一份资料的一生
你的文档 → 切成小块(chunk)→ 逐块算 Embedding 存入向量库 → 用户提问时,问题也算 Embedding → 找出最相近的 Top-K 块 → 和问题一起交给模型 → 模型被要求”只依据这些资料回答”。
3. 为什么 RAG 是企业/个人知识库的默认答案
- 知识可更新:换文档就行,不用重新训练模型
- 可溯源:答案能附”来自第 N 份文档”,方便核查
- 省成本:对比微调便宜几个数量级(见 07-微调-RAG-提示词)
- 代价:检索质量决定上限——“捞错了资料,答得再流畅也是错”是 RAG 最常见的失败方式
决策规则
| 条件(IF) | 动作(THEN) |
|---|---|
| 要建知识库、补私有/时效知识 | 先上 RAG,不要先想微调(见 07-微调-RAG-提示词) |
| RAG 答得不对 | 先查”捞到了什么”——八成是检索没命中,不是模型不行 |
| 资料里根本没有答案 | 提示词必须写”没有就说没有”,否则它照样编 |
常见误区
- ❌ “RAG 消灭幻觉” —— 是大幅减少;资料里没有答案时模型仍可能自由发挥,提示词里要保留”没有就说没有”
- ❌ “文档扔进去就能用” —— 切块大小、清洗质量、元数据都影响检索命中率;垃圾进垃圾出
- ❌ “RAG 和微调二选一” —— 常配合使用:RAG 管知识、微调管风格(见 07-微调-RAG-提示词)
现在就能做的事
- 零代码体验:把一份 PDF 丢进支持”知识库/文件问答”的 AI 产品,问几个文档里没有的问题,观察它是否老实说”未提及”——这是检验 RAG 质量的快招(也是 10-AI工具选型五步法 第 3 步)
- 本项目即活例:luojiai-project 的
raw/ → wiki/目录就是人工版 RAG 管线
相关页面
- 02-上下文窗口 — RAG 本质是”往窗口里精准塞资料”
- 04-幻觉 — RAG 是工程上的主防线
- 07-微调-RAG-提示词 — 三种改造方式的选型对比
- 08-MCP — MCP 让”检索”从插件变成标准接口
出处与置信度
| 引用点 | 出处 | 类型 | 核验 |
|---|---|---|---|
| RAG 架构的提出与命名、在知识密集型任务上的效果 | Patrick Lewis, Ethan Perez, Aleksandra Piktus, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020. arXiv:2005.11401 | [论文] | ✅ 已核验 2026-09-26 |
| Embedding 把语义变成可计算的距离关系 | 业界共识(稠密向量检索为领域公共知识) | [共识] | ✅ 机制稳定 |
| “知识可更新/可溯源/成本远低于微调” | 由 07-微调-RAG-提示词 三条路对比推导 | [推导] | ✅ 与 07 页一致 |
| 本项目即人工版 RAG 管线 | 本站实证:luojiai-project 的 raw/ → wiki/ 流程 | [推导](本站实证) | ✅ |
延伸阅读:各家向量库与 RAG 产品文档(迭代快,发布前实地核验)。