RAG:给 AI 外挂一个"随查随用"的资料库

一句话结论:先检索、后生成:让模型开卷考试

读之前建议先懂: LLM 是如何思考的?一切从"预测下一个词"开始、上下文窗口:AI 的"工作记忆"为什么有限,又为什么越来越不够用

当前判断

  1. 检索质量决定上限——捞错资料,答得再流畅也是错。
  2. RAG 大幅减少幻觉,但不消灭它。
  3. 知识可更新、可溯源、成本远低于微调。

一句话结论

RAG(检索增强生成)= 先检索、后生成:回答前先把相关资料从你的知识库里捞出来塞进上下文,让模型”开卷考试”而不是凭记忆答题。这个思路 2020 年被正式提出并命名(Patrick Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, NeurIPS 2020),如今已是知识库类应用的事实标准架构。

逻辑链

模型知识冻结在训练截止日(见 01-llm是如何思考的)→ 你的私域知识它根本没见过 → 硬问必幻觉(见 04-幻觉)→ 把资料切块 → 用语义相似度找出相关几块 → 塞进上下文窗口 → 模型依据给定资料作答 → 答案可溯源、幻觉锐减

展开

1. 核心零件:Embedding(语义坐标)

每段文字被转成一串数字(向量),语义相近的文本在数学上距离也近。“公司报销流程”和”差旅费怎么报”字面不同、向量相近——这是比关键词搜索聪明的根本原因。

2. 一份资料的一生

你的文档 → 切成小块(chunk)→ 逐块算 Embedding 存入向量库 → 用户提问时,问题也算 Embedding → 找出最相近的 Top-K 块 → 和问题一起交给模型 → 模型被要求”只依据这些资料回答”。

3. 为什么 RAG 是企业/个人知识库的默认答案

决策规则

条件(IF)动作(THEN)
要建知识库、补私有/时效知识先上 RAG,不要先想微调(见 07-微调-RAG-提示词)
RAG 答得不对先查”捞到了什么”——八成是检索没命中,不是模型不行
资料里根本没有答案提示词必须写”没有就说没有”,否则它照样编

常见误区

现在就能做的事

相关页面

出处与置信度

引用点出处类型核验
RAG 架构的提出与命名、在知识密集型任务上的效果Patrick Lewis, Ethan Perez, Aleksandra Piktus, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020. arXiv:2005.11401[论文]✅ 已核验 2026-09-26
Embedding 把语义变成可计算的距离关系业界共识(稠密向量检索为领域公共知识)[共识]✅ 机制稳定
“知识可更新/可溯源/成本远低于微调”由 07-微调-RAG-提示词 三条路对比推导[推导]✅ 与 07 页一致
本项目即人工版 RAG 管线本站实证:luojiai-project 的 raw/ → wiki/ 流程[推导](本站实证)✅

延伸阅读:各家向量库与 RAG 产品文档(迭代快,发布前实地核验)。