微调、RAG、提示词:改造一个 AI 的三条路怎么选
一句话结论:三条路的区别是“改什么”,成本依次飙升,先试便宜的
读之前建议先懂: 提示词的逻辑:为什么"怎么说"比"问什么"更能决定答案质量、RAG:给 AI 外挂一个"随查随用"的资料库
当前判断
- 先问”缺的是知识还是行为”:缺知识走 RAG,缺行为先改提示词。
- 用微调灌易变知识,几乎总是错误选型。
- 三者不是互斥,成熟方案是叠加。
一句话结论
三条路的本质区别是改什么:提示词改”这次的输入”、RAG 改”它看到的资料”、微调改”模型本身”——成本和不可逆程度依次飙升,先试便宜的。
逻辑链
需求出现 → 先问:缺的是”知识”还是”行为”?→ 缺知识(资料/时效)→ RAG(见 05-RAG)→ 缺行为(格式/风格/领域语感)→ 先强化提示词 → 仍不行 → 微调 → 九成场景到 RAG+提示词就结束了
展开
1. 一张决策表
| 你的问题 | 对的路 | 原因 |
|---|---|---|
| 它不知道我们公司的报销制度 | RAG | 私有知识,检索注入即可 |
| 它不知道昨天的新闻 | RAG | 时效知识,微调也不该学(会过时) |
| 输出格式总是不符合规范 | 提示词(模板+示例) | 行为可由上文收窄 |
| 语气/风格要高度定制、提示词写不全 | 微调 | 风格是参数里的分布,示例塞不完 |
| 专业领域术语总用错 | 先 RAG,再考虑微调 | 先查后答通常已解决大半 |
| 让它”更聪明” | 换更强的模型 | 上面三条路都不改变智力上限 |
2. 成本与回报的量级感
- 提示词:几分钟 + 0 元,随时可改
- RAG:数天 + 少量基础设施(向量库/Embedding 费),知识可随时增删
- 微调:数据准备(通常千条级样本)+ 训练费 + 运维,且知识固化、更新要重训——所以”用微调灌知识”几乎总是错误选型
3. 组合才是常态
成熟方案通常是:强模型 + 精修系统提示 + RAG 管知识 + 必要时轻量微调管风格。按”提示词 → RAG → 微调”的顺序逐层加码,每层加码前先量化上一层不够在哪。
决策规则(加码顺序)
| 条件(IF) | 动作(THEN) |
|---|---|
| 效果不好,还没定位原因 | 先花 30 分钟重写提示词,不动架构——多数问题止步于此 |
| 确认缺的是知识/时效 | 加 RAG |
| 确认缺的是风格,且提示词塞不下 | 才考虑轻量微调 |
| 想要”它更聪明” | 上面三条都不解决智力上限,换更强的模型 |
常见误区
- ❌ “微调 = 教会它新知识” —— 微调改变的是行为分布,用它存易变知识既贵又过时得快
- ❌ “微调了就一劳永逸” —— 基座模型升级后,微调成果常要重做
- ❌ “三条路互斥” —— 它们作用在不同层,真正的架构是叠加
现在就能做的事
- 拿你最近的痛点对照决策表定位”缺知识还是缺行为”——多数”效果不好”用提示词重写(见 03-提示词的逻辑)就能救回
- 记录每次失败案例的归因,这就是你自己的选型经验库
相关页面
- 03-提示词的逻辑 / 05-RAG — 前两层详解
- 04-幻觉 — 微调不能根治幻觉,别为此微调
- 10-AI工具选型五步法 — 把这套判断用在选工具上
出处与置信度
| 引用点 | 出处 | 类型 | 核验 |
|---|---|---|---|
| RAG 作为知识注入手段的定位与效果 | Patrick Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020. arXiv:2005.11401 | [论文] | ✅ 已核验 2026-09-26 |
| 提示词改”输入”、RAG 改”资料”、微调改”参数”这一三层划分 | 由 03-提示词的逻辑 + 05-RAG 推导 | [推导] | ✅ 与 03/05 页一致 |
| 决策表与”先试便宜的”原则 | 工程实践共识 + 本页整理框架 | [共识] | ⚠️ 实践总结 |
| 三者的成本量级(分钟/数天/数据+训练+运维) | 各厂商定价与工程经验 | [官方文档] | ⚠️ 待核验:本页只给量级不给数字 |
延伸阅读:OpenAI 微调文档;Anthropic RAG 指南(发布前实地访问补链接)。
本页不写死任何成本数字——价格迭代快,写死即过时。读者请以厂商官网为准。