RAG 让 AI 用上你自己的资料,而不只是训练时记住的通用知识。它把”检索”和”生成”拼起来,是解决幻觉、做企业问答的标配方案。
快速结论
- RAG = 先检索相关资料,再让模型基于资料生成答案。
- 它把回答锚定在真实资料上,幻觉大幅降低。
- 效果上限由检索质量决定,先疑检索再疑生成。
- 切片、嵌入、重排三环没调好,RAG 必翻车。
它解决什么痛点
通用大模型不知道你的内部信息,硬问只能编。RAG 的解法是:先把资料库建好,用户提问时实时捞最相关的几段,让模型”看着资料答”。答案从编的变成查的,可信度质变。
它还能溯源。每段回答都能点回原文,用户和审核都能验证。对合规和可信要求高的场景,这种”有出处”比”答得漂亮”重要得多。RAG 把黑箱回答变成可核查回答。
文档怎么进库
资料进库叫 ingestion。先清洗:去页眉页脚、合并断行、统一格式;再按语义断点切片,每段自成一个意思单元并打来源标记。脏数据进库,后面检索必脏。
切片粒度是命门:太粗检索不精准,太细丢上下文。经验是按自然章节断,每段能独立表达。带元数据(来源、时间、章节)让后续能按条件筛,精准度再升一层。
向量化与检索
切片经嵌入模型转成向量,语义相近的向量也相近。提问时把问题也转向量,去库里捞最相近的几段,这就是”语义检索”——哪怕用词不同也能命中。
嵌入模型选不好,近义判断稀烂,后面全白搭。垂直领域常需选领域友好或微调的模型。向量化是 RAG 第一环,源头准,检索才准,别随便接默认模型。
生成时要画红线
捞到资料后,必须约束模型”只依所给资料答、资料没有就说不知”。没有这条红线,模型会用通用知识补窟窿,反而引入幻觉,RAG 白做。
还要要求带引用,每段结论对应哪段资料。引用既是可溯源的证据,也逼模型别跑偏。生成阶段的约束,是把检索红利锁进答案里的关键一步。
重排提升准度
向量粗召回到一批候选后,常加一道重排:用更精细的模型对候选重新打分,把最相关的顶上来。召回保覆盖,重排保精准,两招叠加是提升 RAG 准度的实用组合。
重排特别擅长纠正纯向量的短板,比如对专名、编号这类关键词,重排能识别向量忽略的精确匹配。别只信向量,叠重排,RAG 质量会上一个台阶。
检索不好的信号
RAG 答非所问,十有八九是检索捞错了片段,而非模型笨。信号包括:答的内容资料里根本没有、引的段落驴唇不对马嘴、该命中的没捞到。看到这些先查检索。
查检索的顺序:切片是否太碎、嵌入是否适配、索引参数是否失当、是否漏了关键词与重排。把检索调顺,多数 RAG 问题不攻自破。顺序错了,白调生成。
和微调怎么选
RAG 与微调不互斥。RAG 解决”用上最新资料”,微调解决”学某种风格或能力”。资料常变、要可溯源,选 RAG;要模型具备某种稳定特质,选微调。很多系统两者并用。
别一上来就微调,成本高且资料更新要重训。先用 RAG 把”基于资料答”跑通,确有风格或能力缺口再补微调。路径先轻后重,投入才不盲目。
落地的小步路线
先拿一个知识域(如产品 FAQ)跑通”上传—切片—检索—作答”闭环,验证体验。再加重排、加约束、接更多域。每一步都把检索质量盯紧,再扩规模。
配套建评估集:一批真实问题加标准答案,每次改动跑一遍看命中率。用评估守住底线,RAG 才从玩具变生产。小步加评估,是最稳的落地姿势。
常见三个坑
坑一:切片粗暴,检索命中率低。坑二:嵌入模型随便选,近义判断差。坑三:只信向量不重排,专名全漏,且生成不约束致幻觉回潮。
三者都靠”精切片、选嵌入、加重排、画生成红线”化解。RAG 不是接个向量库就灵,调好这几环才真正成为可靠底座。
衡量 RAG 好不好
端到端看真实问题的最终答对率,比单看检索指标更说明问题。再拆:检索召回率、答案有出处比例、幻觉率(抽样判)、耗时成本。四数合起来才全面。
别只盯”接了多少文档”。文档多不代表答得对,能基于正确资料稳定给出可溯源答案,才是 RAG 真正的价值。用指标倒逼,系统才越用越准。
什么时候不该上 RAG
RAG 不是万能。资料极少且稳定、模型本身已覆盖的问题,硬接 RAG 反而增加延迟和出错面。先判”资料是否有用且模型不知”,再决定上不上,别为用而用。
还有成本账:每次问答都检索加生成,开销高于纯生成。低频且非关键的场景,先用模型通用知识顶住,把 RAG 留给真需要资料支撑的高价值问答,投入才划算。
图:RAG 四步 核心要点(运营GO 整理)
| 环节 | 做什么 | 易错 |
|---|---|---|
| 进库 | 洗切带源 | 脏数据 |
| 向量 | 语义转码 | 模型不适 |
| 检索 | 捞相关段 | 只信向量 |
| 生成 | 依资料答 | 不约束 |
延伸阅读:什么是 RAG 检索增强生成、什么是 Prompt(提示词)。
下一步行动清单
- 文档进库前清洗并按语义断点切片。
- 嵌入模型选领域适配的,别用默认。
- 向量检索叠加关键词与重排提准。
- 生成时约束”只依资料答、不知就说”。
- 建评估集,每次改动跑一遍盯命中率。


