RAG 之所以能”用上你自己的资料”,背后那块拼图就是向量数据库。它不按关键词匹配,而是按意思找内容,这正是 AI 检索比搜索框聪明的地方。
快速结论
- 向量数据库把文本转成向量,按语义相似度检索而非关键词。
- 它是 RAG 的检索底座,决定”捞得准不准”。
- 选型的命门是嵌入模型和检索策略,不只是数据库本身。
- 切片质量和索引参数,比盲目追大牌更影响效果。
它和普通的表有什么不同
关系库按字段精确查,比如”状态等于已付款”。向量库存的是文本转成的向量,查的是”意思最像的片段”,哪怕用词完全不同也能命中。这种语义检索,是关键词搜索做不到的。
直观说:你问”怎么退钱”,普通搜索要匹配”退钱”二字,向量库能捞出写”退款流程如下”的段落。它懂近义,这正是 AI 问答能基于资料作答的前提。
文本怎么变成向量
文本经嵌入模型转成一串数字(向量),语义相近的文本向量也相近。这一步的质量决定检索上限:嵌入模型越强、越贴合你的领域,近义判断越准。
嵌入模型不是越通用越好,垂直领域常需微调或选领域友好的模型。把”向量化”当整个链路的第一环来重视,而不是随便接一个默认模型。源头准,后面才准。
高维索引怎么存
向量维度常高达几百到上千,逐条比对会慢死。向量库用近似最近邻索引,牺牲一点点精度换百倍速度,让海量向量也能毫秒级返回最相近的几个。
索引有参数要调:召回率和耗时此消彼长。调得太省会漏掉该命中的片段,调得太满又拖慢。按业务对”宁可慢莫漏”还是”宁快莫全”的偏好来设。
它怎么支撑 RAG
用户提问先向量化,去库里捞最相似的几段资料,这几段作为依据送进模型生成答案。向量库就是 RAG 里”检索”那一步的执行者,捞得准不准全看它。
所以 RAG 效果差,常常不是模型不行,而是向量库捞错了片段。优化 RAG 时,先怀疑检索再怀疑生成。底座稳,上层才发挥得出来。
切片质量决定上限
进库的文本怎么切,直接影响检索。切太碎语义不全,切太整噪音太多。按语义自然断点切,每段自成一个意思单元,检索命中率才高。切片是向量库效果的隐藏命门。
还要带元数据:每段记下来源、章节、时间。检索时能按来源过滤、按时间排序,结果更可控。元数据让”语义搜”叠加”条件筛”,精准度再上一层。
检索策略不止一种
默认用向量相似度就够了,但复杂场景可叠加关键词过滤(混合检索)、按时间或权限重排。策略组合能补纯向量的短板,比如对专名和编号,关键词更准。
重排也关键:先粗召回到一批候选,再用更精细的模型对候选重新打分排序,把最相关的顶上来。召回加重排,是提升 RAG 准度的实用两招。
选型看什么
别只比数据库名气。先看嵌入模型是否你能控、索引参数是否可调、能否和现有向量维度匹配、规模上来后成本如何。数据库是壳,里面的模型和策略才是魂。
还要看运维:能否水平扩展、有无托管版、备份恢复是否省心。选一个和你团队能力匹配、能长期养得起的,比追新酷更重要。
常见三个坑
坑一:嵌入模型随便选,近义判断稀烂。坑二:切片粗暴,检索命中率低。坑三:只信向量忘了加关键词和重排,专名全漏。
三者都靠”重嵌入、精切片、叠策略”化解。向量库不是建完就灵,调好前面几环,它才真正成为 RAG 的可靠底座。
和知识库的关系
向量库常是私有知识库的核心组件,但它不等于知识库。知识库还包含权限、接入、更新等,向量库只管”语义检索”这一块。把两者分清,架构才不糊。
实践中常把向量库嵌进更大的知识库系统,对外提供”问内部资料”的能力。理解这一层,你就不会把”上向量库”误当成”上知识库”的全部。
衡量向量库好不好
看检索相关的指标:召回率(该命中的捞到没)、准确率(捞回来的相关不相关)、耗时、成本。四数合起来,才说清底座健康。
端到端更有说服力:用真实问题测 RAG 最终答对率,反推检索环节的贡献。向量库好不好,最终要落到”用户问得出答案”这件事上。
成本与规模化的现实
向量库小规模跑得欢,数据涨到千万级才是真考验。索引重建要多久、查询并发顶不顶得住、存储成本怎么走,这些在原型期看不见,上线后才暴雷。
早做容量规划:预估数据增速、设好分片与冷热分层、把重建放在低峰。把规模化当成设计目标而非事后补救,向量库才陪你从原型走到生产。
图:向量数据库 核心要点(运营GO 整理)
| 环节 | 做什么 | 易错 |
|---|---|---|
| 向量化 | 文本转向量 | 模型不适配 |
| 索引 | 近似最近邻 | 参数失当 |
| 检索 | 语义捞片段 | 只信向量 |
| 重排 | 候选再打分 | 漏掉重排 |
延伸阅读:什么是 RAG 检索增强生成、什么是 Prompt(提示词)。
下一步行动清单
- 重视嵌入模型选型,垂直领域考虑微调。
- 按语义断点切片,并带上来源元数据。
- 默认向量检索,叠加关键词与重排提升准度。
- 先怀疑检索再怀疑生成,优化 RAG 顺序。


