📚 Retrieval-Augmented Generation & Vector Search

什么是 RAG(检索增强生成)?

如何彻底消灭大模型“一本正经胡说八道”的幻觉?把闭卷死记硬背的考生,升级为配备专属私人图书馆与秒级查阅能力的开卷考试学霸

纯 LLM 裸奔(闭卷死记硬背)
🧠🌫️ 闭卷死记·知识陈旧易幻觉

回答全凭训练时留在参数矩阵里的模糊记忆。不知道公司内部私有制度、不知道昨天刚发生的时事新闻;一旦被问及生僻事实,就会自信地编造谎言(Hallucination 幻觉)

静态参数记忆: 知识截至训练时刻 🛑 提问: 2026年最新报销标准 ➔ ❌ 瞎编胡诌 重训/微调模型耗资百万,且依然可能幻觉
❌ 严重依赖训练切断期 ❌ 幻觉严重 · 无法溯源真实出处 ❌ 无法直接访问私有知识库
VS
RAG 增强架构(开卷查阅图书)
📚⚡ 开卷考试·随身图书馆精准引用

答题前先去外部专属向量数据库中把最相关的段落找出来(Retrieve),把真实依据原封不动塞进提示词上下文,再让大模型提炼总结(Generate),答案精准、有据可查、永不过期

提问 ➔ 向量检索 ➔ 翻出《2026最新财务手册第3章》🔍 ✔ “根据第12条规定,机票标准为...” (附带原文页码引用) ⚡ 零重训成本 · 知识秒级更新 · 彻底告别幻觉
✅ 答案 100% 可溯源验证 ✅ 企业知识秒级实时增删 ⚡ 彻底消除大模型知识幻觉
💡

5岁核心顿悟:微调(Fine-tuning)vs RAG(检索增强生成)

微调(Fine-Tuning):像让一个学生花几个月时间把厚厚的专业医书硬生生背进脑子里。不仅极其昂贵费时,而且过几个月新药上市他又忘了,还容易把药名记混;
RAG(开卷检索):学生脑子里只掌握通用的阅读理解与逻辑表达能力,考试时直接给他配一个“秒级翻书机器人”!问什么病,机器人一秒钟翻到对应的那一页摊在他面前,学生照着权威资料归纳作答。既便宜、又精准、还永远保持最新!

🔄 RAG 核心技术全链路四步流水线

从混乱的非结构化原始文档到精准的上下文生成全流程:

Step 1. 切片
✂️ Chunking

将长达百页的 PDF / Word 按语义段落切成 300~500 字的微小碎片(Chunks),保留段落上下文滑动窗口。

Step 2. 向量化
📐 Embedding

调用嵌入模型把每段文字转化为高维空间坐标数组(如 1536 维向量),存入向量数据库(Milvus / Pinecone / Chroma)。

Step 3. 检索重排
🎯 Search & Rerank

把用户问题也转为向量,计算夹角余弦相似度(+ BM25 混合检索),再通过重排模型(Reranker)筛选出 Top-3 最优依据。

Step 4. 增强生成
✨ Augment & Gen

拼接 Prompt:“请结合参考资料【段落A/B/C】回答用户问题...”,大模型快速提取答案并附上出处引用。

现代高级 RAG (Advanced RAG) 的三大进化突破

从粗暴相似度搜索到工业级生产高保真落地

🔀

1. 混合检索 (Hybrid Search = Dense + Sparse)

单独依靠向量检索容易漏掉生僻人名、工号、产品型号;现代 RAG 结合密集向量语义匹配(Dense Vector)+ 传统倒排关键词检索(BM25 Sparse),既懂自然语言隐喻,又绝不漏掉精准代码与货号。

⚖️

2. 交叉编码重排序 (Cross-Encoder Rerank)

向量检索为了速度采用了折中的双塔模型(Bi-Encoder),召回的前 20 条往往包含噪声。通过调用高精度的 Reranker 模型(如 BGE-Reranker)对候选对逐一精算打分,把真正相关的段落排在最前面。

🕸️

3. GraphRAG 知识图谱全局语义增强

传统切片把关联信息截断在不同块中。微软开源的 GraphRAG 先用 LLM 自动抽取出实体与关系网络构建知识图谱,擅长回答跨章节全局宏观问题(例如:“总结全书主角与反派的性格演变”)。

📐 检索数学底座:文字如何变成空间坐标?

在多维向量空间中,两段文字“意思越相近”,它们向量之间的夹角余弦值就越接近 1:

📐 余弦相似度计算公式 (Cosine Similarity)

$$\text{Similarity}(A, B) = \cos(\theta) = \frac{\mathbf{A} \cdot \mathbf{B}}{\|\mathbf{A}\| \|\mathbf{B}\|} = \frac{\sum_{i=1}^n A_i B_i}{\sqrt{\sum_{i=1}^n A_i^2} \sqrt{\sum_{i=1}^n B_i^2}}$$

值范围: [-1, +1],越接近 1 语义越相似
🔀 互惠排名融合 (RRF: Reciprocal Rank Fusion)

$$RRF(d) = \sum_{m \in M} \frac{1}{k + r_m(d)}$$ 将 BM25 关键词排名与向量语义排名无监督无缝混合,即使模型评分刻度不同也能稳定公平融合。

工业级精准召回防漏利器

🎮 交互模拟器:体验 RAG 问答与纯 LLM 裸奔的真实表现

点击切换提问场景,观察系统内部的数据流转与最终回答可信度对比: