什么是 RAG(检索增强生成)?
如何彻底消灭大模型“一本正经胡说八道”的幻觉?把闭卷死记硬背的考生,升级为配备专属私人图书馆与秒级查阅能力的开卷考试学霸!
回答全凭训练时留在参数矩阵里的模糊记忆。不知道公司内部私有制度、不知道昨天刚发生的时事新闻;一旦被问及生僻事实,就会自信地编造谎言(Hallucination 幻觉)。
答题前先去外部专属向量数据库中把最相关的段落找出来(Retrieve),把真实依据原封不动塞进提示词上下文,再让大模型提炼总结(Generate),答案精准、有据可查、永不过期!
🔄 RAG 核心技术全链路四步流水线
从混乱的非结构化原始文档到精准的上下文生成全流程:
将长达百页的 PDF / Word 按语义段落切成 300~500 字的微小碎片(Chunks),保留段落上下文滑动窗口。
调用嵌入模型把每段文字转化为高维空间坐标数组(如 1536 维向量),存入向量数据库(Milvus / Pinecone / Chroma)。
把用户问题也转为向量,计算夹角余弦相似度(+ BM25 混合检索),再通过重排模型(Reranker)筛选出 Top-3 最优依据。
拼接 Prompt:“请结合参考资料【段落A/B/C】回答用户问题...”,大模型快速提取答案并附上出处引用。
现代高级 RAG (Advanced RAG) 的三大进化突破
从粗暴相似度搜索到工业级生产高保真落地
1. 混合检索 (Hybrid Search = Dense + Sparse)
单独依靠向量检索容易漏掉生僻人名、工号、产品型号;现代 RAG 结合密集向量语义匹配(Dense Vector)+ 传统倒排关键词检索(BM25 Sparse),既懂自然语言隐喻,又绝不漏掉精准代码与货号。
2. 交叉编码重排序 (Cross-Encoder Rerank)
向量检索为了速度采用了折中的双塔模型(Bi-Encoder),召回的前 20 条往往包含噪声。通过调用高精度的 Reranker 模型(如 BGE-Reranker)对候选对逐一精算打分,把真正相关的段落排在最前面。
3. GraphRAG 知识图谱全局语义增强
传统切片把关联信息截断在不同块中。微软开源的 GraphRAG 先用 LLM 自动抽取出实体与关系网络构建知识图谱,擅长回答跨章节全局宏观问题(例如:“总结全书主角与反派的性格演变”)。
📐 检索数学底座:文字如何变成空间坐标?
在多维向量空间中,两段文字“意思越相近”,它们向量之间的夹角余弦值就越接近 1:
$$\text{Similarity}(A, B) = \cos(\theta) = \frac{\mathbf{A} \cdot \mathbf{B}}{\|\mathbf{A}\| \|\mathbf{B}\|} = \frac{\sum_{i=1}^n A_i B_i}{\sqrt{\sum_{i=1}^n A_i^2} \sqrt{\sum_{i=1}^n B_i^2}}$$
值范围: [-1, +1],越接近 1 语义越相似$$RRF(d) = \sum_{m \in M} \frac{1}{k + r_m(d)}$$ 将 BM25 关键词排名与向量语义排名无监督无缝混合,即使模型评分刻度不同也能稳定公平融合。
工业级精准召回防漏利器🎮 交互模拟器:体验 RAG 问答与纯 LLM 裸奔的真实表现
点击切换提问场景,观察系统内部的数据流转与最终回答可信度对比: