RAG 检索增强链路
一句话定位:RAG 的核心价值是让模型的回答基于真实检索到的文档而不是内部记忆生成,链路上每一环(切片、召回、重排)质量都直接决定最终答案的忠实度。
1. 完整链路
- 切片策略:把长文档切成适合检索和塞入上下文的小块。
- 固定长度切片:简单但可能把语义完整的一段话切断。
- 语义切片:按段落/章节等语义边界切分,更贴合内容结构。
- 重叠切片(overlap):相邻切片间保留一定重叠内容,避免关键信息刚好落在切片边界被切碎。
- Embedding 模型选型:把文本切片转成向量,选型要看语义相似度效果、向量维度(影响存储成本)、是否支持中文/多语言、是否支持长文本。
- 混合召回:向量检索(语义相似)+ 关键词检索(BM25 等,精确匹配专有名词/数字效果更好)结合,弥补纯向量检索对精确匹配不敏感的短板。
- Rerank 重排:召回阶段为了效率通常召回较多候选(如 top 50),再用更精细但更慢的模型(Cross-Encoder)对候选重新打分排序,取 top-k(如 top 5)送入生成阶段,平衡效率与精度。
- 上下文组装:把重排后的文档片段按相关性排序拼接进 Prompt,注意控制总长度不超过上下文窗口。
- 生成:模型基于拼接好的上下文生成最终答案。
2. 评估维度
- 召回率(Recall):真正相关的文档有多大比例被召回进候选集,是链路上限的天花板——召回没找到的信息,后面无论怎么优化都补不回来。
- 忠实度(Faithfulness):生成的答案是否完全基于检索到的上下文,而不是模型凭内部记忆编造(幻觉的直接度量)。
- 答案相关性:生成的答案是否真正回应了用户的问题(即使忠实于上下文,也可能答非所问)。
3. 面试落点 / 我的缺口
- 这是目前的知识缺口(原条目标注”需做最小落地项目”),面试中应诚实说明”这是近期重点补齐的方向”(呼应第 5 章表达五原则第 4 条),同时展示对链路和评估体系的清晰理解。
- 目标产出:一个”多模态检索 + RAG”最小可用项目作为差异化素材(结合 8.5 全模态数据处理认知)。
- 可迁移话术:切片策略 ≈ 大数据里的分区/分片设计;混合召回 ≈ 数据库的”索引扫描 + 全文检索”组合查询思路;Rerank 的”先粗筛再精排”模式和搜索/推荐系统的”召回-排序”两阶段架构完全一致。
参考:暂无固定论文来源,链路设计综合自主流 RAG 工程实践(LangChain/LlamaIndex 文档、Pinecone/Milvus 检索增强指南)