资讯动态

【RAG系列】基础概念

发布时间:2026/9/27 6:12:24 来源:尧图企业网站定制
1. 什么是RAG它解决了大模型的是什么问题1.1 什么是RAGRAG(Retrieval-Augmented Generation检索增强生成)是一种在LLM推理时动态检索外部知识库将检索到的相关内容注入Prompt再由LLM生成答案的架构范式。1.2 RAG解决的核心问题问题说明幻觉LLM在缺乏相关知识时会“编造”看似合理但事实错误的内容。RAG通过提供可溯源的上下文将生成锚定在真实数据上。知识时效性模型训练数据有截止日期无法回答训练后发生的事件。RAG检索实时/近实时数据解决。私有数据访问预训练语料不包含企业内部文档、业务数据。RAG在不微调模型的前提下让LLM访问私有数据可追溯性LLM的生成是黑盒的。RAG可以附带引用来源让用户验证答案的可靠性。这里需要区分两个概念可解释性为什么给出这个答案内部推理过程可解释原因可追溯性答案的依据来源是什么能指出我引用了哪段资料RAG 主要解决的是可追溯性它让答案有出处成为可能从而在应用层面提升了可信度。注意可追溯 不等于 正确。1.3 RAG如何降低幻觉1.3.1 幻觉产生根源LLM幻觉的本质模型在缺失相关知识时不是拒绝回答而是基于概率模型生成看似合理但错误的内容。对于RAG场景幻觉来源三类来源说明检索噪声检索到的片段与问题无关或相关性低模型被“带偏”上下文冲突多段资料互相矛盾模型不知道怎么选模型倾向模型”过度自信“即使有依据也倾向自由发挥1.3.2 降低幻觉的措施提升检索质量 从源头减少噪声混合检索向量检索 BM25关键词检索用RRF或加权融合兼顾语义和精确匹配Rerank重排序用交叉编码器(Cross-Encoder)对召回结果进行精排把最相关的排最前面相关性阈值过滤设置相似度阈值低于阈值的直接丢弃查询改写把模糊问题改写的更精确提高召回质量核心思想给模型提供的资料越准确模型越不容易被误导。Prompt设计约束引导模型”只依据材料“明确指令告诉模型”只能基于提供的上下文回答不能使用外部知识“无依据拒绝回答指令中加入”如果上下文中没有相关信息请明确说明无法回答不要编造“引用要求 要求模型在回答中标注引用来源强制它”对着材料说话“示例 Prompt 你是一个严谨的问答助手。请仅根据以下【上下文】回答问题。 如果上下文中没有足够信息请直接回答根据现有资料无法回答。 回答时请标注引用来源编号 [1][2]。上下文管理减少冲突去重和压缩去除重复片段压缩冗余内容避免上下文过长注意力被稀释冲突检测检测多段材料是否矛盾矛盾时优先采用更高置信度/更新版的材料控制上下文长度只保留top-k最相关的内容避免塞入过多无关内容生成后校验事后兜底忠实度评估Faithfulness用另一个模型/规则检查答案是否和检索片段一致检测答案中有没有上下文相关的内容引用一致性校验检查答案引用的编号是否真的对应到相关文档模型可能标了引用但内容对不上必须做引用一致性校验幻觉检测模型训练专门的幻觉检测器对生成结果进行打分低分则触发重试或拒答检索增强的进阶形态Agentic RAG让模型自主决定要不要检索、检索什么、检索几次避免一次检索不够或检索方向不对Graph RAG通过实体关系图做多条推理减少单点检索信息不多导致的幻觉Self RAG模型在生成过程中自我反思判断是否需要更多信息动态决定是否补充检索1.3.3 引用溯源实现目标让用户/审计者能从答案追溯到原始文档行程完整证据链。溯源是系统工程不是加个引用标记就完事涉及 ID 管理、解析、校验、渲染、审计全链路。注意 可追溯不等于正确因为引用来源本身可能就是错误的需要结合资料可信度评估。实现方案方案1片段级引用最常用流程 1.检索时给每个片段编号[1] [2] [3] 2.Prompt中要求模型在引用处标注对应ID 3.生成后解析答案中的[n]映射回原始文档片段 4.前端渲染时把[n]变成可点击的引用链接片段ID必须和检索结果一一对应需要处理模型输出的引用标记模型可能标错编号方案2句子级引用用句子对齐技术把答案中每个句子映射到最相似的检索片段优点引用更精准用户可直接知道该句出自哪段缺点实现复杂需要额外引入对其模型方案3元数据注入检索的片段携带元数据文档标题、章节、URL、时间戳)生成时要求模型在引用处带上这些元数据前端直接展示来源信息2. RAG和微调(Fine-tuning)的区别各自适用什么场景RAG和微调的本质区别是RAG是“外挂知识”微调是“内化知识”。维度RAGFine-tuning原理推理时动态检索外部知识注入Prompt通过继续训练将知识写入模型参数知识更新只需更新知识库需重新训练/微调成本低检索基础设施高训练算力可控性高可精确控制检索来源)低(知识“融入”参数难以移除可追溯性高可追溯来源低黑盒参数适用数据量级任意规模需要足够标准数据通常数千条高质量数据外部知识依赖强依赖检索质量不依赖检索质量但强依赖数据工程适用场景RAG更适合知识频繁更新如新闻、政策、产品文档数据库随时可改需要可追溯/可解释金融、医疗、法律等强监管场景答案必须有出处私有/领域数据企业内部的文档、知识库不想或不能用于训练数据量大且分散海量文档无法全部塞进模型对幻觉敏感需要答案有据可查Fine-tuning更适合需要特定风格/格式如让模型模仿特定写作风格、输出固定格式需要领域术语/知识内化如医疗、法律的专业术语希望模型张口就来需要特定行为模式如让模型更严谨、更简洁、更符合某种角色推理速度敏感不希望有检索延迟数据相对稳定知识不会频繁变化最佳实践两者并非互斥生产级系统常采用RAG Fine-tuning组合。微调让模型更好地遵循RAG指令格式和引用规范RAG负责提供最新知识。3. RAG完整流程流程是什么RAG 的完整流程可分为离线阶段索引构建与在线阶段检索增强生成两部分整体架构如下四阶段详解索引Indexing文档解析将PDF/HTML/Markdown转换为 纯文本文档切分Chunking将长文档切分为合适大小的片段向量化Embedding将文本片段转换为稠密向量存储向量入库(FAISS/Milvus/Qdrant/PGVector等)、索引构建(NHSW)检索RetrievalQuery向量化相似度检索余弦向量、内积、欧氏距离等可选混合检索向量 BM25、查询改写、多路召回增强Augmentation重排序Rerank双塔算法、交叉编码(Cross-Encoder)上下文拼接与格式化窗口管理截断/压缩生成Generation将增强后的Prompt送入LLM生成答案通常要求附带引用4. RAG有哪些变体Naive RAG、Advanced RAG、Modular RAG的区别RAG的演进路线经历了三代变体时间核心特征典型技术Naive RAG2023年初最简流程索引-检索-生成无优化固定大小切分、单次向量检索、直接拼接Advanced RAG2023年中-2024在检索前后增加优化环节混合检索、Rerank、查询改写、语义切分Modular RAG2024-2025模块化可组合架构按需插拔自适应检索、多路召回融合RAG 的演进本质是从固定流水线走向自适应、可编排Naive RAG一条固定流水线检索质量决定上限Advanced RAG在流水线各环节做优化提升检索质量Modular RAG拆成模块自由组合引入路由、记忆、自适应检索第一代Naive RAG(朴素RAG)最基础的形态也是大多数人对RAG的第一印象流程文档 - 切分 - 向量化 - 存入向量库 用户问题 - 向量化 - 检索 top-k - 拼进 Prompt - LLM生成特点结构简单易于实现检索、生成是串行、一次性的问题检索质量差时效果直接崩无法处理多跳推理第二代Advanced RAG(进阶RAG)在Naive RAG的检索前、检索中、检索后三个环节做优化。环节优化手段检索前(Pre-Retrieval)查询改写、查询扩展、HyDE(假设性文档嵌入)、意图识别检索中(Retrieval)混合检索(向量BM25、Rerank重排序、元数据过滤、父子块切分检索后(Post-Retrieval)上下文压缩、去重、冲突检测、相关性阈值检测特点检索质量显著提升目前生产环境的主流形态第三代Modular RAG(模块化RAG)把 RAG 拆成可自由组合的独立模块按需编排甚至引入循环和路由。核心思想不再是一条固定流水线而是像搭积木一样组合模块。常见模块路由Routing根据问题类型路由到不同的检索策略或数据源查询规划Query Planning把复杂问题拆成多个子查询记忆Memory引入对话历史支持多轮检索融合Fusion多路检索结果融合自适应检索Adaptive Retrieval模型自主决定要不要检索、检索几次关键变体Agentic RAG在 Modular RAG 基础上引入 Agent 编排让模型自主决策何时检索、检索什么、检索几次支持多轮工具调用与反思适合复杂任务分解。Graph RAG将文档构建为实体-关系图检索时沿图结构做多跳推理能回答跨文档的聚合性问题弥补单点检索信息不足的短板。Speculative RAG先由轻量模型生成草稿答案再用检索片段验证并修正兼顾速度与准确率。Self-RAG模型在生成过程中自我反思动态决定是否需要补充检索并对检索结果与自身输出进行打分取舍。这些变体并非互相替代而是针对不同场景的组合式演进生产实践中常以 Modular RAG 为骨架按需叠加 Agentic、Graph 或 Self-RAG 能力形成可编排、自适应的完整方案。RAG的基础概念到此结束期待后续的检索优化。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑