文章目录1. 前言2. 什么是 RAG 2.1 基础定义2.2 三大核心组件2.3 基础工作流朴素RAG2.4 普通 LLM vs RAG2.5 典型应用场景2.6 发展历史3. 为什么需要 RAG 3.1 LLM 底层本质3.2 LLM 如何学习3.3 LLM 会产生幻觉3.4 RAG 如何解决幻觉问题4. 实现方案4.1 朴素 RAGNaive RAG4.2 高级 RAGAdvanced RAG4.3 模块化 RAGModular RAG4.4 智能体化 RAGAgentic RAG4.5 图增强 RAGGraphRAG4.6 各方案对比简表5. 开源框架/平台5.1 RAGFlow⭐ ~88k5.2 LlamaIndex⭐ ~46k5.3 LightRAG⭐ ~35k5.4 腾讯 WeKnora⭐ ~20k5.5 Haystack 2.x⭐ ~24k5.6 txtai⭐ ~13k5.7 阿里 PAI‑RAG⭐ ~ 0.5k6. 小结1. 前言在上一篇中我们了解了上下文工程Context Engineering中的三大基础组件上下文检索与生成、上下文处理、上下文管理。四大系统实现RAG系统、记忆系统、工具集成推理、多智能体系统。RAG属于中层四大系统实现之一由底层三大基础组件组合构建而成。它以「上下文检索与生成」为核心同时复用上下文处理、上下文管理能力用来实现外部知识注入RAG作为架构骨架进一步结合业务需求可实现知识库问答等上层Agent/AI应用。工程中RAG常与记忆、工具推理组合共同构建复杂智能体。基础组件属于底层能力模块是上下文工程最基础的 “零件库”提供信息获取、信息加工、信息存储管理的基础能力。四大系统属于中层架构范式组装基础组件形成标准化架构骨架是通用技术方案还不是面向用户的成品。基于四大系统架构结合业务需求开发出来构建面向终端使用的最终应用也就是Agent/AI应用比如智能助手、知识库问答、办公Agent、多角色协同机器人等业务产品。2. 什么是 RAG 2.1 基础定义RAGRetrieval‑Augmented Generation检索增强生成是一种将外部知识库检索与大模型文本生成相结合的技术范式不修改大语言模型本身权重推理阶段先从外部知识库检索相关资料再把检索得到的上下文交给大模型由大模型基于检索回来的真实材料生成回答。公式表达LLM your data 大模型 你的私有/外部数据原始大语言模型训练依赖公开互联网数据企业私有文档、内部业务资料、实时互联网信息通常不在模型训练数据集中裸LLM会产生幻觉、无法回答业务专属问题。在《面向大语言模型的上下文工程综述》的三层架构中底层三大基础组件上下文检索与生成、上下文处理、上下文管理✅中层四大系统实现之一 RAG系统上层Agent/AI应用知识库问答、文档助手等产品RAG不是底层单一组件而是一套拼装好的系统架构范式核心依赖「上下文检索与生成」组件同时复用上下文处理、上下文管理能力。简单理解大模型本身参数里存储的知识叫参数化知识RAG从外部文档库拿到的资料叫非参数化知识把检索出来的资料组装进上下文C A ( c 1 , c 2 , … , c n ) C\mathcal{A}(c_1,c_2,\dots,c_n)CA(c1,c2,…,cn)交给大模型参考再输出答案。解决痛点幻觉问题让回答引用真实文档证据减少模型凭空编造内容知识时效性模型训练完成之后新知识无法写入权重RAG可以读取实时更新的外部文档领域私有知识企业内部文档、业务数据不需要微调模型直接通过检索注入成本可控相比模型微调RAG改动知识库即可更新知识不需要重新训练权重。我给你精简、干净、可直接放进技术博客 / 面试背诵的 300 字标准版2.2 三大核心组件一套基础的RAG系统由**知识库、检索器、生成器LLM**三大核心组件构成。知识库是RAG的数据底座用于存储权威、真实、最新的外部资料包括业务文档、手册、合同、私有数据等。原始文档经过解析、清洗、分块、向量化后存入向量数据库为检索提供可靠数据源弥补大模型参数知识有限、过时的缺陷。检索器负责理解用户问题根据用户Query从知识库中精准召回相似度最高的文本片段过滤无关内容输出高质量参考上下文为模型提供作答依据。生成器即 LLM接收用户问题与检索得到的真实资料强制基于外部参考内容生成答案不再依赖模型内部参数脑补。2.3 基础工作流朴素RAG朴素RAG(Naive‑RAG) 是最基础、最简单版本的检索增强生成线性直来直去的RAG流水线没有额外优化模块。朴素RAG一共4个工作步骤索引阶段原始文档切分通过Embedding向量化向量与文本存入向量数据库离线完成知识库构建。查询阶段接收用户提问将问题向量化在向量库中召回相关文档片段。组装上下文将用户query和检索得到的参考片段拼装成完整提示词送入LLM。生成输出大模型基于检索资料输出最终回答。朴素RAG属于固定线性流水线短板明显缺少查询改写能力多跳推理表现差复杂问题场景容易召回无关片段依旧会产生幻觉。2.4 普通 LLM vs RAG普通LLM流程用户Prompt直接送入大模型依靠模型参数内训练知识生成回答。缺点是不能使用私有数据、知识过时容易产生幻觉。RAG引入检索环节用户问题交给检索器从知识库召回相关文档片段将问题与参考文档拼接为增强提示词再交给LLM让模型基于外部资料输出答案。RAG收益显著可以注入私有业务知识、缓解幻觉更新知识只需要维护知识库无需微调大模型还可以实现答案溯源。但代价是增加检索带来的延迟提升系统复杂度。RAG实现职责分离检索器负责找事实LLM专注文本生成。2.5 典型应用场景RAG核心价值不改动大模型权重接入外部私有/实时知识降低幻觉支持溯源下面是工程落地高频场景。企业内部知识库问答最主流对接内部手册、合同、制度、FAQ、运维文档。员工自然语言查询内部资料不用手动翻文档支持客服、内部助手。智能客服与售后机器人把产品手册、故障方案、售后政策存入知识库。用户咨询产品问题基于真实资料回复减少幻觉回答可附带来源。文档分析助手PDF/卷宗/报告法律合同、财报、研究论文、项目卷宗。对长文档做问答、摘要、条款提取快速定位关键信息。垂直行业助手金融研报、公告问答医疗院内规范、诊疗手册查询政务政策文件解读。实时信息问答对接搜索引擎作为知识库获取大模型训练截止时间之后的新闻、事件解决知识过时问题。开发者助手接入私有代码文档、接口文档、内部技术规范做研发问答、接口解释。教育知识库课程讲义、题库资料基于教学资料答疑减少编造知识点。RAG不擅长纯创意创作这类场景直接使用原生LLM即可。2.6 发展历史早期RAG仅仅把文档切分成文本块做相似度检索2026年的RAG已经演进为动态上下文编排系统与上下文工程整套思想完全对齐。行业普遍认为超大长上下文与RAG属于互补RAG负责从海量外部资料做粗筛选长上下文负责局部文档精读。RAG演进可以划分为5个阶段下面整理关键里程碑事件时间里程碑核心意义2020Meta NeurIPS 2020正式提出RAG范式DPR稠密检索论文发表RAG范式正式诞生确立稠密检索生成器的基础架构区分参数化/非参数化知识2021‑2022REALM、RETRO、WebGPT预训练阶段融合检索验证大规模检索增强可行性检索增强走向工业界原型2023ChatGPT爆发Advanced RAG普及LangChain、LlamaIndex生态爆发企业大量落地RAG朴素RAG暴露出短板查询改写、重排序、混合检索等高级技术大规模使用2024‑2025Modular RAG模块化RAG、GraphRAG图增强RAG、Agentic‑RAG智能体RAGRAG从静态流水线走向动态可编排架构知识图谱、智能体规划融入RAG系统也是《上下文工程综述》重点论述的方向2026RAG进入上下文引擎时代工业化落地与前沿研究并行1. Agentic‑RAG从科研走向生产混合检索、重排序成为工业系统默认标配2. 多模态RAG、记忆‑RAG深度融合轻量化GraphRAG实现大量开源3. MCP等标准化协议兴起检索成为Agent可插拔组件4. TREC‑RAG、MTRAG多轮RAG等评测基准大量出现5. 行业形成共识超大上下文窗口不会取代RAG二者协同上下文工程成为RAG顶层设计思想RAG不再简单等同于“检索拼接提示词”升级为动态上下文编排系统将检索、记忆、工具调用统一纳入上下文工程框架重点关注系统可靠性、复杂业务工程落地小提示上下文工程综述论文是2025年7月发布2026是该思想大规模落地RAG、Agent的产业年份。3. 为什么需要 RAG 3.1 LLM 底层本质底层本质高级自动补全大语言模型的底层本质是一套概率式自动续写系统。它并不会真正“理解”语义而是依托前文内容反复推算后续词元的出现概率一步步产出整篇文本。Token生成完整流程上下文接收处理把用户提问、已经生成的内容合并整理成模型可识别的输入状态。概率分布计算神经网络利用训练习得的海量语言规律为词库中每一个候选Token算出对应的发生概率。采样选出下一词元基于概率分布做采样挑选出本次输出的Token并非永远选取概率最高项。迭代循环输出将新生成Token拼接到原有上下文末尾重新走整套流程直到命中停止条件生成结束。举例输入句子今天天气真好太阳正基于概率模型可以生成多个通顺合理的续写高高挂在天上 暖洋洋地照耀大地3.2 LLM 如何学习LLM学习分为两大核心阶段预训练Pre‑training 海量文本的自学阶段造脑产出Base基座模型。后训练Post‑Training预训练完成之后在基座模型权重基础上开展的全部微调与对齐工作统称后训练。预训练阶段模型初始参数随机只会输出乱码。以海量无标注文本为原料核心任务是预测下一个 Token输入上文模型预测后续文本对比真实结果计算误差通过反向传播迭代调整参数习得语法、常识、逻辑产出** Base基座模型**。基座擅长文本续写但不会听从人类指令。后训练Post‑Training在基座之上做对齐。先通过SFT监督微调用指令‑回答样本教会模型理解并响应指令。再做偏好对齐可采用RLHF或DPO基于好坏回答数据优化输出质量叠加安全、工具调用训练得到可直接对话的Chat模型。推理阶段权重完全冻结仅循环预测Token生成回复不会让模型实时学习。3.3 LLM 会产生幻觉LLM本质是生成概率上通顺的词序列学习训练数据中的统计模式并不以输出客观事实为优化目标。这里有一个关键认知Truthful ≠ probable真实不等于概率高。文本读起来流畅合理只代表该文本组合在统计上概率更高不代表内容属实。当出现知识缺口比如训练数据缺失、信息过时模型缺少对应事实依据。但为了完成续写它会依靠统计规律脑补内容于是产生幻觉语气笃定地编造不存在的人名、文献、数据与事件。模型没有真实认知只是不断预测下一个Token。幻觉无法彻底根除只能缓解。落地业务时切忌直接采信大模型给出的事实、数据一定要做校验。常用手段包括RAG检索增强引入外部可信资料优化提示词鼓励模型坦诚说不知道事实类输出必须人工复核。幻觉并非程序Bug是大语言模型与生俱来的特性根源来自模型的生成逻辑。3.4 RAG 如何解决幻觉问题RAG检索增强生成是解决幻觉最有效的落地方案。核心思想不让模型靠参数脑补知识强制依靠外部真实素材作答。通过外接实时、可信数据大幅降低模型编造概率有效解决知识过时、事实错误、幻觉虚构等问题。核心思路不让模型只靠内部参数记忆知识外部拉取真实参考资料作为上下文降低幻觉。4. 实现方案按照上下文工程综述的分类RAG分为朴素RAG、高级RAG、模块化RAG、智能体化RAG、图增强RAGGraphRAG另外还有RAPTOR、Self‑RAG等代表性变体方案。4.1 朴素 RAGNaive RAG流程用户Query→ 向量相似度检索 → 拼接片段 →LLM生成优点最简单开发快适合简单单跳事实问答缺点固定单向流水线没有查询改写不做结果校验容易召回噪声复杂多跳问题效果差存在“迷失中间”问题适用场景简单FAQ、小规模知识库Demo原型。4.2 高级 RAGAdvanced RAG在朴素RAG前后增加预处理、后处理增强环节。关键技术查询侧查询改写、HyDE假设文档嵌入、多查询生成检索侧混合检索BM25关键词 向量检索检索后Rerank重排序模型对召回文档二次打分过滤噪声上下文压缩精简检索块减少token消耗。优点显著提升召回质量成本增加不大缺点整体依旧是固定流水线不会自主判断要不要检索复杂任务无法迭代多次检索适用场景绝大多数企业常规知识库项目。4.3 模块化 RAGModular RAG综述重点方案把整条RAG流水线拆解成独立可插拔组件索引模块、预检索模块、检索模块、后检索模块、生成模块、记忆模块组件之间可以自由替换、编排组合。创新点不再是一条写死的直线可以路由选择不同检索器支持自省、迭代检索可接入外部工具优点灵活适配不同业务可以按需开启关闭模块便于做消融实验、对比不同策略方便研究调优缺点架构复杂度上升组件编排需要工程经验代表框架FlashRAG、ComposeRAG。4.4 智能体化 RAGAgentic RAG将Agent智能体能力嵌入RAG流水线由大模型自主做决策要不要检索、生成什么查询、是否需要多轮检索、什么时候停止检索、对结果做校验反思。核心能力任务分解、迭代检索、结果校验反思可同时调用检索、计算器、搜索引擎等多种工具Self‑RAG是典型代表模型输出特殊token控制检索开关优点擅长复杂多跳、需要多轮搜集证据的复杂问题缺点token消耗高推理延迟大容易循环反复检索提示词约束不好会跑偏适用场景深度文档研究、复杂分析类问题。4.5 图增强 RAGGraphRAG不再只依赖文本块向量相似度抽取文档中的实体、关系构建知识图谱利用图结构做检索与多跳推理。分为三类知识载体型图谱作为核心知识库索引型图谱只是索引原始文档依然保留混合向量检索图检索结合使用。代表实现微软GraphRAG、LightRAG、HippoRAG、RAPTOR层级摘要树优点擅长实体关系、多跳关联推理全局文档综合问答缓解传统向量检索语义碎片化缺点图谱构建成本高实体抽取质量直接决定效果索引构建耗时适用场景人物关系、产业链、医疗、法律等强关系型知识场景。4.6 各方案对比简表RAG虽然才出现短短几年但已经发展出各种各样的RAG方案NaiveRAG一般也称为传统RAG是初代检索增强生成方案也是最早落地、架构最简单的RAG形态。各类RAG方案对比方法核心思路强项弱项典型效果NaiveRAG文本相似度检索简单、速度快不具备推理能力无法识别实体关系综合得分 30–40%RQ-RAG问题拆分 / 改写复杂问题召回效果好调用成本高无法解决实体关系问题效果略优于 NaiveRAGHyDE虚拟文档检索短文本问题匹配精度高依赖大模型生成结果易引入幻觉效果优于 NaiveRAGGraphRAG知识图谱 社区检索支持多跳推理全局理解能力强运行慢、Token 开销大、数据更新困难综合得分约 50%Agentic RAG智能体自主规划、迭代检索与工具调用自主决策、动态调整检索策略适配复杂长任务流程链路长、耗时久、逻辑复杂度高综合表现中上灵活度突出LightRAG双层图检索 增量更新高效精准、成本低支持多模态索引阶段仍依赖大模型综合得分 60–85%LLM Wiki摄入时编译结构化百科知识查询检索整理后的知识页知识全局沉淀、无碎片、可读性极强、适合长期知识库复利预处理编译成本高、实时性差、不适合动态数据回答质量极高适合企业静态知识库还有很多方案方法核心思路强项弱项典型效果Hybrid RAG向量BM25混合检索召回准、兼顾语义与关键词双索引维护成本高工业界首选稳定RAPTOR分层聚类多层级检索长文档、多章节问题强建树开销大长文本最佳Self-RAG生成后自我反思重查幻觉低、质量可控多一轮LLM、成本高高可靠问答CRAG检索质量评估纠错鲁棒性强、防垃圾进逻辑复杂、链路长开放域稳Adaptive RAG问题难度路由策略速度质量平衡、企业首选需训练分类器生产标准MM-RAG图文统一嵌入、跨模态检索能处理PDF/表格/图片依赖多模态模型、贵文档知识库NodeRAG实体级细粒度知识网络复杂关系推理强构建成本高多跳问答强工程实践现实项目很少只用单一范式经常互相组合例如模块化RAGGraph检索 Agent自省。5. 开源框架/平台本次筛选标准项目核心定位以 RAG 为主区分代码开发SDK与RAG专用服务引擎排除Dify这类以Agent工作流为核心的通用低代码AI平台。下面按照2026年8月GitHub Star热度依次介绍7个主流项目。5.1 RAGFlow⭐ ~88k项目地址RAGFlow是一款面向企业复杂文档场景的开源RAG引擎依托深度文档理解能力构建完整检索增强工作流。项目附带可视化Web管理界面同时开放标准化API方便业务系统集成。虽然内置可选Agent模板但Agent仅作为附加拓展能力产品全部底层设计围绕知识库检索问答构建不属于通用Agent开发平台非常适合国内企业私有化知识库落地。核心特性原生深度文档解析完美支持PDF、扫描件、Excel表格、图文混排、版式复杂合同文档内置混合检索关键词向量检索、重排序、可控切片策略支持可视化调整文本分块答案溯源引用机制每条结论绑定原始文档片段降低模型幻觉结果可审计支持多样化大模型、嵌入模型灵活接入开箱即用无需从零搭建RAG底层链路提供完整HTTP API支持与业务系统深度对接。适用场景企业内部知识库、合同文档问答、扫描资料检索、私有化部署业务问答系统。5.2 LlamaIndex⭐ ~46k项目地址社区公认的RAG优先开发框架前身为GPT‑Index。框架设计初衷就是打通私有数据与大语言模型是面向开发者的代码SDK。虽然支持拓展Agent能力但Agent仅作为可选插件核心链路聚焦文档加载、索引构建、检索调度适合开发者灵活定制各类RAG策略。核心特性内置上百种数据源连接器兼容PDF、网页、数据库、各类文档格式多索引体系向量索引、树形摘要索引、属性知识图谱索引原生支持GraphRAG开发开箱实现HyDE、RAG‑Fusion、父文档检索等大量高级RAG优化方案分层API设计高层API快速搭建Demo底层API支持自定义改写检索、预处理逻辑兼容市面上绝大多数向量数据库、大模型、重排模型。适用场景自定义RAG业务开发、长文档处理、GraphRAG原型验证、需要灵活迭代检索策略的项目。5.3 LightRAG⭐ ~35k项目地址香港大学团队开源的轻量化图增强RAG算法库专注解决传统向量RAG文本碎片化、多跳推理薄弱的痛点。项目代码精简无冗余Web界面、无复杂Agent编排模块专注实现向量检索知识图谱双层检索架构MIT宽松协议方便二次改造与学术验证。核心特性双层检索范式底层向量检索负责细节匹配上层知识图谱完成实体关联、多跳推理支持文档增量更新新增文本自动抽取实体与关系无需全量重建索引原生支持重排序模块可自由切换各类嵌入模型与大模型架构轻量化部署资源开销低于传统GraphRAG方案提供简洁Python接口便于嵌入自有业务代码。适用场景人物、产业链、医疗、法律等强实体关系知识库需要多跳问答的RAG系统。5.4 腾讯 WeKnora⭐ ~20k项目地址腾讯开源企业级RAG知识框架RAG为核心底座ReAct Agent、Wiki图谱为附加扩展能力Go语言实现完整WebUI与企业级API面向私有化知识库落地。核心特性多模态深度文档解析支持PDF、图片、合同兼容飞书、语雀等多源数据导入混合检索向量关键词知识图谱检索支持父子分块、重排序企业级能力RBAC权限、审计日志、答案溯源、多租户模块化可对接主流向量库、各类大模型支持开启Agent模式处理复杂问题不强制依赖Agent。适用场景国内企业私有化知识库、内部文档问答、业务客服知识库。5.5 Haystack 2.x⭐ ~24k项目地址Deepset推出的企业级模块化RAG流水线开发框架采用全新DAG有向图组件化架构面向生产环境设计。框架重心围绕检索、文档处理、问答流水线打造Agent能力仅作为可选拓展不会侵入RAG核心流程商业友好Apache2.0协议。核心特性强类型组件化流水线支持分支路由、循环迭代、条件判断构建复杂动态RAG链路原生支持混合检索、检索结果重排、上下文压缩等工业常用优化手段完善调试链路、日志观测能力方便线上问题定位深度兼容Elasticsearch、OpenSearch等企业主流检索引擎组件高度解耦开发者可以自由替换文档切分、检索、生成模块。适用场景正式上线企业级RAG服务对稳定性、可运维、合规审计有较高要求的项目。5.6 txtai⭐ ~13k项目地址一体化轻量级嵌入式RAG Python库最大特点是内置嵌入、向量存储、语义检索、问答能力不需要额外部署独立向量数据库。项目主打轻量化语义检索场景不内置重型Agent工作流适合嵌入小型程序、本地离线应用。核心特性单包依赖极简向量索引内置支持稠密向量、稀疏关键词混合检索同时支持语义检索、RAG问答、主题建模API简洁支持导出REST服务可快速封装成独立语义问答服务跨平台友好适配PC、边缘设备离线运行支持图文、文本多模态向量构建。适用场景本地离线知识库、嵌入式程序内置问答、轻量化小型Demo、边缘端RAG应用。5.7 阿里 PAI‑RAG⭐ ~ 0.5k项目地址阿里开源Agentic‑RAG企业框架以RAG流水线为基础叠加查询改写、ReAct、MCP工具调用提供WebUI与全套API适合复杂业务问答。核心特性多模态文档解析内置混合检索、Rerank重排序原生Query改写、问题拆解支持多跳问答ReAct智能体、MCP工具、Text‑to‑SQL能力兼容通义、开源LLM、第三方模型完整可观测支持私有化部署。适用场景复杂业务问答、需要工具调用、多跳推理的企业RAG项目。6. 小结结合上下文工程视角来看RAG不是简单的 “向量库大模型”而是一套完整的中层系统实现由底层三大基础组件组装而成。从朴素RAG一路演进到模块化、智能体、图增强RAG本质就是上下文工程思想不断落地对检索、处理、记忆做动态编排构造最优的输入上下文C A ( c 1 , c 2 , … , c n ) C\mathcal{A}(c_1,c_2,\dots,c_n)CA(c1,c2,…,cn)约束在token窗口内最大化任务相关信息。