资讯动态

【AI大模型实战】手把手教你基于Dify搭建RAG知识库,全程干货,零基础小白也能轻松学会!!

发布时间:2026/8/27 14:57:11 来源:尧图企业网站定制
前言Dify 是一款开源的大模型应用开发平台旨在帮助开发者快速构建生产级生成式 AI 应用。在Dify 本地化部署中知识库功能是实现企业级 AI 应用的核心能力。本文介绍基于版本 1.5.1 搭建知识库全流程解析一、Dify基本概念Dify 是一款开源的大模型应用开发平台旨在帮助开发者快速构建生产级生成式 AI 应用。它集成了模型管理、提示词工程、数据检索、工作流编排和运维监控等核心功能支持数百种开源及商业大模型如 Llama3、GPT-4、Claude 等并提供可视化工作流设计、RAG检索增强生成管道、Agent 智能体框架等特色能力。其核心特点包括1. 低代码/无代码界面通过可视化编排 Prompt、连接知识库、配置 Agent 工作流降低 AI 开发门槛。2. 技术栈整合内置 RAG 管道、多模型支持如 OpenAI、本地模型、可观测性工具避免重复开发基础组件。3. 开源与自托管代码完全开放支持 Docker 私有化部署确保数据隐私与合规性。二、Dify本地部署1. Docker部署2. Dify部署硬件要求CPU ≥ 2 核RAM ≥ 4GB推荐 8GB 以上以运行中等模型# 克隆仓库git clone https://github.com/langgenius/dify.git cd dify/docker# 复制环境配置cp .env.example .env# 启动容器sudo docker compose up -d验证服务**访问 http://localhost/install**初始化管理员账号。3. 模型配置在“设置”—“模型供应商”中自定义配置所需的大模型API-KEY类型包括Chat、Text Embedding、Rerank模型。三、基于Dify的知识库搭建1. Dify知识库介绍Dify 知识库系统通过**RAG检索增强生成**技术实现核心流程LLM 接收到用户的问题后将首先基于关键词在知识库内检索内容。知识库将根据关键词召回相关度排名较高的内容区块向 LLM 提供关键上下文以辅助其生成更加精准的回答。开发者可以通过此方式确保 LLM 不仅仅依赖于训练数据中的知识还能够处理来自实时文档和数据库的动态数据从而提高回答的准确性和相关性。支持多种文本类型例如长文本内容TXT、Markdown、DOCX、HTML、JSON 甚至是 PDF结构化数据CSV、Excel 等在线数据源网页爬虫、Notion 等将文件上传至“知识库”即可自动完成数据处理。如果内部已建有独立知识库可以通过连接外部知识库与 Dify 建立连接。2. 知识库搭建“知识库”—“创建知识库”—“选择数据源”选择作为知识库的来源。2.1 指定分段模式知识库支持两种分段模式通用模式与父子模式。如果你是首次创建知识库建议选择父子模式。1通用模式系统按照用户自定义的规则将内容拆分为独立的分段在该模式下需要根据不同的文档格式或场景要求参考以下设置项设置文本的分段规则。分段标识符如\n可以遵循正则表达式语法自定义分块规则系统将在文本出现分段标识符时自动执行分段。下图是不同语法的文本分段效果分段最大长度指定分段内的文本字符数最大上限超出该长度时将强制分段。默认值为 500 Tokens分段长度的最大上限为 4000 Tokens**分段重叠长度**指的是在对数据进行分段时段与段之间存在一定的重叠部分。这种重叠可以帮助提高信息的保留和分析的准确性提升召回效果。建议设置为分段长度 Tokens 数的 10-25%配置完成后点击“预览区块”即可查看分段后的效果。可以直观的看到每个区块的字符数。如果重新修改了分段规则需要重新点击按钮以查看新的内容分段。若同时批量上传了多个文档轻点顶部的文档标题快速切换并查看其它文档的分段效果。2父子模式与通用模式相比父子模式采用双层分段结构来平衡检索的精确度和上下文信息,让精准匹配与全面的上下文信息二者兼得。其中**父区块Parent-chunk保持较大的文本单位如段落提供丰富的上下文信息子区块Child-chunk则是较小的文本单位如句子用于精确检索。系统首先通过子区块进行精确检索以确保相关性然后获取对应的父区块来补充上下文信息从而在生成响应时既保证准确性又能提供完整的背景信息。**可以通过设置分隔符和最大长度来自定义父子区块的分段方式。例如在 AI 智能客服场景下用户输入的问题将定位至解决方案文档内某个具体的句子随后将该句子所在的段落或章节联同发送至 LLM补全该问题的完整背景信息给出更加精准的回答。其基本机制包括子分段匹配查询将文档拆分为较小、集中的信息单元例如一句话更加精准地匹配用户所输入的问题。子分段能快速提供与用户需求最相关的初步结果。父分段提供上下文将包含匹配子分段的更大部分如段落、章节甚至整个文档视作父分段并提供给大语言模型LLM。父分段能为 LLM 提供完整的背景信息避免遗漏重要细节帮助 LLM 输出更贴合知识库内容的回答。配置完成后点击“预览区块”即可查看分段后的效果。可以查看父分段的整体字符数。背景标蓝的字符为子分块同时显示当前子段的字符数。3两种模式的区别两者的主要区别在于内容区块的分段形式。通用模式的分段结果为多个独立的内容分段而父子模式采用双层结构进行内容分段即单个父分段的内容文档全文或段落内包含多个子分段内容句子。不同的分段方式将影响LLM对于知识库内容的检索效果。在相同文档中采用父子检索所提供的上下文信息会更全面且在精准度方面也能保持较高水平大大优于传统的单层通用检索方式。2.2 索引方法与检索设置提供高质量与经济两种索引方法其中分别提供不同的检索设置选项在高质量模式下使用Embedding嵌入模型将已分段的文本块转换为数字向量帮助更加有效地压缩与存储大量文本信息使得用户问题与文本之间的匹配能够更加精准。将内容块向量化并录入至数据库后需要通过有效的检索方式调取与用户问题相匹配的内容块。高质量模式提供向量检索、全文检索和混合检索三种检索设置。1向量检索定义向量化用户输入的问题并生成查询文本的数学向量比较查询向量与知识库内对应的文本向量间的距离寻找相邻的分段内容。**Rerank****模型**默认关闭。开启后将使用第三方Rerank模型再一次重排序由向量检索召回的内容分段以优化排序结果。帮助LLM获取更加精确的内容辅助其提升输出的质量。TopK****用于筛选与用户问题相似度最高的文本片段。系统同时会根据选用模型上下文窗口大小动态调整片段数量。默认值为 3数值越高预期被召回的文本分段数量越多。**Score阈值**用于设置文本片段筛选的相似度阈值只召回超过设置分数的文本片段默认值为 0.5。数值越高说明对于文本与问题要求的相似度越高预期被召回的文本数量也越少。2全文检索定义关键词检索即索引文档中的所有词汇。用户输入问题后通过明文关键词匹配知识库内对应的文本片段返回符合关键词的文本片段类似搜索引擎中的明文检索。**Rerank****模型**默认关闭。开启后将使用第三方Rerank模型再一次重排序由全文检索召回的内容分段以优化排序结果。向LLM发送经过重排序的分段辅助其提升输出的内容质量。3混合检索定义同时执行全文检索和向量检索或Rerank模型从查询结果中选择匹配用户问题的最佳结果。权重设置允许用户赋予语义优先和关键词优先自定义的权重。关键词检索指的是在知识库内进行全文检索Full Text Search语义检索指的是在知识库内进行向量检索Vector Search。Rerank模型默认关闭开启后将使用第三方Rerank模型再一次重排序由混合检索召回的内容分段以优化排序结果。3.知识库使用运用Dify内置的应用模板创建基于知识库的问答系统“工作室”—“从应用模板创建”—“Knowledge Retreival Chatbot”在“Knowledge Retrieval”组件配置知识库名称和召回设置在“LLM”组件中设置模型类型及将知识库检索结果作为上下文设置完成后进行预览测试可在工作流中查看每一步的运行情况在“Knowledge Retrieval”输出中可查看知识库的检索结果总结Dify通过知识库索引优化、多模态支持和动态参数校验构建了企业级 AI 知识库的完整技术栈。其本地化部署方案在数据安全GDPR/HIPAA 合规、性能和成本上具有显著优势。无论是医疗、金融还是制造业均可通过 Dify 实现私有数据的智能管理与精准应用。建议企业结合自身业务场景灵活运用 FireCrawl 爬取、Xinference 模型部署等扩展方案打造贴合需求的行业级知识库系统。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价