资讯动态

基于 Deepseek LLM 本地知识库搭建开源方案(AnythingLLM、Cherry、Ragflow、Dify)认知

发布时间:2026/8/27 17:59:40 来源:尧图企业网站定制
写在前面博文内容涉及 基于 Deepseek LLM 的本地知识库搭建使用 ollama 部署 Deepseek-R1 LLM知识库能力通过 Ragflow、Dify 、AnythingLLM、Cherry 提供理解不足小伙伴帮忙指正 ,生活加油本地 LLM 部署LLM 本身只是一些神经网络参数, 就拿 DeepSeek-R1 来讲模型本身存储了权重矩阵以及 混合专家MoE架构 实际运行起来需要行业级别的服务器配置 消费级别的个人电脑不能直接运行实际还涉及到硬件适配需手动配置CUDA/PyTorch环境编写分布式推理代码处理量化与内存溢出问题现在通过ollama可以在消费级别电脑部署上面涉及到的问题ollama帮我们完成同时还涉及模型的管理推理服务构建ollama开源项目地址 https://github.com/ollama/ollama它在项目中这样介绍自己Get up and running with large language models.ollama安装下载 ollama之后直接安装就可以下载地址 https://ollama.com/downloadollama 专注于在本地设备如个人电脑或服务器快速部署和运行开源大语言模型如 DeepSeek-R1支持模型下载、环境配置及基础推理服务。适用需本地化运行 LLM 的场景强调数据隐私与低成本无需高性能服务器但是不提供知识库管理、RAG 或应用开发功能需配合其他工具使用安装成功会自动配置环境变量PS C:\Users\Administratorollama-h Large language model runner Usage:ollama[flags]ollama[command]Available Commands:serve Start ollama create Create a modelfroma Modelfile show Show informationfora model run Run a model stop Stop a running model pull Pull a modelfroma registry push Push a model to a registrylistList models ps List running models cp Copy a model rm Remove a modelhelpHelp aboutanycommand 。。。。。。Ollama 采用 Client-ServerC/S架构,C 端通过命令行CLI或桌面应用与用户交互发起模型请求。S 端负责处理客户端请求管理模型下载与元数据推理引擎负责加载模型并执行计算Ollama资源优化技术:权重量化支持 INT8/INT4 量化显存占用降低至原始模型的 1/2 至 1/4使 65B 参数模型可在 16GB 内存设备运行分块加载长文本分块处理避免显存溢出GPU/CPU 调度优先调用 NVIDIA/AMD GPU 加速无 GPU 时通过 Metal 或分布式计算优化 CPU 模式模型管理机制本地存储模型文件如 blobs 数据和元数据如 manifests默认存储在 $HOME/.ollama支持离线使用,数据无需上传云端适合医疗、金融等隐私敏感场景。模型拉取客户端通过 ollama run 模型名 触发服务端从远程仓库下载并缓存模型通过下面的地址选择对应的参数的模型即可https://ollama.com/library/deepseek-r1deepseek R1 蒸馏模型部署关于什么是蒸馏模型小伙伴可以看我之前的文章模型下载成功就可以用了默认会自动下载DeepSeek-R1-Distill-Qwen-7B模型PS C:\Users\Administratorollama run deepseek-r1 pulling manifest pulling 96c415656d37...100%▕████████████████████████████████████████████████████████▏4.7GB pulling 369ca498f347...100%▕████████████████████████████████████████████████████████▏387B pulling 6e4c38e1172f...100%▕████████████████████████████████████████████████████████▏1.1KB pulling f4d24e9138dd...100%▕████████████████████████████████████████████████████████▏148B pulling 40fb844194b2...100%▕████████████████████████████████████████████████████████▏487B verifying sha256 digest writing manifest success直接命令行就可以交互了算一道数学题PS C:\Users\Administratorollama run deepseek-r1123454654213thinkTo solve the equation \(123454654213\),I will follow these steps:First,add the numbersfrom1to4.Next,add the result to54654.Finally,add thissumto213to get the final answer./thinkTo solve the equation \(123454654213\),follow these steps:1.**Add the numbersfrom1to4:**\[123410\]2.**Add thissumto54654:**\[105465454664\]3.**Finally,add the result to213:**\[5466421354877\]**Final Answer:**\boxed{54877}Send a message这里通过命令行的方式启动服务端配置$env:OLLAMA_HOST0.0.0.0的作用是 将 Ollama 服务绑定到所有网络接口,因为后面涉及到和其他工具交互。PS C:\Users\Administrator$env:OLLAMA_HOST0.0.0.0# 设置环境变量服务启动涉及到的环境变量在项目中位置https://github.com/ollama/ollama/blob/main/envconfig/config.goPS C:\Users\Administratorollama serve# 启动服务2025/02/2008:47:44routes.go:1187:INFO server config envmap[CUDA_VISIBLE_DEVICES: GPU_DEVICE_ORDINAL: HIP_VISIBLE_DEVICES: HSA_OVERRIDE_GFX_VERSION: HTTPS_PROXY: HTTP_PROXY: NO_PROXY: OLLAMA_DEBUG:false OLLAMA_FLASH_ATTENTION:false OLLAMA_GPU_OVERHEAD:0 OLLAMA_HOST:http://0.0.0.0:11434 OLLAMA_INTEL_GPU:false OLLAMA_KEEP_ALIVE:5m0s OLLAMA_KV_CACHE_TYPE: OLLAMA_LLM_LIBRARY: OLLAMA_LOAD_TIMEOUT:5m0s OLLAMA_MAX_LOADED_MODELS:0 OLLAMA_MAX_QUEUE:512 OLLAMA_MODELS:C:\\Users\\Administrator\\.ollama\\models OLLAMA_MULTIUSER_CACHE:false OLLAMA_NOHISTORY:false OLLAMA_NOPRUNE:false OLLAMA_NUM_PARALLEL:0 OLLAMA_ORIGINS:[http://localhost https://localhost http://localhost:* https://localhost:* http://127.0.0.1 https://127.0.0.1 http://127.0.0.1:* https://127.0.0.1:* http://0.0.0.0 https://0.0.0.0 http://0.0.0.0:* https://0.0.0.0:* app://* file://* tauri://* vscode-webview://*] OLLAMA_SCHED_SPREAD:false ROCR_VISIBLE_DEVICES:]time2025-02-20T08:47:44.74708:00levelINFO sourceimages.go:432msgtotal blobs: 14time2025-02-20T08:47:44.74808:00levelINFO sourceimages.go:439msgtotal unused blobs removed: 0time2025-02-20T08:47:44.74808:00levelINFO sourceroutes.go:1238msgListening on [::]:11434 (version 0.5.7)time2025-02-20T08:47:44.74908:00levelINFO sourceroutes.go:1267msgDynamic LLM librariesrunners[cpu_avx cpu_avx2 cuda_v11_avx cuda_v12_avx rocm_avx cpu]time2025-02-20T08:47:44.74908:00levelINFO sourcegpu.go:226msglooking for compatible GPUstime2025-02-20T08:47:44.74908:00levelINFO sourcegpu_windows.go:167msgpackages count1time2025-02-20T08:47:44.74908:00levelINFO sourcegpu_windows.go:183msgefficiency cores detectedmaxEfficiencyClass1time2025-02-20T08:47:44.74908:00levelINFO sourcegpu_windows.go:214msgpackage0cores12efficiency4threads20time2025-02-20T08:47:44.87208:00levelINFO sourcetypes.go:131msginference computeidGPU-e65029a6-c2f9-44b1-bd76-c12e4083fa4c librarycuda variantv12 compute8.6driver12.8nameNVIDIA GeForce RTX 3060total12.0 GiBavailable11.0 GiB[GIN]2025/02/20-08:47:57|200|0s|172.19.16.1|GET/[GIN]2025/02/20-08:47:57|404|0s|172.19.16.1|GET/favicon.ico同时项目启动之后会输出当前推理服务的环境变量2025/02/2008:47:44routes.go:1187:INFO server config envmap[CUDA_VISIBLE_DEVICES: GPU_DEVICE_ORDINAL: HIP_VISIBLE_DEVICES: HSA_OVERRIDE_GFX_VERSION: HTTPS_PROXY: HTTP_PROXY: NO_PROXY: OLLAMA_DEBUG:false OLLAMA_FLASH_ATTENTION:false OLLAMA_GPU_OVERHEAD:0 OLLAMA_HOST:http://0.0.0.0:11434 OLLAMA_INTEL_GPU:false OLLAMA_KEEP_ALIVE:5m0s OLLAMA_KV_CACHE_TYPE: OLLAMA_LLM_LIBRARY: OLLAMA_LOAD_TIMEOUT:5m0s OLLAMA_MAX_LOADED_MODELS:0 OLLAMA_MAX_QUEUE:512 OLLAMA_MODELS:C:\\Users\\Administrator\\.ollama\\models OLLAMA_MULTIUSER_CACHE:false OLLAMA_NOHISTORY:false OLLAMA_NOPRUNE:false OLLAMA_NUM_PARALLEL:0 OLLAMA_ORIGINS:[http://localhost https://localhost http://localhost:* https://localhost:* http://127.0.0.1 https://127.0.0.1 http://127.0.0.1:* https://127.0.0.1:* http://0.0.0.0 https://0.0.0.0 http://0.0.0.0:* https://0.0.0.0:* app://* file://* tauri://* vscode-webview://*] OLLAMA_SCHED_SPREAD:false ROCR_VISIBLE_DEVICES:]如果有需要部署生产级别的小伙伴需要详细了解这里简单看几个常用的OLLAMA_HOST作用指定服务器监听的 IP 地址和端口。它定义了客户端可以访问服务器的地址。当前值http://0.0.0.0:11434表示服务器将监听所有可用的网络接口端口为 11434使用 HTTP 协议。OLLAMA_KEEP_ALIVE作用设置模型在内存中保持加载的时间。如果在这个时间内没有新的请求模型可能会被卸载以释放内存。当前值5m0s即 5 分钟意味着模型在 5 分钟内没有被使用就可能会被卸载。OLLAMA_LOAD_TIMEOUT作用设置模型加载的超时时间。如果模型在这个时间内没有加载完成服务器可能会放弃加载操作。当前值5m0s表示模型加载的最长时间为 5 分钟。OLLAMA_MAX_LOADED_MODELS作用限制每个 GPU 上最多可以加载的模型数量。这有助于控制 GPU 的资源使用。当前值0表示没有对每个 GPU 加载的模型数量进行限制。OLLAMA_MAX_QUEUE作用设置请求队列的最大长度。当请求数量超过这个值时新的请求可能会被拒绝。当前值512表示请求队列最多可以容纳 512 个请求。OLLAMA_MODELS作用指定模型文件存储的目录。服务器会从这个目录中加载模型。当前值C:\Users\Administrator.ollama\models表示模型文件存储在该 Windows 用户目录下的 . ollama\models 文件夹中。OLLAMA_NUM_PARALLEL作用设置服务器可以同时处理的并行模型请求数量。当前值0表示没有对并行请求数量进行限制。知识库搭建在知识库搭建的时候我们还需要一个基本的嵌入模型用于理解分析已有的知识库内容嵌入模型这里我们使用的是BGE-M3嵌入模型是什么通俗的话讲它把文本信息翻译成计算机能够理解和处理的数字形式也就是向量。它就像是给每一段文本生成了一个独一无二的 “数字指纹”凭借这个 “指纹”计算机就能对文本进行各种分析和操作。有了嵌入模型分析知识库的文本内容那么是如何和问答结合的这就需要RAGRAG检索增强生成RAG是一种将外部知识检索与大语言模型LLM相结合的技术。传统的大语言模型虽然拥有丰富的知识但知识更新可能不及时或者在特定领域的知识储备不足。RAG 通过在生成回答之前先从外部知识源如文档数据库、网页等中检索相关信息然后将这些信息与用户的问题一起输入到大语言模型中从而生成更准确、更具时效性的回答。需要注意的事项知识库的搭建部分使用的是容器的方式所以调用ollama提供的推理能力的时候通过127.0.0.0:11434访问是访问不通的所以需要一个能代表宿主机但是IP地址或者域名不是 127.0.0.0或localhost 的地址。在windos 上面会有这个一个虚拟交换设备 在其他服务调用 ollama 的时候需要本地ID11434 的方式访问这里我们选用这个 IP 172.29.176.1:11434,至于这个 设备如何创建的一般开启虚拟化 Hyper - V 的时候会自动创建以太网适配器 vEthernet(Default Switch):连接特定的 DNS 后缀.......:本地链接 IPv6 地址........:fe80::c872:92b3:b00a:6ce0%25IPv4 地址............:172.29.176.1子网掩码............:255.255.240.0默认网关.............:对于通过客户端的方式直接部署的我们可以之间使用127.0.0.0:11434或者 localhost 来访问推理服务Ragflow DeepSeekRAGFlow是一款基于深度文档理解构建的开源 RAGRetrieval-Augmented Generation检索增强生成引擎。RAGFlow 可以为各种规模的企业及个人提供一套精简的RAG工作流程结合大语言模型LLM针对用户各类不同的复杂格式数据提供可靠的问答以及有理有据的引用。官网地址https://ragflow.io项目地址 https://github.com/infiniflow/ragflow这里需要使用 docker 来部署安装dockr 克隆项目执行docker-compose就可以了git clone https://github.com/infiniflow/ragflow.git然后参考 readme 部署即可$ cd ragflow/docker $ docker compose-f docker-compose.yml up-d这里需要说明一下有些docker-compose维护不及时可能部署有问题所以我们用 readme 推荐的方式上面截图中 GPU 版本的 我尝试了好久server 启动链接 es 报错未果用了默认的 compose。部署成功之后可以在docker 桌面版中看到容器核心服务是一个 server默认 80 端口需要注册账号登陆需要先配置基础模型需要注意这里的地址不能写 127.0.0.1选择本地模型 LLM 模型选择嵌入模型在系统模型设置添加对应的模型选择知识库创建知识库在配置中配置需要的数据上传本地的知识库内容全选解析启用之后在聊天配置中选择对应的知识库模型参数调整简单测试每次提问会显示对应的文本内容Dify DeepSeekDify 是一个开源的LLM 应用开发平台。其直观的界面结合了 AI 工作流、RAG 管道、Agent、模型管理、可观测性功能等可以快速从原型到生产。官网地址 https://dify.ai/zh项目地址 https://github.com/langgenius/dify/blob/main/README_CN.md和上面的部署一眼克隆项目然后通过 docker 部署git clone https://github.com/langgenius/dify.git运行项目中的 docker-compose.yml这里直接通过 vs code 运行docker 中观察容器运行情况同样是 80 端口需要注册一个账号用注册的账号登陆即可选择知识库在用户中心设置中配置模型相关配置配置本地模型需要注意这里的地址配置嵌入模型然后中模型配置中添加选择创建知识库导入本地知识库分段相关配置保存设置等待文档解析完成知识库创建完成创建聊天助手上下文选择之前创建的知识库做简单的问答测试可以看到最下面引用的文档点击发布知识库机器人创建完成Cherry Studio DeepSeekCherry Studio是一款开源、跨平台支持 Windows/macOS/Linux的 AI 桌面客户端专注于聚合多模型服务并提供本地化 AI 应用开发支持。官网地址 https://cherry-ai.com/下载地址 https://cherry-ai.com/download项目地址 https://github.com/CherryHQ/cherry-studio它的这样介绍自己Cherry Studio是一款支持多个大语言模型LLM服务商的桌面客户端兼容 Windows、Mac 和 Linux 系统。以下是其核心功能与使用要点多模型集成支持 300 主流大语言模型包括 DeepSeek、OpenAI、Gemini、Claude 等通过 API 密钥接入云端服务也支持本地部署模型如 Ollama知识库管理:可上传 PDF、Word、Excel、网页链接等文件构建本地结构化数据库通过 RAG 技术实现智能检索支持向量化处理和来源标注预置智能体: 内置 300 行业助手如翻译、编程、营销支持自定义提示词Prompt创建专属 AI 应用多模态处理: 支持文本生成、图像生成集成硅基流动等平台、代码高亮、Markdown 渲染及文件格式转换下面我们看看如何搭建下载安装设置图标选择模型服务选择本地的ollama服务,模型配置选择我们之前 pull 的模型然后在默认助手中作简单测试选择知识库图标创建知识库添加嵌入模型然后上传要创建知识库的文件可以通过搜索知识库简单测试然后就可以提问了选择一开始添加的本地模型提问的时候选择知识库文档中的内容做简单问答测试引用知识库中的内容AnythingLLM DeepSeekAnythingLLM 同样是一个全栈应用程序可以使用现成的商业大语言模型或流行的开源大语言模型再结合向量数据库解决方案构建一个私有ChatGPT不再受制于人您可以本地运行也可以远程托管并能够与您提供的任何文档智能聊天。官网下载地址 https://anythingllm.com/文档地址 https://docs.anythingllm.com/项目地址 https://github.com/Mintplex-Labs/anything-llm/blob/master/locales/README.zh-CN.md下载安装包直接安装即可安装完后会有如下的界面选择本地的模型之后一直下一步创建工作区然后在新工作区选择下面的箭头导入知识库文档添加到工作区选择启用问一个知识库相关的问题测试最下面会列出引用的文档LLM 相关配置可以在设置中设置AnythingLLM和Cherry Studio都是客户端所以 ollama 的推理模型直接设置 本地回环地址就可以整体来看Ragflow 相对专业一点其次是 Dify Cherry Studio AnythingLLM 但是前两个相对部署较重后两个客户端可以直接客户端部署。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价