资讯动态

如何快速上手WeKnora:本地文档RAG问答完整新手指南

发布时间:2026/9/6 23:41:07 来源:尧图企业网站定制
如何快速上手WeKnora本地文档RAG问答完整新手指南【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora手上一堆 PDF 合同、产品手册、内部流程文档越攒越多。新人来问一句你要一页页翻给他找翻到了还可能是不再有效的旧版本。WeKnora 是一个开源的 LLM 知识平台把这堆原始文档丢进去它能变成一个可提问的 RAG 知识库——用自然语言问每条回答都附带原文段落出处还带 ReAct 智能推理和自动维护的 Wiki。 十分钟跑通本地部署环境只要三样Docker 与 Docker Compose20.10 及以上4 核 CPU / 8GB 内存起步docreader 里带着 LibreOffice 和 Playwright比较吃内存一套能用的模型本地 Ollama或任意 OpenAI 兼容服务DeepSeek、通义、智谱、硅基流动等。至少备一个对话模型 一个向量模型Embedding把文字转成数字向量以便按语义比对三步启动第一步克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/we/WeKnora cd WeKnora第二步把.env.example复制为.env按文件内注释填必填项数据库账号密码、Redis 密码、JWT 密钥等。第三步拉镜像并启动docker compose pull docker compose up -d等服务全部变成 healthy浏览器打开http://localhost就是注册页。注册完自动得到一个属于你自己的工作空间你在这个空间里是 Owner。问出第一个答案界面里点四下在「知识库」页新建填个名字类型选document初始化向导里为这个库选对话模型和向量模型点「测试」确认连通用本地 Ollama 时后端在容器里地址要填http://host.docker.internal:11434不是 localhost拖入文件——PDF、Word、Excel、PPT、Markdown、图片都能解析后台异步跑列表里能看到进度进对话页选中这个知识库提问回答带引用角标点引用能跳回原文。到这里最小闭环已经跑通。整个过程大部分时间在等拉镜像和等文档解析机器配置不高或不想碰 Docker 的话还有个 Lite 版单二进制、内嵌 SQLiteFTS5 sqlite-vec、零外部依赖make build-lite即可。 它是怎么工作的先翻文档再作答还写上页码核心机制叫 RAG检索增强生成大白话就是让 AI 先翻文档再作答。它不会把你的整摞文档塞给大模型硬背而是每次提问时先找出最相关的几段只拿这些段落去作答并把出处一并标出来。整条链路分前后两半入库上传后跑一次docreader 服务把文件解析成结构化文本支持 PDF、Word、Excel、PPT、EPUB、图片OCR等十余种格式解析器源码在 docreader/parser/按语义段落切成分块之后检索和引用都以块为单位向量模型把每个块变成向量存进数据库同时建一份 BM25 关键词索引BM25 是一种按词频给文档排名的经典算法擅长命中专有名词、编号这类精确词。检索 作答每次提问跑一遍问题先被改写——多轮对话里的那它的价格呢会先补全成独立句多路同时出发BM25 抓精确词向量检索抓换了个说法的语义知识图谱检索可选开启、补充段落之间的关联Rerank重排用一个专门的模型给候选段落重新打相关分把混进来的无关内容压下去留下最相关的几条大模型基于这几段生成回答。复杂问题下由 ReAct 智能体接管ReAct 思考 行动的循环模型自己决定检索几轮、要不要联网、要不要调工具。整体系统的布局看这张架构图Web、API、IM、MCP 这些输入都进同一个引擎存储层的 PostgreSQL/ParadeDB、向量库、对象存储、Redis 全部可以替换私有化边界很清晰。 核心能力拆解它具体能帮你做什么能力能帮你做什么一个小例子混合检索BM25 关键词 向量语义 图谱可选 重排每路各补一路的漏搜第 7.2 条 终止违约金能命中合同精确页单靠向量检索7.2这种编号容易丢多格式文档解析PDF / Word / Excel / PPT / EPUB / MHTML / 图片OCR等 12 格式扫描件也能读上传扫描件 PDF直接问表格里的数字ReAct 智能体推理模型自决检索几轮、是否联网、是否调 MCP 工具处理一步检索答不了的问题竞品最新报价是多少、和我们政策差多少一句话问完Wiki 模式Agent 从原始文档自动生成相互链接的 Markdown 页面与图谱支持人工编辑、版本历史、一键回滚一摞原始文档变成可浏览的内部维基不用人手动维护多渠道接入Web UI、REST API、weknora CLI、10 个 IM 渠道企业微信、飞书、Lark、Slack、Telegram、钉钉、Mattermost、微信、QQBot、云之家、网站嵌入挂件员工在企业微信里直接问不必再开一个网页完全私有化部署8 种向量库后端pgvector、Elasticsearch、OpenSearch、Milvus、Weaviate、Qdrant、Doris、腾讯云 VectorDB16 模型厂商Helm 可部署到自有 K8s内网起一套数据不出域模型和存储都能换另外两点值得记住回答带引用每条答案能追溯回具体段落知识库来源和网络来源分开展示点引用即可核验可观测集成 Langfuse每一次 ReAct 循环、工具调用、Token 消耗都有记录回答为什么跑偏了这类问题查得出来。 两个实战场景企业知识库与网站智能客服场景一合同与手册的共享知识库谁用法务、产品、客服以及所有文档攒了一堆、但没人维护问答表的团队。怎么用内网机器 Docker Compose 部署K8s 则用 Helm建一个合同库向导里选好模型把整摞 PDF 拖进去解析完成后把页面链接分享到团队群或者接上企业微信 / 飞书直接在 IM 里问。得到什么答案自带出处引用新人自助找答案不用逐条追问你条款更新了传新版本覆盖旧的即可不用人工维护问答表。空间级四级角色Owner / Admin / Contributor / Viewer可以控制谁能看、谁能传、谁能管。场景二官网与产品站点的自助问答谁用官网、产品运营想让高频重复问题不再占用人力。怎么用开启网站嵌入 Widget把一段配置挂到自己的站点上内置域名白名单与限流知识库与问答链路和内部那套完全复用。得到什么常见问题自动答、带出处人工只接例外每一次问答都能在 Langfuse 面板里回放回答出问题时能看出发生在检索、重排还是生成的哪一段。顺带一提接到你的开发链路里想在程序里调用它REST API 统一前缀/api/v1提供权限范围 API Key能力级授权 按知识库限制官方 MCP Server 带 29 个工具支持 stdio / SSE / HTTP 三种传输weknoraCLI 可以在终端直接管知识库。完整接口与环境变量说明都在 website-docs/ 官方文档站里按「入门 → 架构 → 功能 → API → 客户端 → 开发」六个板块组织。 下一步WeKnora 把一摞没人整理的文档变成可查询、可推理、可自动维护的知识资产且模型、向量库、存储后端都可替换数据始终留在自己的域内。跑起来之后想深入就翻 website-docs/含可运行的样例数据部署遇到问题先看 docs/QA.md 的常见问题排查部分。【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价