ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

三步搭好一个能用的企业知识库:开源 RAG 框架 WeKnora 上手实战

三步搭好一个能用的企业知识库:开源 RAG 框架 WeKnora 上手实战 三步搭好一个能用的企业知识库开源 RAG 框架 WeKnora 上手实战【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnoraWeKnora 是一个基于 LLM 的开源智能知识管理框架RAG 平台。它把散落在手里的文档变成可查询的知识库、会自主调工具的推理代理以及一份能自我维护的 Wiki。适合想快速搭企业知识库、做文档智能问答又要求数据留在自己机器上的开发者和小团队。它到底是什么一套框架三种用法日常查资料走 RAG 快速问答复杂问题交给 ReAct 代理自主拆步骤、调工具还能开 Wiki 模式让代理把原始文档整理成带知识图谱、可编辑可回滚的 Markdown 知识库格式全兼容PDF / Word / Excel / PPT / Markdown / HTML / EPUB / 图片 / CSV / JSON 等 10 种文档格式直接丢进去模型随便换OpenAI、DeepSeek、通义千问、智谱、混元、Gemini 等 20 多家 LLM 提供商外加 Ollama 本地模型向量库支持 PostgreSQL、Qdrant、Milvus、Weaviate、Elasticsearch、OpenSearch、Doris、腾讯 VectorDB 共 8 种后端入口很多Web UI、REST API、CLI、MCP Server、浏览器扩展、网页嵌入组件以及企微、飞书、Slack、Telegram 等 10 个 IM 渠道这张图里一眼能看完所有部件上面是各种入口渠道中间引擎负责解析、分块、向量化和检索底层是 PostgreSQL、向量库、Redis 这些随便换的存储。三步跑起来装好 Docker 和 Docker Compose 后最短路径就这几行git clone https://gitcode.com/GitHub_Trending/we/WeKnora cd WeKnora cp .env.example .env # 按注释填模型、数据库等信息 docker compose pull docker compose up -d起来后浏览器打开http://localhost后端 API 在http://localhost:8080。核心栈包含前端、应用、PostgreSQLparadedb 镜像BM25 和向量一体化、Redis 和 docreader 解析服务全部容器化。可选组件走 Compose profiles按需开就行要知识图谱docker compose --profile neo4j up -d要调用链路追踪--profile langfuse要对象存储--profile minio全都要--profile full它是怎么干活的挑三个真正拉开差距的机制说。1. 自适应三档分块文档切块前会先跑一个剖析器统计标题、分页符、多语言章节标记这些结构信号然后自动在 auto / heading按#标题切/ heuristic按 PDF 版式特征切/ 递归切分里挑最合适的切出来明显太碎会自动降级重试。好处是不用按文档类型手工调参Markdown 手册和扫描件 PDF 都能拿到合理分块。2. 多路混合检索 重排序BM25 关键词、密集向量、知识图谱多路召回再用 LLM rerank 对候选重排。一句话关键词防漏、向量管意会、重排去噪三件事各管一段。3. ReAct 代理引擎代理模块在 internal/agent/ 下基于 ReAct 循环让模型自己决定调哪个工具——查知识库、调 MCP 工具、做网络搜索——多步迭代SSE 流式输出。好处是它不只是照着检索结果回答而是能把复杂问题拆成几步去干。这张图里从左到右就是三段先把数据喂进索引查询进来后经过改写、多路检索、重排最后才进 LLM 生成回答。能拿来做什么把内部手册变成值班机器人上传产品手册或运维文档直接在企微、飞书里问中控 Pro 怎么设置回家模式得到的是一步步的操作说明并标注引自哪份文档。这张截图里回答给出了触发条件、执行动作、配置步骤三段式结构底部还附了引用来源不用再去翻 PDF。让代理替人跑多步任务切到代理模式模型会自己决定查哪个知识库、调哪个 MCP 工具、要不要上网搜中间的工具调用过程在对话里全程可见出了问题能顺着链路排查。让文档库自己长出 Wiki开 Wiki 模式后代理把原始文档蒸馏成互相链接的 Markdown 页面和知识图谱支持在线编辑、逐版本 diff 和一键回滚。适合团队把文档散落各处、没人维护的老问题直接消掉。调优速查关键参数都集中在 config/config.yaml常见场景这么调chunk_size / chunk_overlap默认 512 / 50FAQ、短问答型把 chunk_size 压到 200–400、overlap 设为 0长报告、叙事类文档提到 1000–2000分块策略Markdown 文档用 headingPDF 报告用 heuristic混合语料就留 auto 让系统自己选embedding_top_k / rerank_top_k默认都是 30答案经常没找到先把这两个调大扩召回vector_threshold 0.2 / rerank_threshold 0.3引用了一堆不相关的块就调高明明知识库里有的内容它答不出就调低改之前先预览知识库编辑器的 Chunking 侧栏支持贴样本文本试跑分块看完效果再真正上传避免白烧一遍 embedding上手前必须知道的 3 件事它不是一个单体进程。核心栈含 PostgreSQLparadedb 镜像、Redis、docreader 解析服务内存小的机器先掂量一下要上 K8s 的话仓库里自带 Helm charthelm/模型成本是实打实的。检索重排、代理多步推理都会持续打 LLM测试阶段建议先挂 Ollama 本地模型上了量再接 Langfuse 看 token 消耗和调用链路私有化部署 数据主权但安全配置别偷懒。文档、向量、存储全在自己机器上这点是它的卖点但生产环境务必设置 32 字节的SYSTEM_AES_KEYAPI Key 等敏感字段的落盘加密主密钥、把DISABLE_REGISTRATION设为 true并且不要把服务直接暴露到公网想动手的话按上面三步把服务拉起来配一个 Ollama 或 DeepSeek 模型传一份手头文档问一句话十分钟就能见到第一个带引用的答案。功能走向可以看 docs/ROADMAP.md跑出问题欢迎直接提 Issue。你的企业知识库从这条命令开始 【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表