
Utopia文档摄取完整指南9种文件如何变成可推理的事实【免费下载链接】utopia首个开源企业世界模型项目地址: https://gitcode.com/deeplethe/utopiaUtopia 是首个开源企业世界模型它的文档摄取Ingestion能力让 PDF、Word、Excel、Markdown 等 9 种格式的文件不只是能搜索而是自动解析为带时间、带出处的可推理事实存入双时间轴知识图谱。本指南面向新手讲清一条文件从上传到入库的完整旅程。 哪些文件可以摄取Utopia 支持以下9 类文件直接上传详见 README.md 的功能列表类别格式说明办公文档PDF、DOCX、PPTX保留标题层级与表格结构电子表格XLSX、XLS、ODS、CSV/TSV首行自动识别为表头行永不拆分网页与文本HTML、Markdown、纯文本自动检测 GBK 等旧编码所有解析逻辑集中在 parsers.rs每种格式对应一个解析函数pdf、docx、pptx、spreadsheet、html、csv_text统一输出 Markdown 中间格式——这是后续所有处理的地基。 上传之后一条文件变成事实的四步流水线官方流水线文档 docs/pipeline.md 描述了完整链路对新手只需记住四步解析与切块文件被读成 Markdown 块标题、段落、表格再由 chunker.rs 按 token 预算打包成块chunk。表格会带着自己的标题和表头一起走一行永远不会被拦腰截断设计细节见 docs/design/sources.md。嵌入即可查块一旦完成向量嵌入文档立即变为ready状态——全文检索和问答马上可用无需等待后续步骤。抽取后台对每个块调用一次大模型抽取实体与事实。低置信度、结构不合法的条目会被记录丢弃原因extraction_drops表绝不静默丢失。入图实体经过三级消解精确同名 → 相似度 → 模型裁决后事实写入双时间轴账本它在世界上何时为真 系统何时得知。纠错不覆盖旧值而是关闭旧版本并留链。 这就是两阶段设计的妙处长文档几分钟后才长完图谱但几秒内已可搜索问答。⏱️ 时间轴与出处让事实可推理的关键普通向量库只存现在的知识Utopia 的差异在于两个底层设计文档自带日期优先doc_time字段内容日期 来源日期 上传时间决定文档在时间轴上的位置。上传时间永远不算文档日期见 migrations/0055_a_name_is_a_fact.sql 之后的时间相关迁移。每条事实带出处事实指向原文句子的偏移位置回答时可点开原始段落provenance.rs 保证引用永远不跨越知识库边界。配合本体的公理推理传递性、逆关系等一份被修订三次的合同可以回答2024 年 3 月 15 日生效的付款条款是什么——答案、依据句和修正来源一并给出。 新手快速上手三种接入方式除了拖文件上传Utopia 提供三种集成方式完整字段参考 web/src/docs/ingest.md方式发起方适合场景Custom拉取Utopia 定时轮询你的 URL定期快照、导出源API推送你的服务随时 POST事件驱动系统、CI 脚本Statements结构化推送你的系统直接推声明传感器、事件总线等已知{实体,关系,值,时间}的系统三种方式共享同一套身份语义同一 ID 再次推送 原地更新同一文档旧内容保留为版本搜索重建索引知识图谱重新抽取。删除也只是打源中不存在标记由人在 Library 里确认绝不自动删除。# 最简启动Docker 一条命令 git clone https://gitcode.com/deeplethe/utopia cd utopia docker compose --profile app up -d # 打开 http://localhost:1516 注册首个账号即管理员✅ 小结Utopia 文档摄取支持9 种格式统一走 Markdown 中间格式四步流水线解析切块 → 嵌入可查 → 后台抽取 → 双时间轴入图每条事实带时间轴位置 原文出处纠错留痕、冲突可审文件上传、拉取、推送三种接入方式同一套按身份更新、历史不丢的语义。上手后建议先看 scripts/bench/ 下的基准语料与 docs/decisions/ 中的决策记录它们解释了每个设计背后的取舍。【免费下载链接】utopia首个开源企业世界模型项目地址: https://gitcode.com/deeplethe/utopia创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考