ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Paperless-ngx 零基础上手指南:从扫描件到可检索电子档案

Paperless-ngx 零基础上手指南:从扫描件到可检索电子档案 Paperless-ngx 零基础上手指南从扫描件到可检索电子档案【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngx找一份半年前的租房合同结果它躺在鞋盒最底层。Paperless-ngx 就是为这类问题做的它把纸质文档数字化OCR 识别、自动分类、归档存储一气呵成之后一个关键词就能秒级定位任意一页。本文带你完成安装、入库、查找和自动化配置全部基于仓库里的真实文件与文档。 一条命令装完 Paperless-ngx先说门槛一台能跑 Docker 的机器2GB 内存、10GB 磁盘即可起步日常长期使用建议 4GB 内存加 SSD。推荐用官方安装脚本。clone 仓库后运行根目录下的脚本它会逐项检查 Docker 环境然后交互式地问你几件事数据库选哪种建议 PostgreSQL、数据目录放哪、时区是什么最后帮你创建管理员账号。git clone https://gitcode.com/GitHub_Trending/pa/paperless-ngx bash paperless-ngx/install-paperless-ngx.sh跑完打开浏览器访问127.0.0.1:8000就能登录。想自己控制细节也可以从docker/compose/目录把docker-compose.postgres.yml、docker-compose.env、.env三个文件复制到同一文件夹再执行docker compose pull docker compose up -dcompose 文件会在旁边自动创建 consume 与 export 文件夹服务监听 8000 端口。SQLite 和 MariaDB 版同样在 docker/compose/ 下按需替换。启动后必改的四个变量变量作用建议PAPERLESS_SECRET_KEY会话令牌签名密钥模板默认值change-me必须替换用python3 -c import secrets; print(secrets.token_urlsafe(64))生成PAPERLESS_OCR_LANGUAGEOCR 默认识别语言文档以中文为主就设chi_simPAPERLESS_OCR_LANGUAGES额外安装的语言包容器默认只装英文等几种中文要手动补USERMAP_UID/USERMAP_GID容器内运行身份设成宿主机当前用户否则读写不了 consume 目录完整清单在 docs/configuration.md不必背用到再查。 场景一让扫描件自己进来Paperless-ngx 的核心是一个自动流水线。文件只要进了consume 目录系统的收件箱后面全靠机器OCR 提取文字、识别日期、生成缩略图、建全文索引。网页上传的文件其实也走这条路。入库后先看仪表盘处理队列是否顺畅流转、新文档有没有带上标题和日期。邮件附件也能自动收配一个 IMAP 邮箱再写好邮件规则——按发件人、主题、正文匹配——符合条件的附件定期被抓取并直接进入流水线。电子发票、账单这类文件基本零操作入库。️ 场景二让分类不再靠手每份文档都有详情页右侧面板集中改四类东西标题和日期识别不准就手动纠正搜索全靠它们标签 / 对应人 / 文档类型基础分类三件套标签支持多级层级存储路径决定原件归档到哪个物理目录权限单独指定谁能看、谁能改这一份 场景三让查找快到离谱顶栏搜索框做的是全文检索OCR 出来的正文也算在内列表页再按标签、类型、日期组合过滤视图可在表格、大卡片、小卡片之间切换。批量干活用表格视图勾选多份文档后打开批量编辑面板统一补标签、调权限、重命名或者直接打包下载。清历史积压文档时这比逐份点开快得多。⚙️ 场景四把重复劳动交给工作流工作流由触发器和动作拼成全部在界面里配。触发器有四种文件开始消费时、邮件抓取时、文档入库后post-consumption、按计划定时动作包括自动分配标签、对应人、类型、标题移除元数据发邮件调 Webhook移入回收站去除 PDF 密码举个例子入库后 正文包含发票 → 自动打上财务/发票标签。配一次长期生效。顺手说一句 AI新版内置 AI 能力根据内容给出标题、标签、对应人建议还能在顶栏用自然语言向文档库提问基于 RAG 检索。默认关闭在设置里开启后指向本地 Ollama 或 OpenAI 兼容端点即可。注意一点开启后文档内容会发往模型服务敏感档案自己权衡。更多用法可翻 docs/usage.md。 翻车现场这四个坑最常见容器起不来登录页打不开。先跑docker compose logs看报错。两个主因8000 端口被占用改ports映射、.env里的密钥没换。文件丢进 consume 目录没反应。九成是权限。把USERMAP_UID/USERMAP_GID对齐宿主机当前用户id -u可查容器才写得进这个目录。OCR 识别效果差。扫描件控制在 300DPI 左右中文语言包要在PAPERLESS_OCR_LANGUAGES里补装倾斜、低对比度的图建议先做预处理再投喂。升级会把数据弄丢吗不会。数据都在 data、media 这些卷里升级只是换镜像。但升级前仍建议完整备份一次并过一遍 docs/changelog.md 确认有无破坏性变更。 上公网前的两个动作反向代理加 HTTPS别把 8000 端口直接暴露出去开启双因素认证定期轮换密钥内置的 REST API 带 Swagger 界面访问/api/docs/接扫描 App 或写脚本都方便。 第一天行动清单跑完安装脚本确认127.0.0.1:8000能登录替换PAPERLESS_SECRET_KEY把PAPERLESS_OCR_LANGUAGE设为chi_sim重启容器投一份真实扫描件进 consume核对标题和日期提取得对不对建两三个顶层标签配第一条正文匹配 → 加标签的工作流记下 data、media 卷的挂载位置设置定期备份【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表