
Hister导入wallabag与Readeck稍后读内容的增量同步【免费下载链接】histerYour own search engine项目地址: https://gitcode.com/GitHub_Trending/hi/histerHister 是一款自托管的个人搜索引擎Your own search engine能把网页和文章变成可全文检索的知识库。如果你用wallabag或Readeck这类稍后读工具收藏文章本文教你用hister import命令把稍后读内容一键导入 Hister并通过增量同步只抓取上次之后的新增与修改——反复运行也不会重复导入几行命令即可搭好第二大脑。为什么要把稍后读内容导入 Hister稍后读工具最大的痛点是文章收进列表后就沉睡了换 App、换设备、换标签体系内容都很难被真正检索到。导入 Hister 后你可以全文搜索正文不再只能搜标题正文、标签、作者都能检索️保留原有元数据标签、归档/星标状态、阅读时长等完整带入⚡内容不重复抓取优先使用稍后读服务已存储的正文缺失时才用爬虫下载可反复运行的增量导入第二次运行只同步上次之后的变化。准备工作两个 token一个命令导入前先准备好两样东西详见 cmd/wallabag.go 与 cmd/readeck.go 的实现说明需要的东西获取方式环境变量wallabag 访问令牌wallabag 实例的 OAuth 设置HISTER_IMPORT_WALLABAG_TOKENReadeck API 令牌Readeck 个人资料的 API 设置HISTER_IMPORT_READECK_TOKEN 源端令牌与 Hister 服务器的认证是两回事全局--token用于登录目标 Hister 服务器而--api-token或上面的环境变量才是访问 wallabag / Readeck 的凭据。建议用环境变量避免令牌出现在 shell 历史里。导入 wallabag三步完成首次全量导入export HISTER_IMPORT_WALLABAG_TOKENyour-wallabag-access-token hister import wallabag https://wallabag.example.com首次运行时没有历史记录Hister 会按更新时间升序逐页拉取全部条目每页 100 条把 wallabag 已存储的文章 HTML 解析成可搜索文本若某条没有可用正文则自动调用配置的爬虫后端http、chromedp或bidi重新下载页面。wallabag 增量同步是如何工作的增量机制是 Hister 服务导入的通用设计核心逻辑见 cmd/service_import.go每篇导入的文档都会打上source: wallabag元数据再次运行命令前Hister 先查询metadata.source:wallabag找出最近一篇已导入文档的更新时间戳该时间戳作为since参数发给 wallabag API只请求更新的条目源端删除的条目不会被同步删除——导入只增不删Hister 里的旧文档会继续保留。所以把命令放进定时任务里每天跑一次就是一个永不丢失的镜像索引。导入 Readeck基于同步事件的精准抓取Readeck 的流程稍有不同它走的是同步事件接口export HISTER_IMPORT_READECK_TOKENyour-readeck-token hister import readeck https://readeck.example.com先查询上次时间戳之后发生的变更事件新增/更新/删除重复的更新事件自动合并去重删除事件被忽略同样不会删 Hister 里的文档再按批次拉取变更书签的完整 JSON 元数据与文章 HTMLReadeck 返回的文章 HTML 片段会被包装成完整文档再提取正文站点图标则直接作为文档 favicon 保存。导入后保留了哪些数据源端字段导入到 Hister 后URL、标题归一化文档 URL、标题存储的文章正文 / 下载内容可全文搜索的文本创建时间 / 更新时间Added / Updated 时间戳wallabag标签、作者、归档、星标、公开状态、阅读时长文档元数据如wallabag_tagsReadeck标签、作者、阅读进度、站点、缩略图文档元数据如readeck_labels、readeck_read_progress完整的字段映射表可查阅官方导入文档import.md。常用选项速查表选项作用--api-token TOKEN本次调用临时覆盖源端令牌--skip-existing跳过 Hister 中已存在的 URL--batch-size N每批提交 1–100 篇文档--start-date/--end-date只导入指定日期区间新增的文档--label LABEL覆盖默认的wallabag/readeck标签--backend chromedp缺失正文时使用浏览器后端下载组合示例hister import wallabag https://wallabag.example.com \ --skip-existing --start-date 2025-01-01 --batch-size 25常见问题 FAQQ在 wallabag/Readeck 里删掉了文章Hister 里会被删掉吗A不会。增量导入只处理新增和更新删除事件被忽略这是有意为之避免误删已建好的索引。Q导入完成后如何确认结果A命令结束时会打印 Imported / Skipped / Errors 三类统计没有 URL 的无效记录会计入 Skipped正文下载失败会计入 Errors 但不会中断整体导入。Q正文提取失败怎么办AHister 会降级为只导入书签元数据并计入 Errors下次增量运行时可配合--backend换用浏览器后端重试抓取。小结用 Hister 导入 wallabag 与 Readeck 的核心就三点一次全量、之后增量、只增不删。把导入命令加入定时任务你收藏的每一篇稍后读文章都会持续变成可搜索的私有知识配合 Hister 的 Web 界面或终端客户端随时检索。更多导入源Linkding、Karakeep、Shaarli 等的配置可继续参考 import.md 与 wallabag 导入实现。【免费下载链接】histerYour own search engine项目地址: https://gitcode.com/GitHub_Trending/hi/hister创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考