ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GetQzonehistory:QQ空间说说本地备份实用手册

GetQzonehistory:QQ空间说说本地备份实用手册 GetQzonehistoryQQ空间说说本地备份实用手册【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory2012 年发的那条说说还在不在不好说但可以验证一下。GetQzonehistory 是一个做 QQ空间备份 的小工具用 Python 模拟扫码登录把 QQ 空间里的说说、评论和图片完整抓下来导出成 Excel 和 HTML。整个过程在本地运行不需要把密码交给任何第三方程序。它是怎么跑起来的整体逻辑就三步登录、分页抓取、落盘保存。唯一不太简单的是登录其余部分看一遍代码就能明白。为什么用扫码登录而不是输密码同类工具经常要你把 QQ 密码填进配置里这一步本身就是最大的风险点。GetQzonehistory 走的是 QQ 官方二维码登录接口程序启动后向 QQ 服务器申请登录二维码把二维码以 ASCII 字符的形式打在终端里用 pyzbar 解码然后每 3 秒轮询一次登录状态直到手机确认、返回登录成功。这样做有两个附带的好处。第一全程碰不到密码也就没有密码泄露的渠道。第二登录成功后会话 cookie 会写进resource/user/目录下的文件下次运行程序会列出所有已登录的账号输入序号就能复用只有凭证过期或输入 0 主动重新登录时才需要再扫一次码。分页抓取与中断续传数据其实来自两个来源。一是 QQ 空间的互动消息列表也就是涉及你的所有说说、转发和评论记录。程序先用二分查找确定消息总量然后循环每次拉取 10 条用 BeautifulSoup 解析每页的 HTML取出时间、内容和图片链接并去重每拉完一页休息 3 秒再拉下一页。另一个来源是未删除的可见说说列表每页 30 条用来补齐没出现在消息列表里的说说包括 2014 年之前的旧内容。中断处理上程序给 SIGINT 和 SIGTERM 注册了信号处理按 CtrlC 或杀掉进程时它会先把已经抓到的数据写进 Excel可见说说的原始数据还有本地缓存文件下次重跑不用从零开始抓。数据落地本地文件体系所有解析结果都写进本机磁盘按 QQ 号组织。跑完后程序会在resource/result/下建一个以你 QQ 号命名的子目录里面放着几份 Excel 表格和一个 HTML 页面还有一个pic/目录专门接收下载下来的图片。默认的保存位置在resource/config/config.ini里配置不合意可以直接改。从零到拿到数据环境准备有 Python 3 和 pip 就够。依赖里有 pandas、openpyxl、pyzbar 这些包建议用虚拟环境git clone https://gitcode.com/GitHub_Trending/ge/GetQzonehistory cd GetQzonehistory python -m venv myenv source myenv/bin/activate pip install -r requirements.txtWindows 上激活虚拟环境改用.\myenv\Scripts\activate。另外还有一个系统级依赖pyzbar 需要 zbar 共享库LinuxRPM 系发行版执行sudo dnf install -y zbarmacOS 执行brew install zbar。不想配环境的话项目 release 页面有打包好的单文件可以直接运行。装完依赖之后接下来就一件事——运行抓取python main.py 终端打出 ASCII 二维码后用手机 QQ 扫一下。登录成功后程序先跑一个获取消息列表数量的进度条然后开始主抓取进度条以 10 条为单位走。跑完会自动打开结果文件夹终端同时打印总数、最早说说时间、好友数等统计信息。你会拿到什么最终产物是resource/result/QQ号/目录下一组结构化的文件文件内容典型用途QQ号_全部列表.xlsx全部互动记录时间、内容、图片链接、评论四列完整存档跨条目检索QQ号_说说列表.xlsx仅自己原创的说说统计、迁移到博客QQ号_转发列表.xlsx自己转发过的内容区分原创与转发QQ号_留言列表.xlsx别人留给自己空间的评论追溯互动记录QQ号_说说网页版.html说说与评论还原成的网页浏览器浏览、存档打印 除了表格pic/目录会把说说里的图片全部下载到本地文件名由说说内容生成图片和对应说说能对上号。拿这些数据能做什么打开说说列表的 Excel按年份分组计数拉个柱状图看看自己哪年最话痨。时间列是YYYY年MM月DD日 HH:MM格式的字符串切片一下就能用。QQ空间历史说说导出不必止步于备份打开网页版 HTML用浏览器打印功能转成 PDF或者导入笔记软件就是一份可检索的个人档案。再往前推一步写个 cron 任务或 Windows 定时任务每月跑一次python main.py只要resource/user/里的 cookie 没过期新说说会自动进 Excel旧文件被覆盖更新。main.py的抓取循环默认拉全量如果只想要某个时间段在循环里加个时间过滤就能单独备份近一年的内容。pic/目录是一批现成的图片素材再写个脚本做人脸识别或场景分类就是一份个人照片集。util/目录里消息列表和可见说说两套抓取策略可以单独调整如果只关心自己的原创内容保留第二套能省不少时间。用之前要知道的事所有请求和解析都在本机完成数据不会发到任何第三方服务器。但导出的 Excel 里包含你的说说内容和好友昵称建议加密存放或者至少别丢到共享网盘里。 登录凭证是临时的 QQ 会话 cookie放久了或在他处退出登录可能失效届时重新扫码即可resource/user/里的缓存文件也随时可以删。消息列表只覆盖互动列表内的记录仅自己可见的说说拿不到想要完整一些建议隔几个月重跑一次补新内容。工具依赖 QQ 空间的公开接口如果接口或扫码登录策略有变动程序可能跑不通可以留意项目更新和 Issue。抓取间隔内置了 3 秒停顿如果说说很多上万条消息整个过程要跑挺久适合挂着后台等它跑完。整个流程没有别的环节了clone、装依赖、扫码、等它跑完顺利的话一小时内能拿到第一份 Excel。现在就可以跑一遍看看自己十年前的说说长什么样。【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表