ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

douyin-downloader 实战教程:5 步跑通首个无水印下载,再进入批量抓取

douyin-downloader 实战教程:5 步跑通首个无水印下载,再进入批量抓取 douyin-downloader 实战教程5 步跑通首个无水印下载再进入批量抓取【免费下载链接】douyin-downloaderA practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback support. 抖音批量下载工具去水印支持视频、图集、合集、音乐(原声)。项目地址: https://gitcode.com/GitHub_Trending/do/douyin-downloaderdouyin-downloader 是一个免费开源的抖音下载工具专治内容只躺在云端的焦虑粘一个视频链接拿到无水印成片、封面、BGM 和元数据粘一个主页链接可以把该作者的作品、点赞、合集按模式批量拉回本地。能力速览能搬什么边界在哪先看边界避免把期望放错地方。每一行都是能做什么 限制条件视频 / 图文 / 合集 / 音乐四种链接都能直接粘音乐模式优先取原声文件取不到时回退到该音乐下的首条作品分享短链v.douyin.com这类短链App 分享出来的一串短地址自动解析成长链不用手动转换主页批量post作品、like点赞、mix合集、music音乐四种模式可任意组合跨模式自动去重❤️自己的收藏夹只支持当前登录账号collect/collectmix两种模式必须单独使用不能与post等混用直播录制FLV直播常见视频格式产物可直接播放HLS 源只保存 playlist 文件需要 ffmpeg 后处理评论采集按作品输出 JSON二级回复可选抓热搜与关键词搜索一条命令导出 JSONL适合做选题分析工程细节SQLite轻量本地数据库记录去重、断点续传中断后重跑跳过已完成文件、指数退避重试、浏览器兜底、REST API 服务模式、完成通知推送、可选的视频语音转写默认行为也值得记一句所有下载优先挑无水印的最高码率源按你配置决定是否附带封面、BGM、头像和元数据 JSON。最短跑通路径从克隆到第一个无水印视频这一节的目标只有一个让文件出现在硬盘上。每步都按做什么 → 为什么 → 做完看到什么来讲。第 1 步拉取代码git clone https://gitcode.com/GitHub_Trending/do/douyin-downloader cd douyin-downloader/douyin-downloader为什么进子目录可执行入口run.py和依赖清单都放在douyin-downloader/里。做完后当前目录下能看到run.py、requirements.txt、config.example.yml三个文件。第 2 步装依赖pip install -r requirements.txt pip install playwright python -m playwright install chromium第一行装核心运行库第二行装浏览器内核供 Cookie 自动获取和翻页兜底使用不想装可以稍后补。如果网络慢可在命令后追加-i https://pypi.tuna.tsinghua.edu.cn/simple切国内镜像。装完后python -c import aiohttp, rich, yaml不报错即为通过。第 3 步拿到登录凭证python -m tools.cookie_fetcher --config config.yml为什么需要它抖音的完整作品列表、点赞页都要登录态Cookie 就是这份登录态的凭证文件。命令会弹出浏览器你扫码登录一次回终端按回车凭证自动写进config.yml的cookies段。它只存在你本地文件不存在时该步骤可跳过但后续批量功能会受限。第 4 步写一份最小配置cp config.example.yml config.yml打开config.yml把link换成你自己的视频短链其余保持默认即可link: - https://v.douyin.com/xxxxxxx/ # 换成你的视频短链 path: ./Downloaded/ # 下载落盘目录 music: true # 附带下载 BGM cover: true # 附带下载封面 json: true # 保存作品元数据第 5 步运行并验收python run.py -c config.yml做完看到什么终端先打印解析出的链接类型与下载配置然后进度条推进到 100%Downloaded/下按作者名 / 模式 / 作品目录生成文件——视频、封面、音乐、_data.json各司其职。命令行效果长这样命令行输出时间范围筛选、已存在文件跳过、逐条下载统计一目了然到这里环境已验证无误。后面所有场景都是在改config.yml的不同字段。场景扩展按你的目标改几行配置下面每个场景都按你想实现什么 → 改哪几行 → 得到什么结果展开。用哪个看哪个。批量下载作者主页全部作品并限定数量目标一位创作者的全部作品或最近 N 个一次性拉回本地。link: - https://www.douyin.com/user/MS4wLjABAAAAxxxx # 作者主页链接 mode: - post # 也可加 like / mix / music number: post: 50 # 只取最近 50 个0 全量 start_time: 2024-06-01 # 可选只搬这个时间段发布的 end_time: 2024-06-30得到什么终端出现批量下载进度多线程默认thread: 5并行推进每个任务失败自动重试。多模式组合时同一个aweme_id只下一次批量下载界面进度条同步推进时间范围约束已生效增量去重怎么开让重跑永远不白跑目标每周追更一次只补新作品不重下旧文件。database: true # 每次下载把作品 ID 记入 SQLite increase: post: true # 重跑时跳过已记录的作品得到什么第二次运行时已下过的作品直接跳过只处理新增。去重是数据库记录 本地文件名双保险——判断重新下载某个作品的正确姿势是数据库记录和文件都要删只删一个只删库不删文件不会触发重下程序扫文件名里的 ID只删文件不删库反而会重复下载。落盘后的目录结构按作者 / 模式 / 日期_标题_ID组织翻文件像翻档案下载完成后的目录每个作品独立文件夹视频、封面、音乐、元数据齐全文件命名模板怎么自定义目标文件名乱成一锅粥或重名作者目录合并了想规整命名。folderstyle: true filename_template: {date}_{title}_{id} folder_template: {date}_{title}_{id} author_dir: nickname_uid # 昵称ID防重名合并、改名分裂模板可用变量包括{id}{title}{author}{date}{year}{month}{day}等 15 个规则是至少保留{id}否则重名会互相覆盖。默认author_dir: nickname在作者重名时会把两个人的目录合并到一起重度使用建议切到nickname_uid切换只影响后续下载不迁移已有目录。桌面版里对应的可视化设置页如下设置页作者目录命名方式、文件名与子目录模板都可逐项配置直播录制参数说明目标喜欢的博主开播时你不在电脑前挂机录完整场。link: - https://live.douyin.com/123456789 # 直播间链接 live: max_duration_seconds: 3600 # 0 录到主播下播得到什么FLV 文件落到Downloaded/{作者}/live/下附一份*_room.json直播间元数据快照。主播下播、网络空闲或你按 CtrlC 中断时已录制的字节都会保留临时文件自动转正。注意两点HLS 源只存 playlist需 ffmpeg 拼接直播接口标注为实验性功能遇到个别场景不识别属正常现象。直播录制自动识别房间信息、列出可选清晰度、给出流地址评论采集与热搜导出给做内容分析的人目标把某个作品下的讨论、或当天的平台热点变成可分析的数据。comments: enabled: true include_replies: false # 需要二级回复时改 true请求量会变大每个作品旁会多生成一份{date}_{title}_{aweme_id}_comments.json。热搜与搜索则走命令行结果以 JSONL 落盘python run.py --hot-board 30 -p ./Downloaded python run.py --search 猫咪 --search-max 100 -p ./Downloaded接入自己的系统REST API 与完成通知目标把下载能力嵌进自动化脚本任务跑完手机知道。pip install fastapi uvicorn python run.py --serve --serve-port 8000启动后向POST /api/v1/download提交{url: ...}拿到job_id再用GET /api/v1/jobs/{job_id}查状态细节见 server/。配合notifications段支持 Bark / Telegram / Webhook 三类 provider并发推送、单渠道失败不阻塞下载长任务就不用守着了。视频转写同理transcript.enabled: true并配置OPENAI_API_KEY后每个视频会多出.transcript.txt和.transcript.json注意只对视频生效图文不转写。长期维护要点用久了才会遇到的五件事这些都不影响第一次跑通但影响你用得久不久。每条按现象 → 原因 → 解法给一句话报 403 或未登录Cookie 有效期通常一到两周过期后接口拒绝服务。解法重跑python -m tools.cookie_fetcher --config config.yml扫码一次建议一周检查一次。批量只抓到 20 条就停翻页被风控截断API 分页到顶被限制。解法确认browser_fallback.enabled: true且headless: false弹窗出现后手动过验证别急着关窗口它跑完会自己补齐。下载到一半中断了断网、断电或手动停止后不用从头来。解法直接重跑同一配置断点续传加完整性校验Content-Length 比对不完整的文件自动清理重下会跳过已完成部分。速度偏慢或内存偏高默认 5 线程对大文件并发下载占资源。解法thread: 3单次任务控制在 50100 个作品分批执行跑大任务前确认磁盘余量。想强制重新下载却没生效去重是库 文件双判定只删一处会卡住。解法删对应作品目录再执行sqlite3 dy_downloader.db DELETE FROM aweme WHERE aweme_id ID;全量重来则连dy_downloader.db一起清。写在最后三条可以今天就做的建议先跑单个视频确认环境与 Cookie 无误挑一位固定关注的作者试一次全量批量打开增量去重养成每周补更的习惯不习惯敲命令的话项目另有一个基于同一后端的桌面客户端Douzy粘贴链接即下、逐任务跟踪状态可开箱即用桌面版下载页识别链接类型后勾选作品 / 喜欢 / 合集即可开始任务中心每个下载任务的状态、项数、耗时都有记录可查打开终端跑起你的第一个下载任务。【免费下载链接】douyin-downloaderA practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback support. 抖音批量下载工具去水印支持视频、图集、合集、音乐(原声)。项目地址: https://gitcode.com/GitHub_Trending/do/douyin-downloader创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表