ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

3步本地跑通AI数字人:Duix.Avatar免费离线口播视频生成完整指南

3步本地跑通AI数字人:Duix.Avatar免费离线口播视频生成完整指南 3步本地跑通AI数字人Duix.Avatar免费离线口播视频生成完整指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想不出镜、不传云端就做出口播视频Duix.Avatar 是一套完全离线运行的免费开源数字人工具提交一段10秒左右的真人视频即可克隆你的形象和声音再用文字或音频驱动数字人自动生成口播视频。本文带你从配环境到产出第一条视频把每一步讲清楚。5分钟快速判断Duix.Avatar值不值得装先给结论再往下看。下表覆盖大多数人的情况你的情况判断理由有 NVIDIA 显卡、内存 32G 以上✅ 值得装项目全部算力在本地 GPU没有 NVIDIA 显卡三个服务根本起不来32G 内存是官方标注的必要项能腾出 100GB 空闲磁盘接受首次约 70GB 镜像下载✅ 值得装服务端镜像体积大官方提示首次拉取消耗约 70G 流量建议连 WiFi 等待半小时左右需要视频制作数据不出机器✅ 值得装语音识别、语音合成、视频合成全部本地运行部署完成后不依赖外网只有 AMD/Intel 显卡❌ 别装docker-compose 中所有服务都绑定 nvidia runtime非 NVIDIA 硬件不支持需要实时交互式数字人双向对话❌ 别装本项目做的是非实时视频合成官方明确说明实时交互是另一条产品线不想碰 Docker、只会双击安装⚠️ 谨慎客户端本身很简单但服务端部署需要跑 Docker 并会排查故障首次搭建预计要 1-2 小时一句话概括这是给有 NVIDIA 硬件、愿意跑一次 Docker的人准备的全离线方案硬件不达标或追求开箱即用的直接看同类工具里的云端 API 或双击整合包。判断完值得装下面把机器条件一次性对齐。开跑前的准备配置与依赖一张表看全官方文档只给了推荐配置没有写死最低线。下面是从 README 和 常见问题 交叉整理的实际要求项目要求/最低推荐为什么是这个值显卡NVIDIA 显卡 正确安装驱动必要RTX 4070三个 Docker 服务全部依赖 GPU 计算部署前用nvidia-smi验证内存32G官方标注必要32G 及以上常见问题文档明确提到16G 内存时 ASR 服务可能启动不了CPU主流 x86 CPUi5-13400F视频合成算力主要在 GPUCPU 负责客户端与服务编排磁盘100GB 空闲100GB 以上存服务镜像首次下载约 70GBWindows 另要求 D 盘 30GB 存模特与作品数据网络仅首次稳定的宽带 WiFi—拉完镜像后全程离线可用系统Windows 10 19042.1526 / Ubuntu 22.04Ubuntu 22.04内核 6.8.0-52 已验证官方只完整测试过这两个系统其他 Linux 未做兼容验证软件DockerWindows 需 WSLLinux 需 NVIDIA Container Toolkit—容器是服务载体NVIDIA runtime 是 Docker 调用 GPU 的桥梁客户端依赖Node.js 18仅自己构建时需要—客户端是 Electron 程序直接下载官方安装包可跳过构建Windows 用户注意如果 C 盘放不下 100G 镜像装好 Docker 后可以按下图把镜像存储位置挪到别的盘。Windows C 盘不足 100G 时在 Docker 设置里修改 Disk image location硬件条件对齐后开始走最短部署路径。最短上手路径从获取代码到第一条视频以 Windows 为例Ubuntu 的差异在最后说明。全程只需以下几条短命令。第 1 步装 WSL 和 Docker Desktopwsl --install wsl --update到 Docker 官网下载 Windows 版安装包按 CPU 架构选择装完启动 Docker Desktop。看到 Engine running 界面就算成功首次运行接受协议、跳过登录即可。再确认显卡驱动终端执行nvidia-smi能显示显卡信息说明驱动正常。第 2 步克隆代码并启动服务端git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d首次拉镜像约半小时、消耗约 70GB 流量。成功标志Docker Desktop 里看到 duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video 三个容器均为 Running 状态。如果只需要视频合成、不做声音克隆可用 lite 版只起一个服务docker-compose -f docker-compose-lite.yml up -d。第 3 步装客户端产出第一条视频下载官方构建的Duix.Avatar-x.x.x-setup.exe双击安装Linux 版为 AppImage无需安装启动客户端后在快速定制入口上传一段 ≥8 秒的说话视频并给模特命名 → 等待训练完成后我的数字模特里出现模型卡片 → 在创建视频里选择模特、输入文案 → 点击合成视频 → 到首页-我的作品预览并下载 MP4。能在作品列表下载到视频即全流程跑通。Ubuntu 用户把第 2 步换成docker-compose -f docker-compose-linux.yml up -d使用 50 系显卡则用docker-compose -f docker-compose-5090.yml up -d官方已用 5090 验证30/40 系开 CUDA 12.8 也可用。部署跑通之后真正有价值的是下面三个用法。跑起来之后三个典型使用场景先给一张主流程图后面的场景都挂在它上面场景一把自己克隆成可复用的数字模特目标一次拍摄得到一个可反复出片的数字分身。操作客户端创建数字模特入口上传一段 10 秒左右的正面说话视频按界面提示填写模特名称提交后等待训练。产出我的数字模特列表里出现带预览图和视频时间的模型卡片之后做视频直接选它即可形象与声音都来自这段素材。容易踩的坑素材视频必须有人声——程序要用视频里的声音做声音克隆静音或只有 BGM 的视频会直接报错同时视频要 ≥8 秒、前后只有同一个人、五官清晰不遮挡、≥720P、MP4/MOV 格式客户端的标准示例面板把多张人脸、面部过大、五官遮挡等错误情况都列出来了对着拍即可。客户端主界面左侧两个入口分别对应做视频和克隆模特下方是作品与模特列表场景二用一段文案批量产出口播视频目标把产品说明、课程稿这类现成文案快速变成出镜视频不需要真人反复录制。操作创建视频入口 → 从模特列表选一个已训好的模特 → 在视频内容里输入文案支持中英文脚本层面共支持中、英、日、韩、法、德、阿、西 8 种语言→ 点击合成视频。产出任务进入首页-我的作品状态从排队中/正在制作中变为可预览点下载视频拿到 MP4。容易踩的坑合成前必须选模特否则会提示请先定制或选择模特视频名称和文案两个字段都是必填漏一个都会卡在提交这一步。场景三用已有录音或自己的原声驱动目标不想用克隆音色或手里已经有剪好的配音音轨想让数字人照着读。操作编辑页切换到音频合成上传 1 个音频文件支持 mp3、wav、flac、m4a单个时长小于 30 分钟可试听后提交合成。产出口型跟随音频节奏和语调变化的视频比纯文本合成更接近真人播报的语感。容易踩的坑官方要求上传纯干音背景音乐和噪音会直接影响合成效果单次最多传 1 个文件长音频先自己裁剪。另外服务端在本地开放了 18180音频合成与 8383视频合成等 API脚本批量出片的可以参考 src/main/service/video.js 和 src/main/service/voice.js 中的调用方式。功能跑顺了下面集中处理大家最容易卡住的几个环节。常见卡点与解法按现象直接对号入座以下 5 个是官方 常见问题 里反复出现的高频故障按现象→原因→处理给法。1. 现象执行docker-compose up -d时三个服务都报错request canceled/context canceled镜像拉不下来。原因Docker Hub 官方源连接不稳定这是国内环境最常见的第一道坎。处理在 Docker Desktop 的 Docker Engine 配置里加registry-mirrors官方文档附了一份镜像源列表应用后重试Ubuntu 则写入/etc/docker/daemon.json后重启 Docker。拉取失败时先在这里配置国内镜像源2. 现象容器起不来或反复重启客户端连不上服务。原因机器没有 NVIDIA 显卡或显卡驱动没装好——本项目所有算力都在本地缺了 NVIDIA 环境三个服务启动不了。处理nvidia-smi检查装好最新 NVIDIA 驱动后再重启 Docker。3. 现象定制模特时报错服务端日志里出现 funasrConnection refused。原因ASR 服务冷启动比较慢另外内存只有 16G 时该服务可能根本起不来。处理服务端刚启动时等几分钟再操作克隆内存不足就升到 32G。4. 现象上传视频后模特创建失败或合成失败。原因素材不达标视频里没人声、多人出镜、面部遮挡、分辨率低于 720P、格式不是 MP4/MOV、时长不足 8 秒。处理对照客户端标准示例重拍一段单人、吐字清晰、头部不倾斜、手不挡脸。5. 现象出了别的错不知道从哪里查起。原因本项目是客户端 三个 Docker 服务结构故障可能出在任何一环。处理按官方自查顺序走——先确认三个服务都是 Running再取两端日志客户端在设置菜单点Open Log服务端在 Docker 容器日志里复制关键段提问或排查前先备好客户端日志服务端日志从容器日志复制配合客户端日志一起看最后确认服务端和客户端都升级到最新版很多问题在新版本里已修复。故障排除完最后把话说全它到底适合你吗。收尾适合谁以及选同类工具时的判断维度适合有 NVIDIA 显卡和 32G 内存、希望视频制作全程离线数据不出机器、需要批量产出口播视频的内容创作者与中小团队项目支持免费商用但用户量超 10 万或年营收超 1000 万美元的企业需签商业许可协议商用前先核对自己是否触发这条线。不适合非 NVIDIA 硬件用户、需要实时双向交互数字人的场景、以及不想碰任何部署操作的纯小白——这三类人装了也跑不起来或跑起来也不是他们要的东西。拿它和同类工具比较时建议看四个维度一是算力位置全本地部署、云端 API 还是混合直接决定隐私与成本结构二是是否实时视频合成与实时交互是两种产品别混为一谈三是硬件与磁盘门槛看推荐配置和首次下载量而不是只看免费四是授权边界免费商用的上限条件写清楚没有。官方自身也提供云端 API 方案作为对照——不想自购显卡和维护服务的可以直接比对这个选项而不必勉强本地部署。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表