ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GPT-SoVITS实战指南:用1分钟音频克隆出专属TTS声音

GPT-SoVITS实战指南:用1分钟音频克隆出专属TTS声音 GPT-SoVITS实战指南用1分钟音频克隆出专属TTS声音【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个开源的少样本语音克隆项目喂给它 5 秒参考音频即可零样本合成语音提供约 1 分钟的目标人声数据则能微调出一个音色贴合的专属 TTS 模型。适合想快速搭建语音合成能力、又不想折腾完整 TTS 训练流水线的开发者。 能力与适用场景速览维度说明零样本合成提供 5 秒人声样本 参考文本直接生成目标音色语音少样本微调约 1 分钟训练数据即可微调 GPT/SoVITS 双模型提升音色相似度语言覆盖中文、英语、日语、韩语、粤语支持跨语言推理与句内混读配套工具链UVR5 人声分离、自动音频切片、多语言 ASR 转写与可视化校对声码器集成 BigVGANv3 原生输出 24kv4 原生输出 48k 音频官方说明见 docs/cn/README.md模型架构实现集中在GPT_SoVITS/AR/models/与GPT_SoVITS/module/models.py。 四步跑通首次安装已验证的环境组合Python 3.10/3.11 PyTorch 2.5.1CUDA 12.4或 PyTorch 2.7.0CUDA 12.8。1. 获取代码git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS2. 创建虚拟环境conda create -n GPTSoVits python3.10 conda activate GPTSoVits3. 运行安装脚本自动安装 ffmpeg、PyTorch、依赖包并下载预训练模型到GPT_SoVITS/pretrained_models、G2PW 中文音素模型到GPT_SoVITS/textbash install.sh --device CU128 --source HF --download-uvr5--device可选CU126 | CU128 | ROCM | MPS | CPU--source可选HF | HF-Mirror | ModelScope。Windows 用户也可以直接下载官方整合包双击go-webui.bat启动。macOS 上官方建议选CPU因为 Mac GPU 训练出的模型质量明显偏低。4. 启动 WebUIpython webui.py浏览器访问http://localhost:9874即进入主界面ASR 校对 9871、推理 9872、UVR5 9873端口定义在 config.py。首次使用某类 ASR 模型时会自动联网下载离线环境可提前把模型放进tools/asr/models。️ 从原始音频到第一条合成语音整个流程在 WebUI 的训练数据准备与模型训练两个标签页内完成按序执行即可导入与切片填入原始音频路径用内置 slicer 切成适合训练的小片段长音频自动按静音分割。去噪可选底噪较大的样本先过一遍降噪工具。ASR 转写自动识别生成文本标注。中文/粤语走 FunASR 后端多语言默认 Fun-ASR-Nano也可换 Faster Whisper见tools/asr/funasr_asr.py、tools/asr/fasterwhisper_asr.py。人工校对在可视化校对界面逐条修正错字、补标点这一步直接决定训练上限。导出标注文件格式为四段式语言码支持zh / en / ja / ko / yuevocal_path|speaker_name|language|text D:\GPT-SoVITS\xxx\clip001.wav|xxx|zh|你好这是第一段训练文本。微调训练切到训练标签页先训 GPT 语义模型s1再训 SoVITS 声学生成模型s2对应仓库中的GPT_SoVITS/s1_train.py与GPT_SoVITS/s2_train.py。训练权重按版本分目录存放如GPT_weights_v2Pro、SoVITS_weights_v2Pro配置文件参考GPT_SoVITS/configs/train.yaml如precision: 16-mixed、gradient_clip: 1.0。推理试听进入1-GPT-SoVITS-TTS / 1C-inference页签选择刚训好的权重、上传 5–10 秒参考音频并填参考文本输入目标文本生成 WAV。⚙️ 选版本与调合成参数版本怎么挑均为 config.py 中实际注册的版本版本定位适用数据输出规格v2经典款预训练扩到 5k 小时弱参考音频更稳平均音质即可32kv2Pro / v2ProPlus性能超过 v4显存占用略高于 v2速度接近 v2平均音质即可32kv3音色相似度更高GPT 更稳少复读、少漏字情感更丰富需要较高质量训练集原生 24kv4修复 v3 的金属感伪影原生 48k 输出官方视为 v3 直接替代需要较高质量训练集原生 48k官方结论训练集音质一般时 v1/v2/v2Pro 出效果更稳v3/v4 的合成音色更贴合参考音频而非整个训练集。推理侧旋钮WebUI 与 API 共用参考音频长度 5–15 秒越贴近目标文本的语域语气越自然top_k默认 15、top_p默认 1.0、temperature默认 1.0控制随机性复读或跑题时调低 top_kspeed默认 1.0调语速sample_steps默认 32影响生成步数is_half控制 fp16 半精度NVIDIA 显卡默认开启以省显存由环境变量is_half控制。推理速度参考官方 v2 ProPlus 实测 RTFRTX 4090 约 0.0141400 字约 3.36 秒出 4 分钟音频RTX 4060 Ti 约 0.028M4 纯 CPU 约 0.526。 常见坑位与排查WebUI 打开后连不上页面现象终端正常打印但浏览器打不开 9874 端口。 可能原因端口被占用或防火墙拦截。 解决换一个空闲端口后重启或用浏览器直接访问终端输出的完整 URLDocker 场景下确认--service-ports已生效。中文合成读音错乱、出现拼音或英文现象中文文本被按英文规则读。 可能原因GPT_SoVITS/text下缺少G2PWModel目录中文音素模型没装。 解决重新执行install.sh --device ... --source ...或手动把 G2PWModel 压缩包解压重命名后放入该目录。CUDA 版本对不上安装失败或回退 CPU现象脚本提示找不到驱动回退 CPU或运行时出现 CUDA 报错。 可能原因驱动只支持 CUDA 12.6 却选了 CU128。 解决用nvidia-smi查看 CUDA Version据此在--device中指定CU126或CU128。ASR 一直转写失败或卡住现象切片后的音频没有生成文本标注。 可能原因首次使用需联网下载 ASR 模型网络不通时静默失败。 解决换--source HF-Mirror环境或手动下载模型放入tools/asr/models后再跑。v3/v4 合成有明显金属感或发闷现象高语速段出现金属味整体偏闷。 可能原因v3 的非整数倍上采样伪影或 v3 原生 24k 输出被放大后浑浊。 解决换 v4 权重原生 48kv4 用户还可用tools/AP_BWE_main/的 24k→48k 超分模型处理旧产物。音色不像目标说话人现象合成语气平稳但音色偏离参考人。 可能原因训练数据过少、参考音频含伴奏或底噪或参考音频与训练集音色差异过大。 解决扩充到 3–5 分钟干净人声参考音频选目标说话人的典型片段重跑微调平均音质数据优先选 v2Pro 系版本。 API 集成与容器化部署HTTP APIapi.py默认监听 9880 端口GPT_SoVITS/inference_webui.py也可独立起推理端。核心端点有POST /set_model切换权重、POST /change_refer换参考音频、POST /合成。合成请求体示例{ refer_wav_path: GPT_weights_v2Pro/prompt.wav, prompt_text: 参考音频的文本内容, prompt_language: zh, text: 你好这是一段 API 合成测试, text_language: zh, top_k: 15, temperature: 1.0, speed: 1.0 }Docker 部署docker-compose.yaml提供GPT-SoVITS-CU126、GPT-SoVITS-CU128及对应-Lite不含 ASR 与 UVR5 模型四个服务在仓库根目录执行docker compose run --service-ports GPT-SoVITS-CU128Windows Docker Desktop 默认共享内存偏小按需调大shm_size想用 fp16 设环境变量is_halftrue。需要最新代码时可bash docker_build.sh --cuda 12.8本地构建。批量处理切片、ASR、推理都有 CLI 入口例如python tools/slice_audio.py、python tools/asr/funasr_asr.py -i 输入目录 -o 输出文件 -l zh适合放进脚本做批量任务。下一步先跑通install.shwebui.py用 1 分钟音频走完切片 → 校对 → 微调 → 推理全流程拿到第一条合成语音后再考虑换版本或上 API。深入细节按 docs/cn/README.md 和GPT_SoVITS/AR/models/源码逐层看即可。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表