
GPT-SoVITS 零成本云端训练1 段录音练出语音克隆权重【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 能用 1 分钟录音训出可用的语音克隆模型。读到这里读完你就在免费环境里走完一整条云端训练闭环备录音、搭 GPU 环境、加工数据、训练两级模型并听到第一段合成语音。先看到终点跑完你手里有什么跑完是什么样子你手里会多出三样东西一对音色权重GPT 侧一个.ckpt、SoVITS 侧一个.pth这是本次音色微调的产出物一段能试听的声音写任意文本新音色照着念出来一条可复用的链路数据加工、训练、推理导出各环节都有独立脚本下次换录音照同样流程再来一遍即可。开工前只需备两样东西这一节只回答你自己要准备什么。就两样一段干净人声录音1 分钟到几十分钟都行背景音乐和底噪越少越好这是语音克隆的原料一个 Colab 账号免费档即可显存装得下默认批大小Python 环境由仓库脚本一并处理不用自己装。唯一可能吃紧的是磁盘代码、预训练权重、数据放一起留出 15 GB 比较稳妥。从零到环境就绪一段命令串完这一节只解决一件事让代码跑起来。三个动作串在一起拉取仓库建一个 Python 3.10 的 conda 环境防止依赖和其他 notebook 互相打架跑官方安装脚本依赖和预训练权重都会自动拉好。git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVITS python3.10 -y conda activate GPTSoVITS bash install.sh --device CU128 --source HF --download-uvr5--device按 Colab 实际的 CUDA 版本选CU126、CU128 均可--source在 Hugging Face 与 ModelScope 之间按网络情况切换--download-uvr5顺带装好人声分离模型后面处理带 BGM 的录音用得上。跑完看到GPT_SoVITS/pretrained_models/目录下有模型文件环境就算就绪了。模型权重两个渠道选一个这一节只把选择说清楚权重从哪个站拿。到这一步基础预训练权重已经就位。若还想拿别人微调好的音色直接推理或继续训练两个渠道任选其一Hugging Face 的可选仓库更丰富ModelScope 国内连接更稳文件本身没有区别。wget https://huggingface.co/AkitoP/GPT-SoVITS-v2-aegi/resolve/main/new_aegigoe-e100.ckpt这条拿的是 GPT 侧权重SoVITS 侧的.pth用同样方式取。下完把两个文件分别放进对应的权重目录WebUI 的下拉框里就会自动列出它们无需任何手动注册。把一段长录音喂给模型这一节决定质量原始录音得先变成一条条干净短句 对应文字模型才吃得上。抠人声带 BGM 才需要用 WebUI 的人声分离功能把纯人声单独摘出来降噪用 tools 目录下的降噪脚本去掉底噪切短句按静音点切成 3~10 秒的小段脚本是tools/slice_audio.py。切片的原因是让模型一次只看一小段切太碎浪费信息切太长又吃显存配文字每条切片配一句转写写成文件名|文本一行一条。转写准不准发音就准不准值得逐条听、逐条写。这时候在 WebUI 里依次点文本分词与特征提取语音自监督特征提取语义 Token 提取三个按钮文本和音频就被转成模型能吃的张量。开训然后听到第一版声音这一节把训练 试听两个动作合并掉。GPT 和 SoVITS 两个模型要各训一遍。习惯命令行的话可以直接起 S1默认批大小 8、轮数 20对新手足够友好python GPT_SoVITS/s1_train.py -c GPT_SoVITS/configs/s1longer.yamlS2 同理显存偏紧时把配置里的grad_ckpt打开用计算换显存。日志里 loss 平稳往下走就属正常权重文件会落在对应的输出目录里。跑完之后启动主界面export is_shareTrue python webui.pyis_shareTrue会生成一个临时公网链接浏览器打开即可。接着在 TTS 面板走最短路径选你刚训的 GPT 权重和 SoVITS 权重 → 上传一段参考音频、填上参考文本 → 写好目标文本、选语言 → 点生成。从训练结束到听到第一版声音中间只差这一次点击。出问题时先定位再动手遇到报错别急着重跑先看症状再决定动哪个旋钮。显存爆了、报 OOM多半是批大小给大了。把训练页的batch_size改成 4 甚至 2重新起训S2 阶段再顺手把grad_ckpt置为 true。批大小减半训练时长大约翻倍免费 GPU 上这买卖通常划算。Colab 会话断了重连后记得重新激活环境conda activate GPTSoVITS再用 Lightning 的--resume_from_checkpoint指向实验目录里最新的检查点文件名从中断处接着跑已训的轮数不浪费。个别中文字读错、声调怪先核对转写有没有错字、多音字转写没问题多半是词典命中不到位。GPT_SoVITS/text/下的文本归一与分词逻辑负责声调和分词补充词条后重走一遍特征提取即可。回头看全流程就是一条箭头线录音 → 数据 → 权重 → 声音每一环都是独立脚本哪环出问题就查哪环。想再往前推一步把录音换成更长的样本、对比不同轮数下的音色差异或把权重导出成 ONNX 挂进自己的应用。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考