
一行命令装好、10 行代码出声VoxCPM2 零样本语音克隆上手笔记【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM给短视频配旁白还要花钱请配音师VoxCPM2 把文本转语音TTS和零样本语音克隆塞进一行安装命令支持 30 种语言输出还是 48kHz 的录音棚级音质5 分钟就能听到自己生成的第一条语音。 一张图讲清原理左边进的是文字和可选的参考音频右边出来的是 48kHz 的音频波形。中间四段流水线接力参考音频先被压成连续向量语言模型据此一段段决定怎么念声学模块再把语义精修成真实声波。它最特别的一点是不做离散分词tokenizer把语音切成一个个小碎片的老做法全程在连续空间里生成语气的起伏和停顿不会被碎片磨平。所以图里的流程看着长实际就干一件事把文字变成像人说的话。⚡️ 30 秒跑通环境一句话Python 3.10–3.12有 NVIDIA 显卡显存 8GB 左右、PyTorch 2.5、CUDA 12体验最佳没有显卡 CPU 也能跑就是慢。装它只要一行pip install voxcpm。首次运行会从模型仓库拉 2B 参数的权重网络慢就先喝口水之后都走本地缓存。然后直接跑from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate( text你好这是 VoxCPM2 生成的第一条语音。, cfg_value2.0, inference_timesteps10, ) sf.write(output.wav, wav, model.tts_model.sample_rate)没报错的话output.wav 已经躺在当前目录了双击就能听。️ 两条路走跑通了接下来想换音色、批量出稿两条路都能走。用代码调把参考音频的路径丢给generate克隆立刻成立仓库 examples 目录里的参考音频可以直接拿来试wav model.generate( text这是用参考音频克隆出的音色。, reference_wav_pathexamples/reference_speaker.wav, ) sf.write(clone.wav, wav, model.tts_model.sample_rate)适合嵌进自己的程序里、批量出片或者生成完接着做自己的后处理。想顺手改风格在 text 开头用括号写一句描述就行比如语速稍快、语气轻快音色本体不变只改说话方式。用命令行不想写 Python 就走命令行装完自带voxcpm命令design和clone两个子命令覆盖主要玩法# 设计音色不用参考音频一句话描述就行 voxcpm design --text 欢迎收听本期节目。 --control 年轻女声温柔一点 -o design.wav # 克隆音色丢一段参考音频进去 voxcpm clone --text 这是克隆音色演示。 --reference-audio examples/reference_speaker.wav -o clone.wav适合快速试参数、写脚本批量出稿--seed还能把随机性钉死方便复现同一条结果。 不满意时怎么办不铺参数表只说最常碰的四个Python 和命令行通用听起来像在背课文、太紧绷把cfg_value从默认的 2.0 降到 1.5声音会更松弛、更像在聊天反过来要它字字咬死提示提到 2.5 左右。细节糙、沙沙声压不掉inference_timesteps从 10 提到 15–20多出来的步数都花在精修音质上嫌生成慢就降回 4–8 换速度。克隆对了音色但味道不对加一句风格指令直接指挥更活泼/更沉稳代码里写在 text 开头括号内命令行用--control。同一段文字想 A/B 对比加seed42固定随机数不然每次生成都不一样参数调了也白调。 再往深处走嫌命令行繁琐就python app.py --port 8808开 Web 界面浏览器里点完直接下载。想长期固定某个音色用 5–10 分钟音频做 LoRA 微调就够了训练配置在 conf/voxcpm_v2/ 里训练数据的 JSONL 格式照着 examples/train_data_example.jsonl 抄。吞吐方面RTX 4090 上 RTF 约 0.3搭配 Nano-vLLM 这类加速框架能压到 0.13长文本批量生成不用干等。下一步把examples/reference_speaker.wav换成你对着麦克风录的 5 秒干声再跑一遍 clone出来的音色就是你了。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考