ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

VoxCPM2 语音合成完整教程:30 种语言 TTS、声音克隆与音色设计实战

VoxCPM2 语音合成完整教程:30 种语言 TTS、声音克隆与音色设计实战 VoxCPM2 语音合成完整教程30 种语言 TTS、声音克隆与音色设计实战【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM给一期播客配多语言解说或者用一段 10 秒的录音复刻出内部培训的声音这类需求现在可以完全在本地用开源工具完成。VoxCPM2 语音合成是一个采用 Apache-2.0 协议开源的多语言文本转语音系统由 OpenBMB 发布支持 30 种语言、输出 48kHz 采样率的音频在 RTX 4090 上使用加速推理引擎时 RTF实时率即生成 1 秒音频所需的真实时间可低至约 0.13。读完本文你可以完成安装、跑通基础合成与声音克隆并按自己的场景选定部署方式。 先跑起来VoxCPM2 安装步骤安装只需一条 pip 命令出第一句音频的代码不超过 8 行。先在终端执行pip install voxcpm然后运行下面的代码块from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate(text你好这是第一句合成语音。, cfg_value2.0, inference_timesteps10) sf.write(demo.wav, wav, model.tts_model.sample_rate) print(saved: demo.wav)运行结束后demo.wav就是可播放的成品音频。环境要求Python 3.10 到 3.12、PyTorch ≥ 2.5.0、CUDA ≥ 12.0显存约 8GB。如果想查看仓库里的训练脚本或 Web 入口可以克隆代码git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM。 三种玩法合成、设计与克隆三种用法共用同一个generate()接口区别只在传入的参数。基础合成文本直接变语音核心价值输入文本即得到语音30 种语言直接输入即可无需标注语言。代码就是上文「先跑起来」的第一个代码块即最小形态。效果生成的音频自带与文本内容匹配的韵律语气会随语义变化。自然语言设计音色没有录音也能造声音核心价值不需要任何参考音频用文字描述就能生成一个全新音色。写法是把描述放在text开头的括号里wav model.generate( text(年轻女性声音温柔甜美)欢迎使用 VoxCPM2 语音合成。, cfg_value2.0, inference_timesteps10, seed42, ) sf.write(design.wav, wav, model.tts_model.sample_rate)效果design.wav会呈现稳定的「年轻女性、温柔甜美」音色适合品牌声音、旁白等没有现成录音的场景。声音克隆一段录音复刻一个声音核心价值提供一段参考录音模型复刻其音色并可用文字指令额外调节语速和语气。把路径传入reference_wav_path即可wav model.generate( text(稍快语速语气欢快)这是克隆后的声音。, reference_wav_pathpath/to/voice.wav, cfg_value2.0, inference_timesteps10, ) sf.write(clone.wav, wav, model.tts_model.sample_rate)效果参考音频接受 16kHz 输入输出仍是 48kHz若还想复刻节奏、情绪等更细的音色细节可以成对传入prompt_wav_path和prompt_text让模型从参考音频处续写。此外若默认音色不合业务5 到 10 分钟的音频即可通过 LoRA 微调配置 训练专属声音入口是 训练脚本也支持python lora_ft_webui.py启动训练 WebUI。 它是怎么做到的无分词器架构说人话大部分开源 TTS 先把音频切成一串离散 token类似把句子拆成一个个字生成时逐个还原信息在每一轮「离散化」中都会损失。VoxCPM2 跳过了这个分词器环节让模型直接生成连续的语音表征再解码成波形所谓「扩散自回归」就是模型沿时间轴逐段生成每一段由噪声通过扩散过程「显影」成清晰信号。整条流水线分四个阶段各自只做一件事LocEnc局部编码器把输入音频切成短片段特征供模型学习音频细节TSLM文本语义语言模型2B 参数的语言模型负责理解文本并产出语义表示RALM残差声学语言模型结合 FSQ 量化与 LocDiT 扩散模块生成连续语音隐码AudioVAE V2把隐码解码成最终音频非对称的编解码设计保证了 48kHz 的输出规格。 效果到底怎么样开源 TTS 基准对比以下数据来自公开基准 Seed-TTS-eval表格只保留选型最相关的三类信息模型参数量是否开源中文 CER越低越好英文 SIM越高越好VoxCPM22B是0.97%75.3%FishAudio S24B是0.54%未公布Qwen3-TTS1.7B是1.22%71.7%CosyVoice31.5B否1.12%72.0%FishAudio S2 的中文 CER 更低但它未公布 SIM 一列VoxCPM2 的英文 SIM 75.3% 是表中开源模型的最高值参数量则介于 Qwen3-TTS 与 FishAudio S2 之间。多语言场景下项目自测的 30 语言 ASR 回听基准平均错误率为 1.68%。以上只是数据陈述实际听感还取决于你的内容类型。 部署方式怎么选三条路线按场景对号入座如果你在自己的 Python 应用里调用直接用本地 API如上例处理长文本时改用generate_streaming()它会逐块产出音频不用等整段合成完如果你只是想快速试听或交给不懂技术的同事体验运行 Web 界面python app.py --port 8808然后浏览器打开localhost:8808入口文件见 app.py如果你需要面向多租户的并发服务走 vLLM 路线。Nano-vLLM 是轻量专用引擎pip install nano-vllm-voxcpmRTF 可降到开头提到的 0.13 量级vLLM-Omni 是官方多模态服务框架提供 OpenAI 兼容的/v1/audio/speech接口、PagedAttention 与连续批处理更适合生产环境。vLLM-Omni 的调用方式如下vllm serve openbmb/VoxCPM2 --omni --port 8000 curl http://localhost:8000/v1/audio/speech \ -H Content-Type: application/json \ -d {model:openbmb/VoxCPM2,input:你好VoxCPM2,voice:default} \ --output out.wav️ 调优与排错速查生成阶段真正常用的参数不多推荐区间如下参数作用推荐区间cfg_value引导强度输出贴合指令的紧密程度2.0~3.0默认 2.0inference_timesteps扩散推理步数影响音质平滑度10~20默认 10seed随机种子固定后结果可复现任意整数max_len生成音频的最大长度token 数2~4096默认 4096prompt_wav_path / prompt_text续写式克隆的输入必须成对提供三个高频问题按「症状 → 解法」排查症状启动或生成时提示 CUDA out of memory。解法加载时加load_denoiserFalse降低显存占用仍不足则换用 0.5B 版本显存约 5GB。症状音色设计或可控克隆每次运行结果不一致。解法项目官方说明此类可控生成的稳定性仍在改进中多生成 1~3 次挑选并用seed锁定满意的结果。症状克隆音色与参考音频差异大或音频断续。解法换用更干净、更短的参考录音检查cfg_value是否过高超过 3.0 容易引入杂音。 周边生态与社区如果你的环境不是 Python或偏好可视化流程社区项目值得看看项目一句话说明适用场景Nano-vLLM高吞吐 GPU 推理引擎支持并发请求单服务高负载vLLM-Omni官方多模态服务OpenAI 兼容 API多租户生产部署llama.cpp-omniGGUF 格式的 C 推理支持 CPU/Metal/CUDA/Vulkan无 Python、边缘设备VoxCPM.cppGGML/GGUF 格式推理CPU/CUDA 轻量部署VoxCPM-ONNXONNX 导出CPU 推理优化ComfyUI-VoxCPM节点式工作流可视化流程编排克隆仓库后运行上文第一个代码块确认能出声再根据默认音色是否合业务决定是否做 LoRA 微调。VoxCPM2 是目前少数完全开源、可商用、支持 48kHz 输出与声音克隆的多语言 TTS 选择。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表