ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

MiniCPM-o 4.5 如何执行 Mimick 任务评估端到端语音建模能力?

MiniCPM-o 4.5 如何执行 Mimick 任务评估端到端语音建模能力? MiniCPM-o 4.5 如何执行 Mimick 任务评估端到端语音建模能力【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V如果你的任务是验证 MiniCPM-o 4.5 的语音生成质量——即模型能否在听到一段音频后以高保真方式重建出原始语音——仓库 README 中给出的对应评估路径是Mimick仿声复现任务。模型接收音频输入后会先进行转写再重建原始音频尽可能保留细粒度的声学、副语言以及语义信息重建音频与原始音频的相似度越高说明端到端语音建模能力越强。这条路径只适用于通过 Hugging Face Transformers 在 NVIDIA GPU 上离线推理的场景依赖文档中明确给出的环境版本与调用参数。准备环境安装带 TTS 的推理依赖Mimick 任务需要生成音频输出因此 README 要求使用「With TTS or streaming inference」一栏的完整依赖组合而不是省略 TTS 的精简组合。文档说明环境基于 Python 3.10 测试并要求固定transformers4.51.0其他版本可能存在兼容性问题pip install transformers4.51.0 accelerate torch2.3.0,2.8.0 torchaudio2.8.0 minicpmo-utils[all]1.0.5注意minicpmo-utils[all]中的[all]是 TTS 路径的必需项只装不带[all]的版本会缺少 TTS 相关组件。加载 MiniCPM-o 4.5 并初始化 TTS按 README.md 中「Model Initialization」给出的方式加载全模态模型并显式开启音频与 TTS 初始化然后调用model.init_tts()完成 TTS 模块初始化import torch from transformers import AutoModel # 加载全模态模型默认init_visionTrue, init_audioTrue, init_ttsTrue model AutoModel.from_pretrained( openbmb/MiniCPM-o-4_5, trust_remote_codeTrue, attn_implementationsdpa, # 可选 flash_attention_2 torch_dtypetorch.bfloat16, init_visionTrue, init_audioTrue, init_ttsTrue, ) model.eval().cuda() # 初始化 TTS用于音频输出 model.init_tts()model.eval().cuda()之后再进行 Mimick 推理这是文档示例给出的调用顺序。执行 Mimick 任务README「仿声复现Mimick」一节给出的完整调用如下。代码中的系统提示词和任务提示词需原样保留——Mimick任务靠这两条提示词定义输入输出行为import librosa system_prompt You are a helpful assistant. You can accept video, audio, and text input and output voice and text. Respond with just the answer, no redundancy. mimick_prompt Please repeat the following speech in the appropriate language. # 读取待评估的语音音频文档示例路径为 assets/Trump_WEF_2018_10s.mp3 # 该文件不在本仓库中请替换为你自己的语音文件路径 audio_input, _ librosa.load(你的语音音频文件路径, sr16000, monoTrue) msgs [ {role: system, content: [system_prompt]}, {role: user, content: [mimick_prompt, audio_input]} ] res model.chat( msgsmsgs, do_sampleTrue, max_new_tokens512, use_tts_templateTrue, temperature0.1, generate_audioTrue, output_audio_pathoutput_mimick.wav, )代码中需要替换的只有一处librosa.load的音频路径。文档示例使用的assets/Trump_WEF_2018_10s.mp3未随仓库提供仓库中自带的示例音频如 assets/input_examples/audio_understanding.mp3也可以作为输入替代。加载参数sr16000, monoTrue是文档固定的处理方式保持不变。model.chat的关键参数按文档原样给出use_tts_templateTrue与generate_audioTrue共同启用语音生成路径temperature0.1是该示例的采样温度max_new_tokens512限制生成长度。验证结果运行成功后output_audio_path指定位置示例中为output_mimick.wav会生成重建音频文件。README 对该任务的判定口径是重建音频与原始音频的相似度越高说明端到端语音建模能力越强。也就是说验证方式是人工对比output_mimick.wav与输入音频——检查转写内容是否被完整复现、音色与韵律等声学特征是否保留。文档没有给出量化的相似度指标或合格阈值这里不应预设固定数值。若生成的文件为空或无声可回到前面两步检查是否安装了带[all]的依赖组合、是否调用了model.init_tts()。适用边界本路径基于 Hugging Face Transformers 离线推理环境要求为 Python 3.10 与transformers4.51.0文档注明其他版本可能存在兼容性问题硬件为 NVIDIA GPU。Mimick 是半双工 chat 推理与文档中另列的 Duplex全双工流式模式相互独立不要把两种模式的参数混用。更多参数含义与完整示例见 README.md 的「MiniCPM-o 4.5 → Usages」部分API 服务方式则见 docs/api.md。【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表