ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

UVR5人声分离工具:免费把伴奏从歌曲里拆出来,4步跑通第一首

UVR5人声分离工具:免费把伴奏从歌曲里拆出来,4步跑通第一首 UVR5人声分离工具免费把伴奏从歌曲里拆出来4步跑通第一首【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui你需要从一首歌里把背景里的鼓点、吉他、人声分别拎出来却找不到干净又免费的办法。UVR5Ultimate Vocal Remover就是干这件事的它是一款开源、免费、图形界面的人声分离工具基于深度神经网络音频全程在本机处理不上传给任何服务器。下面按我实际跑通的顺序讲照着做就能拿到第一首伴奏。没有它的时候伴奏这件事有多难办做翻唱、混音、视频配乐的人多半在伴奏从哪来上耗过时间官方伴奏大多数歌曲根本不发布纯靠运气付费下载站按首收费质量还参差不齐在线工具限时长、限次数高峰期排队出来的文件常带杂音。最后我选了本地方案理由有三条免费且开源想换几次模型就换几次没有按次计费离线运行音频不离开本机版权敏感的素材也不用担心被留存三个模型家族MDX-Net、Demucs、VR各有所长同一首歌可以横向对比着选效果最好的输出。从零到第一次成功输出准备环境先确认电脑上有 Python 3.x命令行里跑python --version能看到版本号即可。UVR5 底层依赖 PyTorchrequirements.txt里已经把torch声明在依赖列表中装依赖时会自动带上。安装第一步克隆仓库git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui第二步安装全部依赖pip install -r requirements.txt这一步耗时较长依赖里有librosa、opencv-python、onnxruntime等较大的包耐心等进度条走完。预期你会看到Successfully installed ...的收尾提示如果中途报权限错误把pip install换成pip install --user重试。首次启动python UVR.py预期你会看到一个深色界面上方是 Select Input / Select Output 两个文件选择栏中间是处理方式Process Method和模型下拉框右侧是 Segment Size、Overlap、GPU Conversion 等开关底部显示版本号 v5.6.0。新手的策略是只动左侧输入输出和中间的模型选择其余全部保持默认。跑第一首歌点 Select Input选一首你要处理的音频点 Select Output指定一个单独的输出文件夹别和原文件混放在 Process Method 里选 MDX-Net模型下拉框保持默认的 MDX23C-InstVoc HQ点 Start Processing等进度条走完。完成后去输出目录看会得到歌名_(Vocals).wav和歌名_(Instrumental).wav两个文件后者就是你要的伴奏。如果只要其中一半可以在勾选 Vocal Only 或 Instrumental Only 后再跑省一半时间。它背后到底在干什么传统做法是靠固定频率滤波人声和吉他恰好挤在同一段频率里时滤出来的是两边都被削掉的糊音。UVR5 换了一条路——它让神经网络反复听海量成对数据同一首歌的混音版和干净版学会在频谱上辨认哪些成分属于人声、哪些属于乐器。可以把它想象成一位戴着监听耳机的资深混音师不是按频率一刀切而是听懂声音的成分再拆开。所以 AI 分离效果普遍优于传统滤镜代价是需要下载预训练模型、吃一点算力。三个模型家族的分工大致是MDX-Net 放在models/MDX_Net_Models/流行、摇滚这类人声伴奏平衡性好的场景稳Demucs 放在models/Demucs_Models/复杂编曲细节保留更完整VR 架构放在models/VR_Models/通用另有 DeNoise 降噪专用模型。首跑时软件会自动尝试下载模型网络不畅就手动下载对应文件放进models/对应目录再重启。想深入原理的从 频谱处理公共模块 读起难度曲线比较平缓再看 MDX-Net 核心网络。从能跑到跑得好Segment Size分段大小。为什么重要音频是按分段切块送进模型的分段太小上下文残缺分段太大显存吃紧。怎么调下拉框里是 32 到 4000 的档位默认 256内存紧张就往下调机器富裕就往上试。调完的变化大分段下人声边缘和混响尾巴通常更干净代价是每段处理变慢。Overlap重叠率。为什么重要分段交界处靠重叠来拼接重叠不足会在拼接处留下接缝听感。怎么调MDX-Net 下重叠档从 2 到 50默认 8接缝明显就加到 16 或 24。调完的变化接缝变平滑但整体耗时同比例上升日常 8 起步就够。GPU Conversion 开关。有 NVIDIA 显卡时勾上它程序在 设备检测逻辑 里会先查 CUDA 是否可用可用就自动切到 GPU 设备执行处理时间常常能压缩到原来的几分之一。没勾上或显卡驱动异常时程序自动落回 CPU只是慢不会报错。大概率会撞上的几个坎现象原因一句话动作报 CUDA out of memory显存装不下当前分段把 Segment Size 降一档再跑拼接处有接缝感重叠率太低Overlap 从 8 加到 16 或 24Windows 启动报缺 DLL缺运行库安装 Visual C Redistributable 后重启软件模型一直下载失败网络受限手动下载模型文件放进models/对应目录重启某些频段听感发空当前模型不擅长这类编曲换另一个模型家族跑同一首歌对比装了显卡但没走 GPU驱动版本不匹配检查显卡驱动先取消 GPU 开关用 CPU 兜底出活排查顺序建议记住一句先调参数参数解决不了换模型模型也不行再回头查环境。这个顺序走下来大多数问题都能在十几分钟内定位。今晚就能做的下一步挑一首你唱过最多次的歌按上面的四步跑第一遍分离重点听(Instrumental)文件里有没有残留人声。跑顺之后再看批量把整个文件夹的音频逐首丢进去挂机处理一次出几十首也不是问题。【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表