公司动态
RVC WebUI 完整新手教程:30 分钟跑通 AI 变声训练与实时变声
RVC WebUI 完整新手教程30 分钟跑通 AI 变声训练与实时变声【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC WebUIRetrieval-based-Voice-Conversion-WebUI是一个基于 VITS 的开源变声项目喂给它 10 分钟以上的目标音色语音就能训练出一个人声转换模型之后把你自己的录音或麦克风输入实时转换成那种音色。本教程面向第一次接触变声项目、想在本地电脑上把它跑起来的新手全部步骤可照抄执行。它和调音高 加变调滤镜的思路不同先用神经网络从你的输入音频里提取特征再通过检索top1 匹配把特征替换为训练集的特征后重建音频所以音色变化来自模型本身而不是对原声做简单修饰。 先给结论这套工具能做什么适合谁结论先行它适合三类人——想做翻唱、需要实时变声的直播用户、想批量处理音频的创作者不适合只想装个插件式变声器、不想碰 Python 环境的用户。项目 README 中列出的能力包括网页界面完成数据准备、训练、推理全流程调用 UVR5 模型快速分离人声与伴奏处理歌曲训练数据时用得上内置 RMVPE 音高提取算法InterSpeech 2023 的人声音高提取方案README 称其可根绝哑音问题支持模型融合ckpt-merge 选项卡混合两个模型的音色支持 A 卡DirectML和 I 卡IPEX加速不只有 N 卡。底模基于约 50 小时的开源 VCTK 数据集训练项目声明无版权顾虑可放心使用。⏱️ 环境准备五步快速开始前置条件Python 版本大于 3.8并安装好 FFmpeg音频处理依赖的工具负责切片和转码。第一步克隆仓库git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI第二步安装 PyTorch 后按显卡安装依赖pip install torch torchvision torchaudio pip install -r requirements.txt # N 卡第三步下载预训练模型。项目需要assets/目录下的模型文件如assets/hubert/hubert_base.pt、assets/uvr5_weights想用 v2 底模还要额外下载assets/pretrained_v2。仓库提供了 tools/download_models.py 批量下载脚本。另需把rmvpe.pt放到项目根目录才能使用 RMVPE 音高提取。第四步启动 WebUIpython infer-web.py浏览器会自动打开训练与推理界面。Windows 整合包用户直接双击go-web.bat即可Mac 用户执行sh ./run.sh。不同显卡装哪个依赖文件硬件依赖文件说明N 卡requirements.txtRTX 30xx 建议指定 CUDA 11.7 版 PyTorchA 卡 / I 卡requirements-dml.txt走 DirectML 加速A 卡Linux ROCmrequirements-amd.txt需先装 ROCm 驱动I 卡Linux IPEXrequirements-ipex.txt启动前先 source Intel 环境️ 训练第一个模型从原始音频到可用检查点在 WebUI 中按音频数据准备 → 训练 → 推理的顺序操作即可。流程上系统会用内置的 slicer2 把你的音频切成小片段提取特征后送入训练脚本 infer/modules/train/train.py。训练完成后别忘了在训练集管理里训练索引文件faiss 特征库——它就是检索环节的数据来源推理时的音色检索靠它完成。训练数据的四个要点时长官方推荐至少 10 分钟低底噪语音这是 README 给出的下限来源如果是翻唱场景先用 UVR5 选项卡从歌曲里分离出人声质量安静环境录制底噪越低越好训练效果与数据质量直接相关版本选择v1 与 v2 两代底模分别对应 configs/v1/ 和 configs/v2/ 下的采样率配置32k / 48k 等训练和推理要使用同一版本。训练超参默认值定义在configs/v1/32k.json等文件里学习率learning_rate: 1e-4、batch_size: 4、最多 20000 个 epoch。显存不足时调小 batch_size 即可。️ 音高提取算法和三个必学参数变声前需要先判断每一帧音频的音高基频。推理界面提供四种算法在 pipeline.py 中实现算法特点pm最快精度一般harvest精度与速度折中crepe精度高但慢资源占用大rmvpe项目推荐效果最好且比 crepe 快需提前放置 rmvpe.ptindex_rate、is_half 与 fp16index_rate检索率控制推理时检索替换的强度GUI 中默认为 0调高可增强目标音色相似度0.5~0.8 之间常作为起点尝试is_half半精度推理开关。configs/config.py 会根据显卡自动判断——老卡1060/1070/1080、P40 等会强制关闭 fp16 并切到 5G 显存档参数新卡走 6G 显存档一般不需要手动干预f0偏移推理时可调升调/降调半音数男女互换音色常用 ±4 到 ±6 半音。 实时变声与批量推理实时变声是独立界面Windows 双击go-realtime-gui.bat启动。README 给出的延迟数据为端到端 170ms若使用 ASIO 输入输出设备可到 90ms但非常依赖硬件与驱动支持。非实时场景有两个入口命令行批量推理tools/infer_batch_rvc.py适合一次处理整个文件夹单条命令行接口tools/infer_cli.py可被其他工具链调用。另外 tools/infer/train-index.py 可以离线重训索引tools/calc_rvc_model_similarity.py 用于对比两个模型音色的相似度。️ 排错清单四类高频问题启动报错、界面打不开先确认 Python 大于 3.8重跑pip install -r requirements.txtWindows 用户检查 FFmpeg 的 exe 是否放在根目录显存不足CUDA out of memory把训练配置里的 batch_size 调小老卡会自动降级到 fp32若仍不足可换 32k 采样率配置数据量更小输出有哑音、断音换用rmvpe算法并确认 rmvpe.pt 已就位音色不像、带原声泄漏检查训练数据是否干净、索引是否已训练、index_rate 是否过低。更完整的问题集合见 docs/cn/faq.md。 目录导览改参数去哪里找路径内容configs/config.py设备、精度、显存档位自动判断逻辑configs/v1/、configs/v2/各采样率的训练超参与模型结构infer/modules/train/数据预处理、特征提取、训练脚本infer/modules/vc/推理管线与四种音高算法实现tools/批量推理、模型下载、ONNX 导出等脚本docs/cn/中文 FAQ 与更新日志下一步建议先跑通 10 分钟数据的完整训练—推理循环再对比 pm 与 rmvpe 两种算法的输出差异最后尝试 ckpt-merge 融合两个模型音色。遇到具体报错优先查 docs/cn 下的 FAQ那里覆盖的问题比本文多得多。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考