公司动态
5 步跑通 RVC 语音转换:从环境配置到首次变声
5 步跑通 RVC 语音转换从环境配置到首次变声【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一个靠检索替换源特征来做 RVC 语音转换的 Web 框架。它的卖点是数据量小、训练快、界面友好最少 10 分钟左右的干净人声就能训出可用模型。下面按执行顺序把克隆、装依赖、拉模型、启动这几步需要复制的命令一次讲清楚并附上语音转换过程中最常见的几类报错怎么处理。读懂项目RVC 的定位很直接把训练 推理打包进一个网页里让你在浏览器里完成从切分音频到导出模型的全流程而不需要盯着命令行。几个值得留意的点靠检索压制音色泄漏推理时用 top1 检索把源特征替换成训练集特征底模和输入源的音色不容易串进来出来的声音更像目标人物而不是输入源本人。小数据可跑推荐 10 到 50 分钟低底噪人声。数据精简且音色有特色时几分钟也能出效果这对普通玩家很友好。网页化操作训练、推理、模型处理都在 Gradio 界面里点按钮不用记参数。自带 UVR5 人声分离混音里先把人声和伴奏拆干净再进训练省一道手工处理。RMVPE 音高提取用 RMVPE 算法取人声音高比传统方法更稳哑音更少。多硬件适配N 卡走 CUDAA 卡/I 卡可用 DirectML 或 IPEXMac 走脚本自动装依赖。启动前准备先确认环境再依次执行。整体是一条装 Python → 拉代码 → 装依赖 → 装 FFmpeg的链路。项目要求系统Windows 10/11、Linux、macOSPython3.8 及以上显卡N/A/I 卡皆可显存建议 ≥4GB磁盘预留约 10GB先拉代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI装 PyTorch 核心再按显卡装对应依赖pip install torch torchvision torchaudio # N 卡 pip install -r requirements.txt # A 卡 / I 卡DirectML pip install -r requirements-dml.txt # A 卡 ROCmLinux pip install -r requirements-amd.txt # I 卡 IPEXLinux pip install -r requirements-ipex.txt如果是 Windows N 卡 Ampere 架构RTX 30 系指定 CUDA 版本pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117Mac 用户直接跑脚本装依赖sh ./run.sh音频处理依赖 FFmpeg按系统装一下# Ubuntu / Debian sudo apt install ffmpeg # macOS brew install ffmpegWindows 把 ffmpeg.exe 和 ffprobe.exe 放进项目根目录即可。拉取与配置模型资产RVC 推理和训练都要一批预训练权重项目提供了自动下载脚本。关键点脚本依赖 aria2没装会直接退出先确认aria2c可用。# Windows tools\dlmodels.bat # Linux / macOS sh tools/dlmodels.sh跑完会补齐这些文件assets/hubert/hubert_base.ptHubert 特征模型assets/pretrainedv1 的 D/G 系列权重assets/pretrained_v2v2 的 f0D/f0G 等权重用 v2 模型时需要assets/uvr5_weightsUVR5 分离权重assets/rmvpe/rmvpe.ptRMVPE 音高模型用 A 卡 / I 卡的话再额外准备一份rmvpe.onnx放进项目根目录走 onnxruntime 的 DirectML 推理。启动与首次运行装好依赖、拉好模型后直接启动推理训练界面python infer-web.pyWindows 用户也可以双击 go-web.bat它等价于带 7897 端口启动。实时变声界面走另一个入口python gui_v1.py或双击 go-realtime-gui.bat。实时变声默认端到端约 170ms 延迟配 ASIO 设备可压到约 90ms但很吃硬件和驱动。I 卡 IPEX 用户在 Linux 上需要先进 oneAPI 环境source /opt/intel/oneapi/setvars.sh python infer-web.py怎么确认启动成功控制台不再刷报错、出现 Gradio 服务就绪信息浏览器会自动打开没自动打开就手动访问http://localhost:7897。能看到选项卡、点刷新音色能列出模型就说明跑通了。排错手册按现象 → 原因 → 解决三条看基本覆盖语音转换时的高频坑。更多细节见 docs/cn/faq.md。现象可能原因处理办法ffmpeg error / utf8 error路径带空格、括号或训练集是中文路径把音频移到无特殊符号、非中文的目录再重跑一键训练结束没有 added 索引训练集过大添加索引步骤卡住手动再点一次训练索引按钮Cuda error / out of memory显存不足训练时把 batch size 调小最低 1推理时改小 configs/config.py 末尾的x_pad、x_query、x_center、x_max。4GB 以下显存基本可放弃llvmlite.dll加载失败缺 VC 运行库安装 Visual C Redistributablex64后重启 WebUIConnection Error控制台黑窗口被关掉了重新打开控制台并启动Expecting value: line 1 column 1客户端或服务端开了代理关闭全局/局域网代理服务端代理也要 unset推理后看不到训练集音色音色缓存未刷新或训练有报错点刷新音色仍不行就查 logs/实验名 下的日志训练中途张量 size 报错存在异常小音频或中途改了采样率删掉 wavs16k 里明显偏小的音频改采样率请换实验名重训进阶玩法与拓展分享模型要分享的是weights文件夹下约 60MB 以上的 pth不要发logs下那个几百 MB 的继续训练用大文件。推荐把模型 pth 和同名 index 一起打包成 zip 再发出去。继续训练关闭控制台双击 go-web.bat 重启用相同的实验名和网页参数再点训练会接着上次的 checkpoint 往下跑。中途加数据新建一个实验名把上一轮最新的 G/D 文件拷进去一键训练即可续上进度。调 epoch底噪大的训练集 20~30 就够音质高、时长足可拉到 200。收尾把依赖装好、模型拉齐、端口打开RVC 就能在一台普通电脑上跑起语音转换流程。卡住了优先查路径和显存两件事多数报错都落在这上面。相关文档官方说明README.md中文 FAQdocs/cn/faq.md中文更新日志docs/cn/Changelog_CN.md英文训练技巧docs/en/training_tips_en.md配置入口configs/config.py【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考