公司动态

Retrieval-based-Voice-Conversion-WebUI:10 分钟录音,训练出一个能用的 AI 语音转换模型

📅 2026/9/1 11:11:17
Retrieval-based-Voice-Conversion-WebUI:10 分钟录音,训练出一个能用的 AI 语音转换模型
Retrieval-based-Voice-Conversion-WebUI10 分钟录音训练出一个能用的 AI 语音转换模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下称 RVC是个基于 VITS 的 AI 语音转换框架喂它 10 分钟以内的人物录音就能把你说或唱的话换成对方音色。想给视频配音、自制声音克隆变声器的装完即用。它凭什么值得你花 10 分钟装一下10 分钟数据就能出可用音色全程网页点按钮不用写代码内置 UVR5 人声分离混音素材直接用原理不神秘模型先把目标人物的音色学进参数转换时用检索把每个音的特征对回训练集所以说话内容是你的音色是 TA 的。把环境跑起来装好语音转换框架 最低门槛一眼看完系统Windows / Linux / macOS 均可Python3.8 以上磁盘留 10GB 空闲依赖加预训练模型约 3GB显卡N 卡最佳A 卡、I 卡也能跑按顺序执行git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt sh tools/dlmodels.sh python infer-web.py前两条拉取项目并进入目录第三条装 PyTorch装过就跳过第四条装依赖按显卡换文件A 卡Linux ROCmpip install -r requirements-amd.txtI 卡Linux IPEXpip install -r requirements-ipex.txtWindows 上的 A 卡 / I 卡pip install -r requirements-dml.txt第五条下载 hubert、pretrained 等预训练模型Windows 用户改成双击 dlmodels.bat最后一条启动网页界面浏览器打开控制台提示的地址就能用。Linux 记得先sudo apt install ffmpegmacOS 用brew install ffmpeg。跟着走一遍从原始录音到第一声语音转换 备料把目标录音收进一个文件夹收集目标人物 5-10 分钟的干净录音底噪低、单人出声最多 50 分钟以内多多益善全部放进一个文件夹路径保持纯英文、不带空格录音带伴奏的先点UVR5选项卡分离出干声看到这个文件夹里全是纯人声文件备料完成训练三步点完一个变声模型在训练选项卡输入实验名如 mi-test采样率选 40k唱歌要勾选带音高指导纯语音可不勾step2a 填训练文件夹路径点处理数据等输出框提示切片归一化完成step2b 选音高提取算法默认 rmvpe_gpu 即可点特征提取step3 总轮数填 20点一键训练等待主训练逻辑见 infer/modules/train/train.py输出框出现 Training is done 即训练成功要分享的模型是 weights 文件夹下 60MB 的 pth出声推理出第一段转换音频打开推理选项卡点刷新音色选中刚训好的模型拖入源音频自己的录音或 UVR5 分出的干声调音高滑杆听到音色串味就把 index_rate 拉到 1点转换播放输出文件听音色是否对味批量处理用 tools/infer_batch_rvc.py效果不理想时先查这三处数据侧补齐低底噪、音色统一的录音到 10-50 分钟 → 音色更稳塑料味更少剔掉底噪段和他人说话的片段 → 输出里的杂音、破音明显减少参数侧训练集音质差就把 total_epoch 降到 20-30 → 不再放大底噪音质好可以拉到 200index_rate 调到 1 → 消除推理源音色串味代价是音质跟训练集走硬件侧报 out of memory 就把 batch_size 降到 1 → 能训完只是变慢音高算法从 rmvpe 降到 pm → 提取提速适合弱 CPU 的机器踩过的坑替你踩了 ⚠️点处理数据报 ffmpeg error / utf8 error。 原因路径带空格、括号或中文。 一行修复把文件夹挪到纯英文路径重跑。训练完推理里找不到新音色。 原因误用了 logs 下几百 MB 的实验状态大文件。 一行修复点刷新音色选 weights 下 60MB 的模型。更多问题见 docs/cn/faq.md。下一步到这里从一堆录音到一个能换音色的模型就齐了。 把仓库 clone 下来今晚就能听到第一个转换结果明天把实时变声接上这套语音转换工具链就完整了。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考