公司动态

Retrieval-based-Voice-Conversion-WebUI AI语音转换完整教程:如何用10分钟音频完成语音克隆与实时变声

📅 2026/9/3 9:22:52
Retrieval-based-Voice-Conversion-WebUI AI语音转换完整教程:如何用10分钟音频完成语音克隆与实时变声
Retrieval-based-Voice-Conversion-WebUI AI语音转换完整教程如何用10分钟音频完成语音克隆与实时变声【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI假设你手里有一段 10 多分钟的干声没有背景音乐的人声想让自己的直播、短视频配音统一成某个角色的音色但不想折腾大规模语料采集和复杂的推理环境。Retrieval-based-Voice-Conversion-WebUI社区里常简称 RVC解决的就是这个问题它是一个基于 VITS 的开源变声框架用 10 分钟量级的低底噪语音数据就能训练出一个可用的 AI 语音转换模型训练完既能在网页里批量转换音频也能接麦克风做实时变声。它是什么适合谁一句话定位Retrieval-based-Voice-Conversion-WebUI 是一个提供网页界面的语音克隆与 AI 语音转换工具核心机制是用 top1 检索把输入音频的声纹特征替换为训练集的特征从而避免音色泄漏即转换结果里混入说话人本身音色的问题。底模本身用约 50 小时的开源 VCTK 数据集训练可以直接放心使用。它适合三类人想把音色搬到自己音频里的内容创作者需要低延迟麦克风变声的直播用户以及想跑通数据集 → 训练 → 推理完整流程、顺便学习 VITS 语音转换管线的开发者。NVIDIA 显卡体验最顺AMD/Intel 用户也支持DML 加速路径。准备工作环境、依赖与模型文件下载环境要求只有一条硬指标Python 版本大于 3.8。第一步安装 PyTorch 和对应显卡的依赖N 卡与 A 卡/I 卡二选一pip install torch torchvision torchaudio pip install -r requirements.txt # NVIDIA 显卡 pip install -r requirements-dml.txt # AMD / Intel 显卡DirectMLMacOS 用户可以直接跑项目根目录的run.shsh ./run.sh它会自动处理依赖。第二步安装 ffmpeg音频切分、转码都依赖它。Ubuntu/Debian 用sudo apt install ffmpegMacOS 用brew install ffmpegWindows 把 ffmpeg.exe 和 ffprobe.exe 放到项目根目录即可。第三步下载预训练模型文件。除了 PyTorch 依赖RVC 还需要 Hubert 声纹特征模型、RMVPE 音高模型InterSpeech 2023 提出的人声音高提取算法专门解决哑音问题和 UVR5 人声分离模型。项目自带下载脚本python tools/download_models.py它会依次拉取assets/hubert/hubert_base.pt、assets/rmvpe/rmvpe.pt、assets/uvr5_weights/下的 onnx 模型以及assets/pretrained/下的 D32k/D40k/D48k 等预训练权重对应 32k、40k、48k 三档输出采样率配置文件在configs/目录。跑通主流程从启动到出第一个转换结果启动 WebUI依赖和模型就位后在项目根目录执行python infer-web.py浏览器会自动打开本地界面训练、推理、音色库管理都在页面上操作。准备训练数据官方建议的数据量是 10 到 50 分钟音质高、底噪低、音色统一的前提下5 到 10 分钟也能出可用的结果。把音频放进一个独立文件夹注意两点路径不要带空格和括号避免中文路径这两点直接关联后文的 ffmpeg error单条音频不要太长可以留在 WebUI 里用自带的音频切分功能切成小段。如果原音频带背景音乐可以先在界面里调用集成的 UVR5 模型做人声伴奏分离再拿分离出的干声去训练。执行训练进入训练选项卡填入数据集路径和实验名点一键训练。流程会自动完成切分 → 提取音高 → 提取 Hubert 特征 → 训练 → 建立检索索引。两个新手最需要知道的手动参数batch size显存紧张就调小4G 显存的卡能训4G 以下基本没戏total_epoch底噪大的数据集 20~30 轮就够音质高且时长充足的数据集可以开到 200。看到 Training is done 字样即模型训练成功。选择模型生成结果训练完进入推理选项卡选择刚训好的模型实验名下 60MB 以上的 pth 文件和对应的 index 索引文件上传待转换音频音高提取算法选 rmvpe点推理按钮即可得到转换后的 wav。有一个参数值得先懂再调index_rate。它控制检索混合的强度调高趋近 1时音色更贴近训练集、杜绝源音色泄漏但音质会更依赖训练集本身的水准调低则结果更容易受推理源音质影响。训练集质量一般时可以从 0.6~0.8 起步听感对比。训练中容易踩的坑与处理方法以下问题都来自项目自带的常见问题文档按现象 → 原因 → 处理整理训练时报 ffmpeg error 或 utf8 error现象一键训练刚开始就报 ffmpeg 相关错误。原因大概率不是 ffmpeg 本身的问题而是音频路径里带了空格、括号等特殊字符ffmpeg error或中文路径在写 filelist 时编码出错utf8 error。处理把数据集移到纯英文、无空格的路径下重跑。Cuda out of memory现象训练或推理时显存溢出报错。原因显存不够少数情况是 CUDA 配置问题。处理训练时调小 batch size推理时缩小configs/config.py末尾的 x_pad、x_query、x_center、x_max。4G 以下显存建议放弃本地训练。显示训练完成但索引文件没生成现象日志出现 Training is done. The program is closed. 之后紧跟报错且没有 added 开头的 index 文件。原因训练集太大内存不足以完成索引建立后面的报错是假的。处理手动再点一次训练索引按钮即可。WebUI 页面提示 Connection Error 或 Expecting value现象界面打不开或弹出 JSON 解析错误。原因前者通常是控制台黑窗口被手动关闭了后者多为局域网/全局代理干扰包括服务端设置的 http_proxy。处理重新完整启动程序关闭代理后再试。Windows 报 llvmlite.dll 加载失败现象启动即报 OSError: Could not load shared object file: llvmlite.dll。原因缺少 Visual C 运行库。处理安装 Visual C Redistributable 后重启 WebUI。进阶玩法实时变声与模型融合实时变声项目提供了独立的实时变声入口Windows 下双击go-realtime-gui.batAMD/Intel 显卡用go-realtime-gui-dml.bat。官方实现的端到端延迟约为 170ms如果输入输出都走 ASIO 设备可以压到约 90ms但这一档非常依赖声卡和驱动的支持普通声卡用 170ms 档位即可。用 ckpt-merge 融合两个模型在ckpt 处理选项卡里有 ckpt-merge 功能可以把两个音色模型的权重按比例混合得到一个介于两者之间的新音色——比如两个同风格角色各取 0.5或主模型 0.8 辅助模型 0.2 微调气息感。融合完的产物仍是标准 pth直接丢进推理选项卡使用。文档、源码与社区入口中文常见问题覆盖音高、index_rate、分享模型格式等最常被问到的问题建议训练前通读一遍中文更新日志跟进 v1/v2 版本差异核心推理源码RMVPE、VC 管线、UVR5 封装都在这里适合想看算法实现的人i18n 多语言文案界面支持中、英、日、韩、法、葡等语言语言包即 JSON 文件项目通过 MIT 协议 开源商用前建议对照根目录的《MIT协议暨相关引用库协议》确认引用库的授权范围下一步从一段 10 分钟的干净干声开始按上文装好环境、跑完一次训练用 index_rate 高低各推理一版对比听感再决定要不要进实时变声和模型融合这两个方向。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考