公司动态
RVC 上手指南:10 分钟语音数据训练出你的 AI 变声模型
RVC 上手指南10 分钟语音数据训练出你的 AI 变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一个基于 VITS 的开源语音转换框架。你只需准备约 10 分钟的低底噪语音就能训练出一个属于自己的 AI 变声模型把任意音频变成指定音色的声音实时延迟最低可到 90ms。上手后你能做到什么把一段录音唱歌、配音素材转换成指定人的音色输出 WAV 文件通过 WebUI 界面完成数据 → 训练 → 推理全流程无需写代码用 UVR5 模型把歌曲里的人声和伴奏快速分离用 WebUI 内置的 Onnx 导出功能把模型转为更轻量的 ONNX 格式用实时变声界面gui_v1.py在直播、会议中即说即变声它为什么值得用相比整段音频跑一次的通用 TTS/变声方案RVC 的差异点集中在三处维度传统方案RVC训练数据量通常需数小时语料约 10 分钟即可出可用效果音色泄漏转换结果混入源音源音色用 top1 检索替换源特征从机制上规避推理延迟离线批处理为主端到端约 170msASIO 设备下约 90ms显卡要求往往需要大显存4G 显存卡可推理普通消费级卡可训练附加能力单一转换附带人声分离、模型融合、ONNX 导出底模由约 50 小时的开源 VCTK 训练集训练而来无版权顾虑放心使用。准备与安装前置要求Python 3.8。先克隆代码下文命令均在此目录内执行git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIWindows 安装步骤# 1. 先装 PyTorch已装可跳过 pip install torch torchvision torchaudio # 2. N 卡装主依赖A 卡 / I 卡改用 requirements-dml.txt pip install -r requirements.txt另外把ffmpeg.exe、ffprobe.exe放到项目根目录或加入 PATH。装完双击go-web.bat即可直接启动。Linux 安装步骤按显卡类型选依赖文件pip install torch torchvision torchaudio pip install -r requirements.txt # N 卡 pip install -r requirements-amd.txt # A 卡ROCm pip install -r requirements-ipex.txt # I 卡IPEX sudo apt install ffmpeg # Ubuntu/Debian 补 ffmpegmacOS 安装步骤一条脚本搞定依赖与 ffmpegsh ./run.sh # 或先 brew install ffmpeg下载预训练模型无论哪个平台训练推理都需要一批预训练权重Hubert 特征模型、VITS 底模、RMVPE 音高模型等python tools/download_models.py # 自动下载到 assets/ 对应目录该脚本会拉取assets/hubert/、assets/pretrained/v1、assets/pretrained_v2/v2和assets/uvr5_weights/所需文件清单见 tools/download_models.py。心智模型RVC 是怎么变声的可以把 RVC 理解成一条三环节流水线提取RMVPE 算法从输入音频提取音高F0Hubert 模型提取内容特征索引文件.index记录训练集的特征库。替换用 top1 检索把源音频的特征替换为训练集特征——这是杜绝音色泄漏的关键也是项目名Retrieval-based的由来。合成VITS 底模 HifiGAN 声码器把新特征合成为目标音色的音频。预期管理转换后的声音像训练集里的人但读/唱的是源音频的内容。训练集音质决定上限索引质量影响相似度。最小可行流程5 分钟跑通第一次推理目标不训练先用现成模型转出第一条声音。启动 WebUIpython infer-web.py浏览器自动打开 7865 端口。在模型推理页签切换到单次推理从音色下拉框选一个已有的 .pth 模型若列表为空先把自己下载/下载的模型放入assets/weights/并点刷新音色。上传一段 WAV 源音频音高方法选 RMVPE或 pm点转换。在页面播放器中试听结果——到这里你已经完成了一次完整的 RVC 推理。核心功能详解WebUI 共 6 个页签模型推理、伴奏人声分离、训练、ckpt 处理、Onnx 导出、FAQ。训练从 10 分钟语音到专属音色操作流程放入音频 → 一键训练内部自动完成切分、提取音高、提取特征、训练、生成索引五步。参数推荐值说明训练集时长10~50 分钟底噪低、音色统一时多多益善精简高质量集 5 分钟也可用total_epoch20~30音质一般时到此为止高质量长数据可加到 200batch_size显存 4G 时调小显存不够就降降到 1 还炸只能换卡音高提取方法RMVPE效果最好且比 crepe 更省资源save_every_epoch10每 N 轮存一次 ckpt便于挑中间结果产物位置assets/weights/下出现 60MB 的 .pth 即可直接用于推理logs/实验名/下的文件用于续训与复现不是用来分享的。模型推理单次与批量单次推理选音色 上传 WAV 设参数点转换。批量推理对todo-songs/目录下所有音频批量转换结果输出到done-songs/。参数默认作用index_rate0.66检索混合比例调高更贴近训练集音色抑制泄漏调低更贴推理源音高 key (f0up_key)0半音升降调正数变高、负数变低rms_mix_rate1响度混合比例protect0.33保护辅音清晰度调高可保留更多气声细节伴奏人声分离 去混响 去回声基于 UVR5用assets/uvr5_weights/下的模型把人声 vs 伴奏一键拆开也支持去混响、去回声。产出的人声轨可直接作为训练集素材。ckpt 处理融合与提取小模型ckpt-merge按比例混合两个模型权重微调音色。提取小模型从 logs 下的中间 ckpt 提取出可分享、可推理的 60MB 小模型需选择是否携带音高/目标采样率信息。格式转换可用 tools/infer/trans_weights.py。Onnx 导出WebUI 内置 Onnx 导出页签也可直接运行 tools/export_onnx.py导出后可用 tools/onnx_inference_demo.py 验证降低部署时的 PyTorch 依赖负担。避坑手册按实际出现频率从高到低排列全部来自 docs/cn/faq.md现象报 ffmpeg error / utf8 error原因不是 ffmpeg 坏了而是音频路径带空格、括号或中文。 解法训练集目录改纯英文无空格路径重命名音频文件。现象CUDA out of memory原因显存不足4G 以下显存基本无解4G 还有救。 解法训练降 batch_size推理调小 configs/config.py 末尾的x_pad、x_query、x_center、x_max脚本会按显存自动给默认值手动调小即省显存。现象一键训练结束没有 added 开头的索引文件原因训练集太大内存不足导致添加索引步骤卡住。 解法直接再点一次训练索引按钮通常即可生成。现象训练完推理列表里没有新音色原因模型文件没放对位置。 解法确认 60MB 的 .pth 在assets/weights/下点刷新音色。注意别把logs/下几百 MB 的实验文件复制过去会报 f0、tgt_sr 等 key 缺失错误。现象WebUI 报 Expecting value: line 1 column 1 (char 0)原因系统开了局域网/全局代理。 解法关闭客户端和服务端如学术加速 http_proxy的代理后重启。现象浏览器提示 Connection Error原因启动时黑色控制台窗口被关掉了服务已终止。 解法保持控制台窗口开启。现象报错 expanded size of the tensor ... must match原因wavs16k里存在异常小的音频文件。 解法删掉显著偏小的文件重新点训练模型流程中断过训练完记得再点一次训练索引。现象中途改采样率后报 tensor size 不匹配原因特征文件与采样率不兼容。 解法不要中途换采样率续训必须换的话新建实验名从头训练。进阶玩法与定制调优显存与速度configs/config.py 会根据显卡自动选择 fp16/fp32 并设置x_pad/x_query/x_center/x_max四参数老卡1060/1070/1080 等会自动降级为 fp32一般无需手改显存紧张时手动调小这四个值即可。用 ONNX 做轻量部署导出后用 infer/lib/onnx_inference.py 的推理类替换默认 VC 流程可脱离 PyTorch 运行实时低延迟场景参考 tools/rvc_for_realtime.py。命令行批量处理绕过 WebUI 直接跑 tools/infer_batch_rvc.py常用参数--f0up_key变调、--index_rate音色相似度、--f0methodrmvpe/harvest/pm、--protect辅音保护。生态与延伸资源中文 FAQ 全集docs/cn/faq.md中文更新日志docs/cn/Changelog_CN.md英文训练技巧docs/en/training_tips_en.md训练/推理 API 服务api_240604.py多语言界面中/英/日/韩/法等 13 种语言包i18n/locale/实时变声命令行入口tools/rvc_for_realtime.pyColab 在线 notebookRetrieval_based_Voice_Conversion_WebUI.ipynb下一步RVC 的核心循环就三句download_models.py备模型 → 训练页签一键训练 → 推理页签转换。python tools/download_models.py # 1. 备齐预训练模型 python infer-web.py # 2. 打开 WebUI一键训练 python gui_v1.py # 3. 需要实时变声时启动实时界面先拿 10 分钟自己的清晰录音走完一遍全流程效果不满意就回头调 total_epoch 和 index_rate——迭代速度正是这个框架最大的优势。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考