公司动态
GPT-SoVITS 快速上手教程:1分钟录音如何克隆出一个专属音色
GPT-SoVITS 快速上手教程1分钟录音如何克隆出一个专属音色【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个开源的少样本语音克隆与文本朗读TTS工具全程在网页界面里完成丢 5 秒参考音频即可零样本克隆音色用 1 分钟左右的录音微调就能训出一个相似度更高的定制音色模型 ️ 无论你是想给播客、游戏、短视频配专属声音的内容创作者还是想集成语音能力的开发者都能在这里完成从音频处理、自动标注到模型训练、推理合成的完整闭环。项目支持中文含粤语、英文、日文、韩文朗读。能力全景GPT-SoVITS 能帮你做什么功能模块能干什么零样本 TTS只需一段约 5 秒的参考音频不做任何训练就能借到这个音色少样本微调约 1 分钟训练数据把音色相似度再往上提一档跨语言推理用中文数据训练的模型也可以合成英/日/韩/粤语文本语音切分长音频按静音自动切成适合训练的短片段tools/slice_audio.py人声分离 UVR5从歌曲、混音里把人声和伴奏拆开tools/uvr5/语音识别 ASR自动给切片音频打字幕内置 Fun-ASR-Nano、SenseVoice、FunASR 等后端tools/asr/标注校对 SubFix批量修正 ASR 输出里的错别字省去逐条手改API 服务api_v2.py 等提供 HTTP 接口方便接入自己的应用ONNX 导出GPT_SoVITS/onnx_export.py 导出推理模型加速部署速度方面官方标注 v2 ProPlus 的推理 RTF 在 RTX 4090 上约 0.014、RTX 4060Ti 上约 0.028M4 CPU 上约 0.526——也就是说 GPU 环境下合成一段几分钟的音频通常只需几秒。最短上手路径三个关键决策就够跑起来 部署这件事其实只需要做对三个选择。决策一按硬件选安装参数。项目用安装脚本一键建好 Conda 环境并下载全部预训练模型你只需回答两个问题设备是什么、模型源走哪里。你的硬件Linuxinstall.shWindowsinstall.ps1NVIDIA CUDA 12.6--device CU126-Device CU126NVIDIA CUDA 12.8--device CU128-Device CU128只有 CPU--device CPU-Device CPU下载加速--source HF-Mirror或ModelScope同左-Source HF-Mirror# 适用场景Linux 上一键安装环境与预训练模型设备、镜像源按上表替换 bash install.sh --device CU126 --source HF-Mirror决策二启动主界面。安装完成后一条命令打开 WebUI浏览器里完成后续所有操作Windows 集成包用户直接双击go-webui.ps1即可。# 适用场景启动 WebUI 主界面在浏览器中完成全部操作 python webui.py决策三选对模型版本。当前提供 v1、v2、v2Pro、v2ProPlus、v3、v4 等多个档位。经验法则是训练素材音质一般时优先 v1/v2/v2Pro 系列追求高相似度、情感表现力且素材干净时选 v3/v4v4 修复了 v3 的金属感音色问题并原生输出 48k 音频。各版本差异详见 README 的 Release Notes 部分训练配置位于 GPT_SoVITS/configs/。场景一把 1 分钟录音变成定制音色微调全流程 这是 GPT-SoVITS 最核心的用法用你自己的声音训练一个专属模型。整条流水线都在 WebUI 的数据集处理与训练页签内完成路径自动填写你只需要按顺序点按钮。第一步备料与粗加工。如果素材是带背景音乐的录音先用 UVR5 分离出人声有杂音则用降噪工具tools/cmd-denoise.py-i输入目录、-o输出目录处理一遍。第二步切片。把长音频切成 5~15 秒的短片段核心参数如下参数含义建议threshold低于此音量视为可切分的静音点从 0.03 起试min_length每个片段的最短时长秒太短的段会自动并到相邻段min_interval相邻切分点之间的最小间隔防止密集碎切max_sil_kept切分后保留的头部/尾部静音上限保留自然呼吸感即可第三步自动标注。用 ASR 工具为切片批量生成文本再进 SubFix 校对页修正错字。最终得到的.list标注文件每行格式为音频路径|说话人|语言|文本语言码取值 zh / en / ja / ko / yue。第四步特征提取与两阶段训练。数据预处理脚本位于 GPT_SoVITS/prepare_datasets/依次产出文本特征1-get-text、自监督声学特征2-get-hubert-wav32k和语义 Token3-get-semantic。随后分两阶段训练S1GPT 模型像一位导演学会根据文本规划说什么输出语义 Token 序列S2SoVITS 声码器像一位歌手把 Token 序列唱成真实波形——声码器就是把乐谱变成歌声的环节。第五步验收。训练产物自动落入模型目录在推理页选中新模型用同一段文本对比原版音色相似度达标即可交付。场景二不训练的 5 秒克隆零样本合成⚡ 如果你只是尝个鲜或临时用一次可以完全跳过训练。打开推理界面GPT_SoVITS/inference_webui.py或主 WebUI 中的 1C-inference 入口流程是上传一段 5~10 秒的参考音频并输入这段音频对应的文字参考文本越准确音色提取越干净选择参考音频语言填入要合成的目标文本和目标语言点击合成试听。生成时的三个可调参数及默认值取自 GPT_SoVITS/inference_webui.py参数默认值直觉理解speed1语速倍率调快省时间、调慢更从容top_p0.6候选采样范围越大语气越随性temperature0.6随机性越高起伏越大、越易出怪句零样本的优点是快代价是音色稳定性不如微调模型对音色要求严格时回到场景一走一遍微调。场景三接入自己的应用API 与批量合成 要把声音能力装进产品有三条路HTTP 接口api.py 与 api_v2.py 提供推理服务供上层应用调用适合搭建自己的声音后端命令行单条合成GPT_SoVITS/inference_cli.py 需要传入 GPT 模型、SoVITS 模型、参考音频及其文本、目标文本与语言、输出目录等参数适合脚本化调用推理加速GPT_SoVITS/onnx_export.py 把模型导出为 ONNX 格式Open Neural Network Exchange一种跨框架的通用模型格式交给 ONNX Runtime 执行在资源受限的机器上也能保持可观的推理速度。常见问题速查表遇到的现象处理方式安装长时间卡住、下载超时换--source为HF-Mirror或ModelScope中断后清理残留目录重装启动时提示预训练模型缺失重跑安装脚本会自动补齐手动放置则统一进GPT_SoVITS/pretrained_models/切出来的片段太碎调高 threshold反之有效语音被切丢则调低训练爆显存保持半精度开启is_half并调小 batch_size主界面会按显存自动给默认值Docker 下行为异常Windows 的 Docker Desktop 默认共享内存偏小把shm_size调到 16g见 docker-compose.yamlmacOS 上训练效果不佳官方提示 GPU 训练质量偏低建议按 README 使用 CPU 方案中文合成读音/多音字不准确认已按 README 部署 G2PW 模型到GPT_SoVITS/text/中文必需ASR 首次使用很慢模型首次会现下载也可预先放到tools/asr/models/离线使用写在最后GPT-SoVITS 把数据→训练→合成整条链路压进了一个网页用极少的录音换来了相当高的音色还原度——这大概是开源 TTS 领域里上手门槛最低、上限又不低的选择之一。接下来可以探索的方向一是多语言混合训练用中英混读素材提升跨语言朗读的自然度二是API 化集成结合 api_v2.py 与对话模型搭建端到端的语音交互系统 【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考