公司动态

GPT-SoVITS 语音克隆实战:5秒声音样本快速上手指南

📅 2026/9/2 13:03:30
GPT-SoVITS 语音克隆实战:5秒声音样本快速上手指南
GPT-SoVITS 语音克隆实战5秒声音样本快速上手指南【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS想给自己的播客或视频配上专属声音却找不到合适的配音演员试试开源项目 GPT-SoVITS一段 5 秒的录音样本它就能克隆出这个声音把任意文字变成语音再用 1 分钟训练数据微调相似度还能再上一档。一句话搞懂它是什么GPT-SoVITS 是一个少样本few-shot语音合成工具它内置了用海量数据预训练好的底模喂进去 5 秒人声样本就能做零样本合成相当于一个声音复印机——原版声音是墨粉你的文字是白纸印出来就是那个人在念你的稿子。如果效果还差口气再丢 1 分钟录音让它微调一下专属模型声音就更像了。整套工具带 WebUI切分音频、识别转写、训练、合成都在浏览器里点完。三步跑起来先看一眼环境要求以官方测试过的环境为准档位设备Python / PyTorch最低CPU3.9 / PyTorch 2.2.2推荐NVIDIA GPU CUDA 12.4/12.83.10 或 3.11 / PyTorch 2.5.1 或 2.7.0发烧Apple siliconM 系芯片3.9 或 3.11 / PyTorch 2.5.1 或 2.7.0第 1 步克隆仓库并安装。下面是 Linux/macOS 的流程一条安装脚本会把依赖和预训练模型都下好--source选模型下载源国内网络可用 HF-Mirror 或 ModelScopegit clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF --download-uvr5 # 按你的设备选 CU126/CU128/ROCM/CPU/MPS装完预期看到各预训练模型出现在GPT_SoVITS/pretrained_models/目录里。如果你是 Windows 系统把安装脚本换成pwsh -F install.ps1 --Device CU128 --Source HFmacOS 则把--device换成MPS或CPU。第 2 步启动主界面。python webui.py # 默认启动 v2Pro 版本终端里等一会儿预期看到 Gradio 服务起在http://localhost:9874浏览器打开就是完整的数据准备 → 训练 → 推理工作台。第 3 步出第一条语音。不训练也能直接玩打开主界面里的推理入口或单独跑python GPT_SoVITS/inference_webui.py传一段 5 秒以上的参考人声、填上这段录音里说的话再输入想合成的文本点生成。听到那个人念出你的文字就算跑通了。核心功能拆解零样本合成5 秒录音直接克隆它能做什么不训练任何模型5 秒参考音频 对应文字立刻合成任意台词。怎么用推理界面里填三项——参考音频、参考音频的转写文本、目标文本目标语言可选中文/英文/日文及中英混合、日英混合、多语种混合生成即可。效果怎么判断把合成结果和原录音并排听口型和音色是否像同一个人官方给出的参考速度是 4060 Ti 上实时因子约 0.0281400 字约 4 分钟音频在 4090 上约 3.36 秒推完基本等于实时。少样本微调1 分钟数据练出专属声音它能做什么用 1 分钟甚至几分钟的录音微调出 GPT SoVITS 两个模型相似度明显优于零样本。怎么用主界面训练数据准备里按提示走填音频路径 → 自动切片 →可选降噪 → ASR 自动转写 → 校对文本 → 切到训练标签页开训。训练集标注格式很简单每行一条音频路径|说话人|语言|文本语言代码为zh / ja / en / ko / yue。效果怎么判断同一句台词分别用零样本和微调模型各合成一次对比说话人辨识度微调后通常不再串味。多语言混读 内置数据处理链它能做什么一句话里中文夹英文再夹日文它能自动识别语种分别处理还支持粤语和跨语言推理训练数据是中文也能合成英文。除了训练它还把数据准备的脏活都内置了UVR5 人声分离从带 BGM 的歌里抽人声权重放tools/uvr5/uvr5_weights/、命令行切片tools/slicer2.py、FunASR / Faster Whisper 转写tools/asr/funasr_asr.py、tools/asr/fasterwhisper_asr.py。这样从一首歌到一份可训练数据集全程不用换工具。实战调优让效果和速度再进一步对合成结果影响最大的就这几个旋钮参数默认值建议值为什么top_p / temperature推理界面滑杆0~1均为 10.6~1.0 之间试调低更稳、少出现复读漏字调高更有情绪起伏但可能不稳定半精度fp16自动检测 GPU 后启用也可用环境变量is_halftrue控制新卡保持开启省显存、推理更快4GB 以下显存的卡会自动退回 CPU fp32底模版本v2Pro见下方选版表不同版本对参考音频的依赖方式不同选错版本效果差一截底模版本怎么选仓库内置 v1 / v2 / v3 / v4 / v2Pro / v2ProPlus版本特点v1 / v2 / v2Pro对平均音质的训练集也能出不错效果音色偏向整体训练集v3 / v4零样本相似度更高、更不容易复读v4 原生输出 48k 音频、修掉了 v3 的金属感音色更贴近参考音频但训练集质量一般时不如 v2 系稳不确定就选 v2Prowebui.py默认就是它它用 v2 级别的硬件成本和速度做到了超过 v4 的综合表现是官方推荐的平衡点。另外主界面启动参数python webui.py v1可切回 v1 老版本--port相关的端口主界面 9874、UVR5 9873、推理 9872都定义在config.py里被占用时可从环境变量或改配置入手。踩坑速查症状安装脚本跑完预训练模型目录还是空的→ 检查GPT_SoVITS/pretrained_models/是否有文件没有就按 README 手动补下模型含中文 TTS 必需的 G2PW 模型解压后放到GPT_SoVITS/text/G2PWModel。国内网络优先换--source ModelScope重跑安装。症状Address already in useWebUI 起不来→ 9874 端口被占了。杀掉旧进程Windows 可用netstat -ano | findstr 9874找到 PID或等旧终端彻底退出再启动python webui.py。症状训练中爆显存CUDA out of memory→ 训练配置在GPT_SoVITS/configs/下默认就是batch_size: 8precision: 16-mixed见s1longer.yaml显存紧张时调小 batch_size并确保半精度开着。推理端则缩短参考音频长度、关掉不必要的浏览器页面。症状零样本合成串味不像参考音频→ 先检查参考音频人声是否清晰、有没有 BGM 残留、转写文本是否准确。再确认版本选对平均音质的数据 v3/v4 可能不如 v2Pro 稳v3/v4 音色更贴参考音频但对训练集质量更挑。最后再上 1 分钟微调兜底。症状ASR 转写错字多训练前就得手动改半天→ 换转写后端试试WebUI 里可切换 Fun-ASR-Nano多语种自动检测、SenseVoice快、经典 FunASR中文/粤语英文日文还能用tools/asr/fasterwhisper_asr.py走 Faster Whisper。中文数据先用 FunASR 系往往校对量最小。延伸探索中文用户手册仓库内docs/cn/README.md更新日志看 docs/cn/Changelog_CN.md训练入口源码GPT 侧 GPT_SoVITS/s1_train.py、声码器侧 GPT_SoVITS/s2_train_v3.py模型结构在 GPT_SoVITS/AR/models/想脱离 WebUI 做批量合成看命令行工具 GPT_SoVITS/inference_cli.py参数化指定参考音频和输出目录生产部署仓库自带 Dockerfile 与 docker-compose.yamlbash docker_build.sh --cuda 12.8可本地构建镜像进阶方向读 GPT_SoVITS/configs/ 里的训练 yaml理解 batch_size、epochs、学习率这些旋钮或者研究 GPT_SoVITS/module/ 下的声学模型实现搞懂文字→语义 token→音频这条链路打开终端把那段 5 秒录音丢进推理界面听听它念出来的第一句话像不像——这就是 GPT-SoVITS 的全部魅力起点。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考