公司动态

GPT-SoVITS 完整入门指南:5 秒音频做出专业级语音克隆

📅 2026/8/30 7:52:54
GPT-SoVITS 完整入门指南:5 秒音频做出专业级语音克隆
GPT-SoVITS 完整入门指南5 秒音频做出专业级语音克隆【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个开源的语音克隆 文本转语音TTSWebUI 工具5 秒参考音频即可零样本合成1 分钟音频可微调出接近原声的效果。支持普通话、粤语、英语、日语、韩语。适合想做有声内容、游戏配音或个性化语音助手但没有录音棚的新手。它到底替你省掉了什么先说清楚它能干什么。你手里通常只有一段几秒钟的人声但任务是一整章的旁白、二十个游戏角色的台词。GPT-SoVITS 给出两条路零样本合成上传约 5 秒清晰人声作为参考系统直接用这个音色朗读你输入的文字不训练、不等权几十秒出结果。少样本微调再准备 1 分钟左右的同一人语音带文字标注训练出一对小模型GPT 声学预测部分 SoVITS 声码部分音色相似度和自然度都会明显上一个台阶之后长期用这对权。另外它是跨语言的——用普通话训练的模型推理时也可以输出英语、日语、韩语或粤语对做多语言素材很省事。如何安装 GPT-SoVITS 并配好预训练模型克隆仓库git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS然后是安装。三条路径按省事程度排序Windows 集成包官方发布了一个集成包下载解压后双击go-webui.bat就能启动连环境都不用装。脚本安装Linux / macOS 下建一个 Python 3.10 的 conda 环境再跑一条安装命令即可脚本会自动装依赖并下载模型bash install.sh --device CU128 --source HF--device按你的硬件填CU126/CU128N 卡按 CUDA 大版本/ROCMA 卡/MPS或CPU苹果--source选模型下载源国内网络选ModelScope或HF-Mirror更快。Windows 上对应脚本是 install.ps1。 3.手动安装pip install -r [extra-req.txt](https://link.gitcode.com/i/14f6283e92edc5167d2b50623bba41ee) --no-deps加pip install -r [requirements.txt](https://link.gitcode.com/i/af92b74b46b8846f733118fed34ef9a8)再单独装好 FFmpeg。适合想完全掌控每一步的人。装完检查预训练模型是否就位关键位置有三个脚本成功跑完会全部下好主模型GPT_SoVITS/pretrained_models/中文声调模型 G2PW解压后重命名为G2PWModel放进 GPT_SoVITS/text/仅中文合成需要人声分离 UVR5 权重tools/uvr5/uvr5_weights/语音识别ASR模型首次使用时会自动下载不用管。硬件参考N 卡 8GB 显存起步4GB 以下会自动退回 CPU 且不可用半精度见 config.py 中的设备判断逻辑16GB 显存跑微调更从容磁盘至少留 20GB 给模型和依赖。如何准备 5 秒参考音频和 1 分钟训练集素材是天花板。参考音频和训练集请尽量满足这几点格式WAV、44.1kHz 采样率、单声道环境安静室内录远离回声和背景音设备优先级是专业麦克风 耳机麦 手机内容语气、语速、情绪有变化别全程一个调子篇幅零样本用 510 秒就够微调建议 15 分钟宁缺毋滥噪声大的片段只会拖后腿正式训练集是一个.list标注文件每行四段竖线分隔音频路径|说话人名|语言代码|文本。语言代码zh中文、ja日语、en英语、ko韩语、yue粤语。例如D:\data\clip001.wav|xiaoming|zh|今天天气真好好消息是标注不用手敲。WebUI 内置 UVR5 人声分离、自动切片tools/slicer2.py、多语言 ASRtools/asr/含 FunASR、SenseVoice、faster-whisper 三套后端和文本校对工具一条链路把原始长音频变成标准.list后面会演示。WebUI 五步完成语音克隆从切分到出音频启动入口是一个命令python webui.py浏览器打开后默认端口 9874定义在 config.py界面分两大块0-前置数据集获取工具和1-GPT-SoVITS-TTS下含1A-训练集格式化工具、1B-微调训练、1C-推理。零样本路径不训练直接进1C-推理页选底模权重上传参考音频、填上参考音频对应的文字和语种再输入要合成的文本点生成即可。微调路径推荐0-前置页填音频路径 → 切片成短片段 → 可选去噪tools/cmd-denoise.py→ 点 ASR 自动转写 → 在页面上逐句校对1A页把片段合并成训练集生成标准.list1B页微调训练产物落在GPT_weights/SoVITS_weights等目录回到1C页权重下拉框里选中刚训好的这对权即可用新音色合成想跳过界面、走命令行微调项目也留了入口音频切分可用 tools/slice_audio.py批量 ASR 可用 tools/asr/funasr_asr.py训练脚本是 GPT_SoVITS/s1_train.py 和 GPT_SoVITS/s2_train.py参数从GPT_SoVITS/configs/下的 yaml 读取。要批量生产比如一整本有声书建议直接用 HTTP 接口 api.py 或 api_v2.py启动后向/tts端点发请求传入文本、参考音频路径和语种参数返回音频流方便脚本循环调用。安装时最易踩的 3 个坑坑一CUDA 版本和 PyTorch 对不上。先用nvidia-smi看驱动支持的 CUDA 版本再选对应的--device CU126/CU128。官方已验证的组合是 Python 3.10/3.11 PyTorch 2.5.1CUDA 12.4或 PyTorch 2.7.0CUDA 12.8。跑不起来时优先怀疑这里其次才怀疑包冲突——重建一个干净的 conda 环境比反复pip install有效得多。坑二微调时爆显存。两个思路一是压低批大小S1 阶段的 batch 写在 GPT_SoVITS/configs/s1.yaml、S2 阶段写在 GPT_SoVITS/configs/s2.json二是开半精度Docker 环境通过环境变量is_halftrue开启普通安装下新版代码会根据显卡自动判断见 config.py。老卡GTX 16 系即使有 GPU 也会自动退回 fp32这是正常行为。坑三找不到模型文件。报错提到s2G*.pth或s1*.ckpt时去对一遍上面三个模型目录。macOS 用户注意官方建议 Mac 上用 CPU 训练GPUMPS训出的权质量明显更差。不同版本怎么选以及推理速度到底快不快仓库里同时存在 v1 / v2 / v3 / v4 / v2Pro / v2ProPlus 几套底模权重路径映射见 config.py选型思路比版本号更有用v3 / v4音色相似度最高不微调直接推底模就有不错效果需要的训练数据最少GPT 也更稳、少复读漏字。适合大多数人。v4 修掉了 v3 的金属感并原生输出 48kHz 音频v3 是 24kHz听感略闷。v1 / v2 / v2Pro训练集音质一般时反而更稳——它们合成出的音色更贴近整个训练集的平均声音而 v3/v4 更偏向参考音频那条。v2Pro 是折中方案显存比 v2 略高音质超过 v4速度接近 v2。速度方面有官方实测数据v2 ProPlusRTF 生成 1 秒音频所耗的真实时间数值越小越快硬件RTF直观感受RTX 40900.014约 1400 字≈4 分钟音频只要 3.4 秒生成RTX 4060 Ti0.028上面内容的两倍时间左右Apple M4CPU0.526实时以下日常可用想进一步压时间可以开半精度、复用已加载的模型服务走 api 常驻进程而不是每次冷启动、一次请求合成长句而不是逐句调。从文档到源码下一步往哪看中文文档docs/cn/README.md其他语言版本在 docs/ 下的en/ja/ko/tr/目录各语言的版本更新记录也在旁边想在线跑仓库根目录的 Colab-WebUI.ipynb训练和 Colab-Inference.ipynb推理可直接在 Colab 打开容器化部署docker-compose.yaml 定义了 CU126/CU128 全量版和 Lite 精简版服务Lite不含 ASR 和 UVR5 模型自构镜像用 docker_build.sh看源码从这三处入手文本前端在 GPT_SoVITS/text/GPT 声学模型在 GPT_SoVITS/AR/models/推理引擎在 GPT_SoVITS/TTS_infer_pack/项目还在持续更新多语言、模型尺寸、情感控制都在计划里遇到报错先翻一遍对应语言的 Changelog很多奇怪行为其实是版本差异。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考