公司动态

GPT-SoVITS 语音克隆完整教程:从 5 秒样本到第一条合成语音

📅 2026/8/30 13:43:23
GPT-SoVITS 语音克隆完整教程:从 5 秒样本到第一条合成语音
GPT-SoVITS 语音克隆完整教程从 5 秒样本到第一条合成语音【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS你有一段朋友 5 秒的录音想让它来读你的视频文案——GPT-SoVITS 语音克隆就是干这个的。它是个免费开源的 TTS文本转语音系统5 秒样本直接零样本合成1 分钟数据可微调出专属音色支持中、英、日、韩、粤跨语言。做内容的、写代码的第一个小时就能出声。 能力速览GPT-SoVITS 语音克隆能帮你干成的 4 件事给视频或播客配一段像本人的声音。不用录完整条音频。丢进 5 秒参考录音写上它对应的文字再输入要合成的文本系统立刻用这个音色读出来——这就是零样本合成全程零训练。把某个音色调得更像本人。零样本的相似度有天花板。如果你手里有 1 分钟左右这个人的干净录音可以做少样本微调先切分、转写、校对再训练 GPT 和 SoVITS 两个模型合成时改选自己训练的权重即可。让中文样本说出英文。跨语言推理是内置能力参考音频和目标文本可以是不同语言。语言代码很好认zh 中文、en 英文、ja 日文、ko 韩文、yue 粤语合成界面上直接选。从一段长音频里做出训练集。WebUI 里自带人声分离从 BGM 里抠出人声、自动切片、多语言 ASR 识别和文本校对界面新手不需要自己装一堆辅助工具tools/asr/ 目录下的识别模块都整合进来了。 最短路径出声音安装步骤 零样本合成三个平台走同一条主线先克隆仓库装好 conda 后创建 3.10 的 Python 环境再跑官方安装脚本。脚本会按你指定的显卡和模型源自动装好 PyTorch、依赖包并下载 GPT-SoVITS 主模型、G2PW 文本模型等文件git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF平台差异就一句话Windows 用 install.ps1参数写法相同macOS 把设备改成 MPS 或 CPU官方提示 Mac GPU 训练质量偏低建议 CPU。国内网络把 --source 换成 HF-Mirror 或 ModelScope想要人声分离工具就加 --download-uvr5。硬件门槛不高入门 4 核 CPU 8GB 内存 GTX 1060 级显卡推荐 8 核 32GB RTX 3090磁盘至少留 20GB 放模型和数据。装完不用训练就能先出声音运行python webui.py打开主界面进入推理区上传 5 秒左右的人声参考音频把这段音频里说的原话逐字填进参考文本框选好参考语言和目标语言输入正文点合成。第一次点不训练直接推底模即可系统会用预训练模型直接推理产物 wav 存在输出目录里听起来已经接近本人。️ 把声音调得更像1 分钟微调的数据检查单想从有点像到很像靠的是微调。先拿这份检查单过一遍数据时长 1 分钟上下即可宁少而干净勿多而嘈杂录音无背景音乐、无混响、无口水音情绪自然覆盖不同语速和语气别全用同一种念法文本逐字对应数字、标点都按实际口播写语料清单每行一条竖线分隔四段音频路径 | 说话人 | 语言代码 | 文本说话人名字全程保持一致训练到合成一共五步预处理主界面 1-0A 上传原始长音频用人声分离去掉伴奏再用 1-0B 自动切片成短句切完可以人工删掉不合格片段转写校对切片结果丢给 ASR 批量识别打开标注界面逐条核对错字、漏字都在这里改掉训练 GPT选版本新手选 v2 系列追求质量选 v3/v4 或 v2Pro设好批大小和轮数开始训练产物落在 logs 目录训练 SoVITS用同批数据再训声学模型配置参考 configs 目录 里的 s1.yaml、s2.json 等文件合成验证回到推理页GPT/SoVITS 权重下拉框里选自己刚训的模型换不同文本各合几条和原声对比️ 调优清单按现象对号入座声音不像本人参考音频换成 5–10 秒、单人单音色、无噪声的片段且参考文本逐字准确目标语言与样本语言差异大时换成该语言训练数据更充足的版本如 v3/v4再试生成太慢确认推理真的跑在 GPU 上终端里 nvidia-smi 应在合成时看到显存占用长文本按换行拆成短句逐段合成比一次性喂长文更稳也更快追求速度可试 v2ProPlus 权重官方在 4090 上测得 RTF 约 0.014显存不够开启 fp16 半精度config.py 里 is_half 默认读环境变量支持 fp16 的显卡保持开启降低批大小、加大梯度累积步数configs 目录 下各 yaml 里都有对应参数实在紧张就换 CPU 训练或选更轻的版本音质差、有杂音先把素材用人声分离过一遍再切片别让伴奏混进训练集参考音频重录一遍环境安静、距离麦克风约一拳换版本对比一次v2Pro 与 v3 的音色质感差别明显️ 报错自救按现象查原因现象安装脚本报 Nvidia Driver Not Found或装完 CUDA 相关报错可能原因NVIDIA 驱动版本与所选 CU126/CU128 不匹配 解法先查驱动支持的 CUDA 版本再选对应 --device 重装 PyTorchnvidia-smi现象pip 阶段依赖冲突、包反复覆盖可能原因复用了旧环境残留包互相打架 解法整个环境删掉重建conda remove 加 --all新环境里只跑官方安装脚本不要手工混装现象合成结果静音、破音或完全不像可能原因参考音频损坏/过短或参考文本与音频内容对不上 解法换一段 5 秒以上清晰录音逐字核对参考文本语言选项与内容一致后再合成现象训练跑一半中断日志报分布式或断点错误可能原因单卡被占、断点文件与版本不兼容 解法训练前确认显存空闲换新的实验名从干净断点重启不要混用不同版本的 logs下一步从一次克隆到稳定产出第一次合成成功后把参考音频 参考文本 语言组合记成模板之后同音色任务直接复用省去每次试错的来回长文案按句拆分、逐段合成再拼接每段单独试听比长句一次成型更可控某个音色要反复用时值得花十分钟做一轮微调并把模型权重归档推理页直接选自己的权重跨语言稳定性也会更好参数拿不准时翻 docs/cn 的中文文档或在 GPT_SoVITS/inference_webui.py 附近看默认取值GPT-SoVITS 的用法就是这样两条线零样本管马上能用微调管长期好用。先用最短路径出第一条声音再按数据检查单把音色磨到位你的语音克隆工作流就搭起来了。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考