公司动态
如何直接用上 GPT-SoVITS v2ProPlus 底模:3 处差异讲清它为什么更好听
如何直接用上 GPT-SoVITS v2ProPlus 底模3 处差异讲清它为什么更好听【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS v2ProPlus 是下载完就能推的零训练底模之一。从声音到底好在哪这个问题出发用仓库里 3 处可验证的差异——推理底模映射、声码器配置、判别器结构把 v2ProPlus 的音质变化拆到代码层面最后给一条 3 分钟跑通的路径。底模下拉框里 v2Pro 和 v2ProPlus 怎么选先回答最常见的纠结要不要从 v2Pro 切到 v2ProPlus看 config.py 的name2sovits_path里面有一条不训练直接推v2ProPlus底模说明 v2ProPlus 的设计定位就是零样本人设、不微调也能直接推的底模。而pretrained_gpt_name显示 v2Pro、v2ProPlus 和 v3/v4 指向同一个s1v3.ckpt——文本侧共享一套 GPT换版本换的其实是 SoVITS 声学模型# config.py pretrained_sovits_name { v2: GPT_SoVITS/pretrained_models/gsv-v2final-pretrained/s2G2333k.pth, v2Pro: GPT_SoVITS/pretrained_models/v2Pro/s2Gv2Pro.pth, v2ProPlus: GPT_SoVITS/pretrained_models/v2Pro/s2Gv2ProPlus.pth, }所以版本切换这件事落点集中在那一个.pth声码器权重上。 用 v2ProPlus 前第一步先确认底模文件齐不齐最容易踩的坑不是版本是底模没放对位置。v2ProPlus 涉及的文件要放进GPT_SoVITS/pretrained_modelss2Gv2ProPlus.pth、s2Dv2ProPlus.pthv2Pro 系预训练权重对外加sv/pretrained_eres2netv2w24s4ep4.ckpt说话人嵌入模型GPT 侧的s1v3.ckpt各版本共用。完整下载清单见 docs/cn/README.md。两个自动识别机制值得知道config.py的SoVITS_weight_root已登记SoVITS_weights_v2ProPlus目录你微调出的权重丢进去就会自动出现在下拉框GPT_SoVITS/process_ckpt.py给 v2ProPlus 权重写了版本头b06加载时先读 magic byte 判版本。如果加载后被识别成 v2先怀疑文件没下全。v2ProPlus 和 v2Pro 的真正差异就藏在几行 JSON 里打开两个配置文件 diff 一下Plus到底 Plus 了什么一目了然。GPT_SoVITS/configs/s2v2ProPlus.json 相对s2v2Pro.json的关键改动在 BigVGAN 声码器上采样段首层通道 512 加到 768第一级上采样卷积核 16 换成 20// s2v2ProPlus.json 关键差异右侧注释为 v2Pro 取值 upsample_initial_channel: 768, // v2Pro: 512 upsample_kernel_sizes: [20, 16, 8, 2, 2] // v2Pro: [16, 16, 8, 2, 2]首层更宽、卷积核更大等于给波形重建尤其高频细节留了更大的感受野对应听感上齿音和嘶声更干净。把三代配置摆一起更直观配置项v2 (s2.json)v2Pro (s2v2Pro.json)v2ProPlus (s2v2ProPlus.json)p_dropout0.10.00.0gin_channels51210241024upsample_initial_channel512512768首个上采样卷积核161620判别器周期数577️ 金属音更少一半功劳在判别器声码器决定上限判别器决定你离上限有多近。GPT_SoVITS/module/models.py 里MultiPeriodDiscriminator按版本分了支# module/models.py if version in v2pro_set: periods [2, 3, 5, 7, 11, 17, 23] else: periods [2, 3, 5, 7, 11]多出来的 17、23 是更大的素数周期。训练时判别器要在更多周期结构上验收波形生成端的细粒度周期伪影被压得更狠——这就是 Pro 系听感上金属感减少最直接的代码出处。训练管线里多出来的 sv_emb音色为什么更像翻训练代码Pro 系有一个独有字段。GPT_SoVITS/s2_train.py中 v2Pro/v2ProPlus 的 batch 比普通版多一项sv_emb生成器 forward 时sv_emb随 mel、文本一起送进net_g。它来自 ERes2NetV2 说话人模型即上文那个sv/pretrained_eres2netv2w24s4ep4.ckpt。换句话说老版本靠参考音频的 mel 承载音色Pro 系多喂了一条独立的说话人向量进生成器参考音频只给一分钟时人设稳定性也主要靠它兜底。3 分钟从零跑通 v2ProPlus 的完整路径只想先听效果按这四步走git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS按 docs/cn/README.md 把s2Gv2ProPlus.pth、s2Dv2ProPlus.pth放进GPT_SoVITS/pretrained_models/v2Pro/pretrained_eres2netv2w24s4ep4.ckpt放进pretrained_models/sv/python webui.py启动 WebUI推理模块选版本 v2ProPluswebui.py的 choices 为[v1,v2,v4,v2Pro,v2ProPlus]SoVITS 模型选不训练直接推v2ProPlus底模贴文本出音跑通之后下一步建议做两件事把微调权重分别丢进SoVITS_weights_v2ProPlus/和GPT_weights_v2ProPlus/下拉框会自动拾取若出音偏薄检查config.py里get_device_dtype_sm是否按你的显卡算力给了 FP16——老卡会回退 FP32听感差异先排除这一层再谈调参。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考