公司动态

10分钟上手Raon-OpenTTS-1B:本地部署零样本TTS的完整新手教程

📅 2026/8/26 15:46:21
10分钟上手Raon-OpenTTS-1B:本地部署零样本TTS的完整新手教程
10分钟上手Raon-OpenTTS-1B本地部署零样本TTS的完整新手教程【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1BRaon-OpenTTS-1B是 KRAFTON AI 开源的 10 亿参数级零样本 TTS文本转语音模型支持语音克隆给它一段几秒钟的参考音频它就能用同样的音色、情感和口音朗读任何英文文本完全不需要额外训练。本文是一份面向新手的本地部署完整教程带你 10 分钟内把这个 SOTA 级语音合成模型跑起来。一、什么是零样本 TTSRaon-OpenTTS-1B 强在哪里零样本 TTSZero-shot Text-to-Speech的核心能力是**见声会声**传统 TTS 需要为每个声音录制大量数据并单独训练零样本 TTS 只要几秒参考音频就能即时克隆出目标音色、语速、情感和口音。Raon-OpenTTS-1B 的亮点效果对标闭源 SOTA在 Seed-TTS-Eval 榜单上 WER 1.78%、说话人相似度 SIM 0.749跻身第一梯队与使用数百万小时私有数据训练的闭源系统相当数据与权重全开源模型基于 F5-TTS 的 DiTDiffusion Transformer架构 flow matching 训练公开了 61.5 万小时训练数据可复现性强鲁棒性强在噪声、口音、情绪等 4 类声学场景的自研评测中平均 WER 与 SIM 均为最优⚡推理高效16kHz、80 通道 mel 谱 HiFi-GAN 声码器单机 GPU 即可完成合成。二、仓库里都有什么文件结构速览本仓库是一个标准的 Hugging Face 模型仓库文件非常精简文件作用说明model_520000.pt模型权重约 16.7 GB经 Git LFS 存储520000 表示训练 52 万步后的 checkpointconfig.yaml模型配置DiT 主干 dim1408、depth28、heads2416kHz、80 维 mel 谱vocab.txt文本词表自定义 tokenizer 使用的字符词表README.md项目文档官方模型介绍、Benchmark 对比表、试听 Demo从config.yaml可以确认关键信息模型名1B、backbone 为DiT、音频采样率 16000Hz声码器使用本地 HiFi-GANspeechbrain 的 tts-hifigan-libritts-16kHz。三、部署前置3 个必备条件开始下载前先确认你的环境满足以下要求GPU 显存1B 参数模型建议 8GB 以上显存推理推荐 12GB 更从容磁盘空间预留20GB 以上权重 16.7GB 依赖环境基础工具Python 3.10、PyTorch带 CUDA 版本、git-lfs模型文件通过 LFS 托管必须安装。# 检查 Git LFS 是否安装 git lfs version # 未安装则执行 git lfs install四、最快下载方式4 步把模型拉到本地本仓库为 Hugging Face 镜像使用 git clone 即可完整获取无需额外注册。# 1. 克隆模型仓库 git clone https://gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1B # 2. 进入目录 cd Raon-OpenTTS-1B # 3. 确认大文件已完整拉取应显示 16GB 左右而非 136 字节的 LFS 指针 ls -lh model_520000.pt # 4. 若只拉到指针文件手动补拉 git lfs pull⚠️新手常见坑如果model_520000.pt只有 136 字节说明 Git LFS 未生效执行git lfs install git lfs pull即可修复。推理代码不在本模型仓库中需另行获取 KRAFTON AI 官方的Raon-OpenTTS 推理代码库见模型仓库 README 中的 Inference 章节指引加载model_520000.ptconfig.yamlvocab.txt三件套即可合成语音。五、零样本 TTS 推理流程速览理解合成流程能帮你更快排查问题输入文本 参考音频prompt │ ▼ DiT 扩散 Transformerflow matching 以参考音频的 mel 谱为条件生成目标 mel 谱 │ ▼ HiFi-GAN 声码器 │ ▼ 输出 16kHz 波形.wav获得自然音色的 3 个小技巧 参考音频选干净、无背景音乐的 3~10 秒片段克隆相似度最高️ 参考音频的情绪和语速会传染给生成结果想要沉稳播报就选沉稳的参考 目前该版本为英文模型训练数据为 11 个英文语音数据集中文文本合成效果不在设计范围内。六、新手常见问题 FAQQ1文件名里的 520000 是什么意思是训练更新步数520K steps。官方在 48 张 NVIDIA B200 GPU 上用 51 万小时数据训练了 52 万步这个文件就是最终 checkpoint。Q2可以商用吗注意许可证为CC BY-NC 4.0仅限非商业用途。商业落地需另行评估版权。Q3还有更小的版本吗有。官方同时发布了Raon-OpenTTS-0.3B轻量版Seed-TTS-Eval WER 1.95%对显存有限的新手更友好可在同一组织下找到。总结Raon-OpenTTS-1B 是目前开源零样本 TTS 的第一梯队模型1B 参数、全开源、效果对标闭源 SOTA部署路径极简git lfs install→ 克隆仓库 →git lfs pull10 分钟即可完成本地模型部署推理只需三件套model_520000.ptconfig.yamlvocab.txt配一段几秒的参考音频即可克隆音色记住许可证边界非商用免费商用需另行授权。现在就可以克隆一段你喜欢的声音生成第一句语音了 【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考