公司动态
开源 AI 语音代理管线:HuggingFace 的 speech-to-speech 上手指南
一句话一行命令启动本地语音 AgentVAD→STT→LLM→TTS 四件套全开源可替换。这个项目解决什么问题想用开源方案做一个能聊天的语音 Agent以前你需要分别搭 STT、LLM 推理、TTS还要自己写 WebSocket 协议处理语音流转。HuggingFace 的 speech-to-speech 把这套流程打包成了一个完整的、低延迟的语音代理管线——pip install然后一行命令启动。核心特点全链路开源VAD、STT、LLM、TTS 四个环节都有多个可替换后端OpenAI Realtime 协议兼容任何支持 Realtime API 的客户端都能直接接入本地优先LLM 可以用自部署的 llama.cpp/vLLM语音合成也有本地模型已投入生产几千台 Reachy Mini 机器人正在用它做对话后端核心亮点四段式管线每段可插拔管线由四个阶段组成各自独立线程运行通过队列连接VAD语音活动检测使用 Silero VAD v5 检测语音边界和说话人切换。STT语音转文字默认用 Parakeet TDTNVIDIA 出品支持 CUDA/CPU/Apple Silicon。备选有 Whisper、Faster Whisper、ParaformerFunASR 出品。LLM语言模型支持 OpenAI 兼容 APIresponses-api/chat-completions也能接本地 Transformers 模型或 mlx-lmApple Silicon。TTS文字转语音默认 Qwen3-TTS支持 GGML/CUDA/macOS mlx-audio。备选有 Kokoro-82M、Pocket TTS、ChatTTS、MMS TTS。一键启动pipinstallspeech-to-speechexportOPENAI_API_KEYyour_key speech-to-speech这就在ws://localhost:8765/v1/realtime启动了服务。本地 LLM 场景# 启动 Gemma 4llama-server-hfggml-org/gemma-4-E4B-it-GGUF-np2-c65536-faon --swa-full# 指向本地 LLMspeech-to-speech\--model_nameggml-org/gemma-4-E4B-it-GGUF\--responses_api_base_urlhttp://127.0.0.1:8080/v1\--responses_api_api_key支持的多后端组件后端选项平台VADSilero VAD v5全平台STTParakeet TDT / Whisper / Faster Whisper / ParaformerCUDA/CPU/Apple SiliconLLMOpenAI API / Transformers / mlx-lm全平台TTSQwen3-TTS / Kokoro-82M / Pocket TTS / ChatTTS / MMS TTSCUDA/CPU/Apple Silicon快速上手安装pipinstallspeech-to-speech需要特定后端时安装对应 extraspipinstallspeech-to-speech[kokoro]# Kokoro-82M TTSpipinstallspeech-to-speech[pocket]# Pocket TTSpipinstallspeech-to-speech[faster-whisper]启动服务后用脚本测试python scripts/listen_and_play_realtime.py--host127.0.0.1--port8765Linux CUDA 用户需要安装对应 wheel# CUDA 13.xpipinstallqwentts-cpp-python0.3.1cu130\-fhttps://huggingface.co/datasets/andito/qwentts-cpp-python-wheels/tree/main/whl/cu130# CUDA 12.4pipinstallqwentts-cpp-python0.3.1cu124\-fhttps://huggingface.co/datasets/andito/qwentts-cpp-python-wheels/tree/main/whl/cu124我的评价优点四段式架构设计优雅每段可独立替换不锁死某家模型默认配置开箱即用Parakeet TDT Qwen3-TTS 效果不错生产验证——几千台机器人跑着它不是 demo 级项目协议兼容 OpenAI Realtime接入成本低缺点中文支持依赖 Paraformer需额外安装默认 STT 偏英文优化Linux CUDA wheel 安装比较折腾版本匹配容易出问题DeepFilterNet 与 Pocket TTS 有 numpy 版本冲突需要注意依赖管理对比类似项目有 OpenAI Realtime API闭源/付费、ElevenLabs Conversational AI闭源/按量计费、Whisper gTTS 手动组合免费但复杂。speech-to-speech 的优势是完整开源、可本地化、成本可控。适合谁需要做本地语音 Agent 的开发者机器人、智能家居、车载不想依赖闭源 API 的团队对延迟有要求的生产场景已在生产验证✅ 已验证基于官方 GitHub 仓库文档 来源huggingface/speech-to-speech README 推断中文适配需额外安装 Paraformer 后端