【开源实时语音交互的“乐高”:Hugging Face 推出 Speech-to-Speech】Hugging Face 开源了一个模块化的实时语音对话流水线,将语音活动检测(VAD)、语音转文字(STT)、大语言模型(LLM)和文字转语音(TTS)深度整合。它兼容 OpenAI Realtime API 协议,支持全本地化部署,并已在 Reachy Mini 机器人上实测。这件事的核心价值不在于发明了新模型,而在于它把原本松散、高延迟的语音链路“工业化”了。开发者最缺的其实不是模型,而是能把 VAD 断句、流式响应和打断机制处理得像人一样自然的工程框架。它通过多线程队列和可插拔后端(如 Qwen3-TTS、Paraformer 等),让开发者能以极低成本搭建专属的语音助手,彻底绕过 OpenAI 每小时近 20 美元的昂贵 API 费用。虽然目前在 8kHz 电话音质和复杂环境下的表现仍需调优,但它标志着实时语音交互从“大厂特权”走向了“开发者自由”。github.com/huggingface/speech-to-speech

