DC娱乐网

NVIDIA 发布了一个语音模型: NemotronLabs VoiceChat

NVIDIA 发布了一个语音模型: NemotronLabs VoiceChat 11B,一个 11B 端到端语音到语音模型,做实时全双工对话。

它不再把 ASR、LLM、TTS 三个模型串起来跑,用的是一个统一网络一次性完成流式语音理解和语音生成。少了多级编排和 API 之间的来回传递,端到端延迟直接下来了:在 Full-Duplex-Bench 1.0 上测到的平滑切换延迟是 448 毫秒。

用户可以在它说话中途插嘴,模型会让步 480 毫秒时的接管率(take-over rate)是 1.00。这一点对真实语音交互很关键,级联方案经常卡在现在到底谁在说话。

它是第一个支持工具调用的开放全双工模型,而且对话不中断:工具调用走一条独立输出通道,以块发出,你的代码返回 。妙处在 on-hold 消息 每个工具由运营方定义一句台词,模型一触发调用就立刻说,API 跑着的空隙对话不冷场。

每个会话最多 5 个工具、不能同时可靠调多个、工具执行期间用户不能打断;系统提示和工具响应必须 ASCII-only 且 TTS 友好。

硬件门槛:一张至少 80GB 显存的 GPU,A100、H100、RTX 6000 Pro 或 B200,x86_64 Linux。没有托管 API,也没有提供商。

架构上是混合 Mamba/Transformer,拼了 NVIDIA 三块现有组件加一条新输出通道:Fast Conformer 语音编码器(连续编码 16kHz 输入)、Nemotron Nano v2 当 LLM 主干、NVIDIA TTS 解码器渲染成 22.05kHz 代理语音;输出同时给代理音频、代理文本和实时用户转录。

比较适合联络中心、车载助手、免下车点餐、电信 IVR、游戏 NPC、无障碍工具,凡是想要可打断语音代理和实时查询助手的地方。权重在 Hugging Face 上发布,代码在 Github 上的 NeMo Speech 仓库。