「稍等,我查一下」:深入拆解会调工具的全双工模型 NemotronLabs VoiceChat

全双工语音模型聊天越来越顺,但都不会「办事」:工具调用是暂停—等待—恢复,而全双工的世界没有暂停键。NVIDIA 的 NemotronLabs VoiceChat 11B 是第一个支持工具调用的开源全双工模型:流式编码器加 9B Nemotron Nano v2 加帧同步 TTS,四条通道踩着 80 毫秒的节拍并行推进,第四条通道专门吐 TOOLCALL,等待 API 返回时 agent 还能说一句「稍等,我查一下」。这篇从模型架构、打断机制一路拆到 Triton 加双 vLLM 的推理容器,看全双工怎么从 demo 走向能干活的语音 agent。

2026年8月18日 · 18 分钟 · 8911 字

停顿不等于说完:拆解 8 MB 的开源判停模型 Smart Turn

语音 agent 抢话的根源,是它拿静音时长猜「你说完没」。Pipecat 的 Smart Turn 用一个 8 MB 的模型直接听音频做判断:Whisper Tiny 编码器 + 注意力池化 + 三层分类头,CPU 上十几毫秒出结果,权重、数据、训练代码全部开源。这篇拆它的架构、三代演进、合成数据流水线,以及它在 VAD 之上怎么组成双保险。

2026年8月6日 · 15 分钟 · 7131 字