StepAudio 3 系列拆解:声音怎样生成,模型怎样边听、边想、边说

从 Gen 的 RVQ 音频编码与时间—码本两级生成,到 Realtime 的全双工、边想边说和异步工具调用,拆解 StepAudio 3 系列的架构、训练方法与能力边界。

2026年9月15日 · 20 分钟 · 9834 字