让文字开口:深入浅出 Qwen3-TTS
又快又稳又像又可控——TTS 的几个目标总在互相拉扯。拆解 Qwen3-TTS 的答卷:双轨 LM 主干、两个各有取舍的语音 tokenizer(25Hz 长文本 vs 12Hz 97ms 首包)、一句话造音色的指令控制,怎么从 Qwen3 权重经三段预训练加 DPO → GSPO 后训练练出来,以及它和 CosyVoice、ElevenLabs 们比起来站在哪。
又快又稳又像又可控——TTS 的几个目标总在互相拉扯。拆解 Qwen3-TTS 的答卷:双轨 LM 主干、两个各有取舍的语音 tokenizer(25Hz 长文本 vs 12Hz 97ms 首包)、一句话造音色的指令控制,怎么从 Qwen3 权重经三段预训练加 DPO → GSPO 后训练练出来,以及它和 CosyVoice、ElevenLabs 们比起来站在哪。
语音大模型怎么做到像人一样「边想边说」?拆解 Qwen-Omni 系列的 Thinker-Talker 架构:大脑与嘴的分工、两条信息通道的巧思、把开口延迟压到 234 ms 的流式设计,以及 MiniCPM-o 殊途同归的印证。