一个声码器走天下:深入浅出 BigVGAN
TTS 的最后一公里——把 mel 频谱还原成波形——藏着两个物理问题:声音天生周期,而神经网络的激活函数不懂周期;非线性天生产生高频,而数字信号里超标的高频会折回来变成杂音。拆解 NVIDIA BigVGAN 怎么用 Snake 激活+抗混叠滤波把这两件事做对,112M 大 GAN 训练踩过的坑,以及 v2 换 CQT 判别器、多尺度 mel 损失、CUDA 融合算子后的完全体。
TTS 的最后一公里——把 mel 频谱还原成波形——藏着两个物理问题:声音天生周期,而神经网络的激活函数不懂周期;非线性天生产生高频,而数字信号里超标的高频会折回来变成杂音。拆解 NVIDIA BigVGAN 怎么用 Snake 激活+抗混叠滤波把这两件事做对,112M 大 GAN 训练踩过的坑,以及 v2 换 CQT 判别器、多尺度 mel 损失、CUDA 融合算子后的完全体。
OpenMOSS 把音频 tokenizer 当成大模型来训:纯 Transformer 的 CAT 架构、16 亿参数、300 万小时音频、六项损失端到端一锅端,12.5Hz 帧率下 0.125–4kbps 随意切换,顺手做出第一个打赢非自回归与级联系统的纯自回归 TTS。这篇忠实拆解它的结构细节、训练配方与三组 scaling 实验。
语音 token 是 TTS 的地基,却常被一笔带过。这篇拆开这台『造币厂』:语义 vs 声学的根本矛盾、VQ/RVQ/FSQ 三种量化、把语义塞进第 0 个码本的关键一招,以及『更低帧率、更少码本』的新潮流——从 EnCodec、SpeechTokenizer、Mimi、CosyVoice、X-Codec2 一路看到 Qwen3-TTS 的两个 tokenizer。
又快又稳又像又可控——TTS 的几个目标总在互相拉扯。拆解 Qwen3-TTS 的答卷:双轨 LM 主干、两个各有取舍的语音 tokenizer(25Hz 长文本 vs 12Hz 97ms 首包)、一句话造音色的指令控制,怎么从 Qwen3 权重经三段预训练加 DPO → GSPO 后训练练出来,以及它和 CosyVoice、ElevenLabs 们比起来站在哪。