一个声码器走天下:深入浅出 BigVGAN
TTS 的最后一公里——把 mel 频谱还原成波形——藏着两个物理问题:声音天生周期,而神经网络的激活函数不懂周期;非线性天生产生高频,而数字信号里超标的高频会折回来变成杂音。拆解 NVIDIA BigVGAN 怎么用 Snake 激活+抗混叠滤波把这两件事做对,112M 大 GAN 训练踩过的坑,以及 v2 换 CQT 判别器、多尺度 mel 损失、CUDA 融合算子后的完全体。
TTS 的最后一公里——把 mel 频谱还原成波形——藏着两个物理问题:声音天生周期,而神经网络的激活函数不懂周期;非线性天生产生高频,而数字信号里超标的高频会折回来变成杂音。拆解 NVIDIA BigVGAN 怎么用 Snake 激活+抗混叠滤波把这两件事做对,112M 大 GAN 训练踩过的坑,以及 v2 换 CQT 判别器、多尺度 mel 损失、CUDA 融合算子后的完全体。
OpenMOSS 把音频 tokenizer 当成大模型来训:纯 Transformer 的 CAT 架构、16 亿参数、300 万小时音频、六项损失端到端一锅端,12.5Hz 帧率下 0.125–4kbps 随意切换,顺手做出第一个打赢非自回归与级联系统的纯自回归 TTS。这篇忠实拆解它的结构细节、训练配方与三组 scaling 实验。
语音 token 是 TTS 的地基,却常被一笔带过。这篇拆开这台『造币厂』:语义 vs 声学的根本矛盾、VQ/RVQ/FSQ 三种量化、把语义塞进第 0 个码本的关键一招,以及『更低帧率、更少码本』的新潮流——从 EnCodec、SpeechTokenizer、Mimi、CosyVoice、X-Codec2 一路看到 Qwen3-TTS 的两个 tokenizer。
又快又稳又像又可控——TTS 的几个目标总在互相拉扯。拆解 Qwen3-TTS 的答卷:双轨 LM 主干、两个各有取舍的语音 tokenizer(25Hz 长文本 vs 12Hz 97ms 首包)、一句话造音色的指令控制,怎么从 Qwen3 权重经三段预训练加 DPO → GSPO 后训练练出来,以及它和 CosyVoice、ElevenLabs 们比起来站在哪。
在 HuggingFace 见过 xxx.Q4_K_M.gguf 吗?为什么 Ollama 拉一个名字就能在笔记本上跑大模型?拆开 GGUF:单文件的解剖结构、Q4_K_M 这串黑话的读法、块量化的账本,以及它和 vLLM、SGLang、两个 Triton 到底是什么关系。
预训练教模型说话,SFT 教模型听话,但「哪个回答更好」没有标准答案可抄——只能试错加打分。从 PPO 的四模型重装旅,到 DPO 的掀桌极简,再到 GRPO 砍掉裁判、GSPO 把单位对齐到整句:贯穿始终的其实是同一道题——整句的分,怎么摊给每个 token。
文字天生离散,世界天生连续。图像和声音进入大模型之前,要么被翻译成「字」(离散 token),要么保持为「向量」(连续特征)。这道每个多模态模型都绕不开的选择题,答案正在收敛:理解用连续,生成用离散,必要时混合或解耦。
上一篇讲了 Omni 模型怎么「边想边说」,这一篇补输入侧:模型怎么知道哪句话配哪个画面?从 RoPE 的表盘、M-RoPE 的三维拆分,讲到 TMRoPE 的 40ms 共享时钟,再看 Qwen3-VL 与 MiniCPM 们对同一道题的不同答卷。
语音大模型怎么做到像人一样「边想边说」?拆解 Qwen-Omni 系列的 Thinker-Talker 架构:大脑与嘴的分工、两条信息通道的巧思、把开口延迟压到 234 ms 的流式设计,以及 MiniCPM-o 殊途同归的印证。
博客开张:Hugo + PaperMod + Git,以及和 agent 协作写作的工作流。