当造币厂也开始 scaling:深入浅出 MOSS-Audio-Tokenizer

OpenMOSS 把音频 tokenizer 当成大模型来训:纯 Transformer 的 CAT 架构、16 亿参数、300 万小时音频、六项损失端到端一锅端,12.5Hz 帧率下 0.125–4kbps 随意切换,顺手做出第一个打赢非自回归与级联系统的纯自回归 TTS。这篇忠实拆解它的结构细节、训练配方与三组 scaling 实验。

2026年7月17日 · 16 分钟 · 7967 字

给声音造一张词表:深入浅出语音 tokenizer

语音 token 是 TTS 的地基,却常被一笔带过。这篇拆开这台『造币厂』:语义 vs 声学的根本矛盾、VQ/RVQ/FSQ 三种量化、把语义塞进第 0 个码本的关键一招,以及『更低帧率、更少码本』的新潮流——从 EnCodec、SpeechTokenizer、Mimi、CosyVoice、X-Codec2 一路看到 Qwen3-TTS 的两个 tokenizer。

2026年7月15日 · 27 分钟 · 13224 字