你的 LLM 偷偷是个全双工预测器:双拆 SALMONN-omni 与 Covo-Audio

Moshi 开创的「codec 进词表」路线有一笔绕不开的智能税:语音 token 挤占词表、模态鸿沟吞噬文本知识。2025–2026 年的两个回应殊途同归——清华与字节的 SALMONN-omni 把 codec 彻底请出 LLM,用连续嵌入直连编码器与合成器;腾讯的 Covo-Audio 折中为「连续进、离散出」的混合双流,把全双工塞进预训练。两家还共享同一个信条:状态切换不需要外挂模块,、、BREAK——你的 LLM 偷偷就是个全双工预测器。这篇一次拆两个。

2026年8月2日 · 14 分钟 · 6719 字

不改模型,改数据:深入拆解 OmniFlatten

Moshi 为全双工改了架构——双 Transformer、声学延迟、17 条并行流;阿里通义实验室的 OmniFlatten 反其道而行:标准 GPT 一行不改,把用户和助手的语音、文字全部摊平进一条序列,用「模态对齐 → 半双工 → 全双工三流 → 两流」四步课程渐进逼近全双工。0.5B 的 Qwen2 底座、全合成的对话数据、块级交错的伪并行——这篇拆解它的每一步取舍,包括那个诚实的负结果:去掉文字流,语义就崩。

2026年8月2日 · 11 分钟 · 5444 字

把「被打断」做成一个 token:深入拆解 LSLM

与 Moshi 几乎同时,上海交大 X-LANCE 与字节跳动的 LSLM 用一个 106M 参数的小模型回答了一个最小问题:模型能不能一边说话一边听?说话通道是单码本的 token TTS,听觉通道是流式 SSL 的连续嵌入,词表里加一个 IRQ token 表示「我被打断了」。三种融合位置的对比给出干净结论:early 毁掉语音生成、late 分不清噪声与人声、middle 恰到好处——这篇把这个全双工的解剖标本拆开讲透。

2026年8月2日 · 10 分钟 · 4759 字

一直在听,也一直在说:深入拆解 Moshi

Kyutai 的 Moshi 是第一个真正实时的全双工语音大模型:Mimi 把声音压成 12.5 Hz 的离散 token,RQ-Transformer 用一大一小两个 Transformer 分担时间与深度,Inner Monologue 让模型先想文字再发声,多流建模直接取消了「轮次」概念,理论时延 160 毫秒。这篇顺着论文和开源代码把每个部件拆开讲透,再看它如何只改一个延迟参数就变身流式 ASR 与 TTS。

2026年8月2日 · 17 分钟 · 8384 字

不是「能被打断」就算全双工:三张地图读懂语音对话系统

十几个语音对话系统都自称「全双工」,能力却天差地别。这篇 2026 年的综述给出三张地图:双工决策在模型栈哪一层做(L0–L3)、该支持哪些交互(T×I×R 六个试金石)、每一刻系统在干什么(五状态决策状态机),外加数据与评测两笔实证账——从此「是不是全双工」有了结构化的问法。

2026年7月31日 · 30 分钟 · 14557 字

让 Agent 一边说话,一边干活:深入拆解 qwen-audio-agent

语音助手为什么一调用工具就沉默?qwen-audio-agent 的答案不是再造一个更大的端到端模型,而是把「实时对话」和「后台干活」拆成两条并行流水线:前台 Qwen Audio Realtime 只管听和说,后台任意 ACP Agent 负责执行,中间用 Work 状态机、权限中转和送达确认把两边缝回「同一个助理」。本文基于 0.9.1 源码逐层拆解。

2026年7月29日 · 28 分钟 · 13993 字

把 90 分钟会议塞进一次生成:深入浅出 MOSS Transcribe Diarize

会议转写不只是听清每句话,还要回答谁在何时说了什么。MOSS Transcribe Diarize 用一条 128k 上下文的自回归序列同时生成文字、说话人和时间戳,并以真实录音与可控模拟对话训练。本文拆解它的任务立意、0.9B 开源架构、时间标尺、数据模拟、三项指标与四组实验,也辨清论文尚未测到的时间戳精度。

2026年7月20日 · 16 分钟 · 7665 字

一个声码器走天下:深入浅出 BigVGAN

TTS 的最后一公里——把 mel 频谱还原成波形——藏着两个物理问题:声音天生周期,而神经网络的激活函数不懂周期;非线性天生产生高频,而数字信号里超标的高频会折回来变成杂音。拆解 NVIDIA BigVGAN 怎么用 Snake 激活+抗混叠滤波把这两件事做对,112M 大 GAN 训练踩过的坑,以及 v2 换 CQT 判别器、多尺度 mel 损失、CUDA 融合算子后的完全体。

2026年7月17日 · 18 分钟 · 8721 字

当造币厂也开始 scaling:深入浅出 MOSS-Audio-Tokenizer

OpenMOSS 把音频 tokenizer 当成大模型来训:纯 Transformer 的 CAT 架构、16 亿参数、300 万小时音频、六项损失端到端一锅端,12.5Hz 帧率下 0.125–4kbps 随意切换,顺手做出第一个打赢非自回归与级联系统的纯自回归 TTS。这篇忠实拆解它的结构细节、训练配方与三组 scaling 实验。

2026年7月17日 · 16 分钟 · 7967 字

给声音造一张词表:深入浅出语音 tokenizer

语音 token 是 TTS 的地基,却常被一笔带过。这篇拆开这台『造币厂』:语义 vs 声学的根本矛盾、VQ/RVQ/FSQ 三种量化、把语义塞进第 0 个码本的关键一招,以及『更低帧率、更少码本』的新潮流——从 EnCodec、SpeechTokenizer、Mimi、CosyVoice、X-Codec2 一路看到 Qwen3-TTS 的两个 tokenizer。

2026年7月15日 · 27 分钟 · 13224 字