你的 LLM 偷偷是个全双工预测器:双拆 SALMONN-omni 与 Covo-Audio

Moshi 开创的「codec 进词表」路线有一笔绕不开的智能税:语音 token 挤占词表、模态鸿沟吞噬文本知识。2025–2026 年的两个回应殊途同归——清华与字节的 SALMONN-omni 把 codec 彻底请出 LLM,用连续嵌入直连编码器与合成器;腾讯的 Covo-Audio 折中为「连续进、离散出」的混合双流,把全双工塞进预训练。两家还共享同一个信条:状态切换不需要外挂模块,、、BREAK——你的 LLM 偷偷就是个全双工预测器。这篇一次拆两个。

2026年8月2日 · 14 分钟 · 6719 字

不改模型,改数据:深入拆解 OmniFlatten

Moshi 为全双工改了架构——双 Transformer、声学延迟、17 条并行流;阿里通义实验室的 OmniFlatten 反其道而行:标准 GPT 一行不改,把用户和助手的语音、文字全部摊平进一条序列,用「模态对齐 → 半双工 → 全双工三流 → 两流」四步课程渐进逼近全双工。0.5B 的 Qwen2 底座、全合成的对话数据、块级交错的伪并行——这篇拆解它的每一步取舍,包括那个诚实的负结果:去掉文字流,语义就崩。

2026年8月2日 · 11 分钟 · 5444 字

把「被打断」做成一个 token:深入拆解 LSLM

与 Moshi 几乎同时,上海交大 X-LANCE 与字节跳动的 LSLM 用一个 106M 参数的小模型回答了一个最小问题:模型能不能一边说话一边听?说话通道是单码本的 token TTS,听觉通道是流式 SSL 的连续嵌入,词表里加一个 IRQ token 表示「我被打断了」。三种融合位置的对比给出干净结论:early 毁掉语音生成、late 分不清噪声与人声、middle 恰到好处——这篇把这个全双工的解剖标本拆开讲透。

2026年8月2日 · 10 分钟 · 4759 字

一直在听,也一直在说:深入拆解 Moshi

Kyutai 的 Moshi 是第一个真正实时的全双工语音大模型:Mimi 把声音压成 12.5 Hz 的离散 token,RQ-Transformer 用一大一小两个 Transformer 分担时间与深度,Inner Monologue 让模型先想文字再发声,多流建模直接取消了「轮次」概念,理论时延 160 毫秒。这篇顺着论文和开源代码把每个部件拆开讲透,再看它如何只改一个延迟参数就变身流式 ASR 与 TTS。

2026年8月2日 · 17 分钟 · 8384 字

不是「能被打断」就算全双工:三张地图读懂语音对话系统

十几个语音对话系统都自称「全双工」,能力却天差地别。这篇 2026 年的综述给出三张地图:双工决策在模型栈哪一层做(L0–L3)、该支持哪些交互(T×I×R 六个试金石)、每一刻系统在干什么(五状态决策状态机),外加数据与评测两笔实证账——从此「是不是全双工」有了结构化的问法。

2026年7月31日 · 30 分钟 · 14557 字