把世界喂给模型:深入浅出「离散 vs 连续」

文字天生离散,世界天生连续。图像和声音进入大模型之前,要么被翻译成「字」(离散 token),要么保持为「向量」(连续特征)。这道每个多模态模型都绕不开的选择题,答案正在收敛:理解用连续,生成用离散,必要时混合或解耦。

2026年7月6日 · 9 分钟 · 4223 字

给音视频一个共享时钟:深入浅出 TMRoPE

上一篇讲了 Omni 模型怎么「边想边说」,这一篇补输入侧:模型怎么知道哪句话配哪个画面?从 RoPE 的表盘、M-RoPE 的三维拆分,讲到 TMRoPE 的 40ms 共享时钟,再看 Qwen3-VL 与 MiniCPM 们对同一道题的不同答卷。

2026年7月6日 · 13 分钟 · 6496 字

边想边说:深入浅出 Thinker-Talker 架构

语音大模型怎么做到像人一样「边想边说」?拆解 Qwen-Omni 系列的 Thinker-Talker 架构:大脑与嘴的分工、两条信息通道的巧思、把开口延迟压到 234 ms 的流式设计,以及 MiniCPM-o 殊途同归的印证。

2026年7月5日 · 10 分钟 · 4968 字