这里是 Jiaqi 的博客,记录技术、笔记与想法。
看过答案的自己教没看过答案的自己:深入浅出 OPSD 在线自蒸馏
做错题后翻答案复盘,是最常见的学习方式;OPSD 把它搬进 LLM:同一个模型,看过参考解的当老师、没看过的当学生,老师在学生自己写的每个 token 上逐字批注。不需要外部大模型,不需要奖励函数,1024 token 的短采样追平 8 × 16k 的 GRPO。这篇拆开它的目标函数、两个稳定器和策略梯度视角,带数字算一遍裁剪到底裁掉了什么,也聊聊后来者的质疑。
你的 LLM 偷偷是个全双工预测器:双拆 SALMONN-omni 与 Covo-Audio
Moshi 开创的「codec 进词表」路线有一笔绕不开的智能税:语音 token 挤占词表、模态鸿沟吞噬文本知识。2025–2026 年的两个回应殊途同归——清华与字节的 SALMONN-omni 把 codec 彻底请出 LLM,用连续嵌入直连编码器与合成器;腾讯的 Covo-Audio 折中为「连续进、离散出」的混合双流,把全双工塞进预训练。两家还共享同一个信条:状态切换不需要外挂模块,、、BREAK——你的 LLM 偷偷就是个全双工预测器。这篇一次拆两个。
不改模型,改数据:深入拆解 OmniFlatten
Moshi 为全双工改了架构——双 Transformer、声学延迟、17 条并行流;阿里通义实验室的 OmniFlatten 反其道而行:标准 GPT 一行不改,把用户和助手的语音、文字全部摊平进一条序列,用「模态对齐 → 半双工 → 全双工三流 → 两流」四步课程渐进逼近全双工。0.5B 的 Qwen2 底座、全合成的对话数据、块级交错的伪并行——这篇拆解它的每一步取舍,包括那个诚实的负结果:去掉文字流,语义就崩。
把「被打断」做成一个 token:深入拆解 LSLM
与 Moshi 几乎同时,上海交大 X-LANCE 与字节跳动的 LSLM 用一个 106M 参数的小模型回答了一个最小问题:模型能不能一边说话一边听?说话通道是单码本的 token TTS,听觉通道是流式 SSL 的连续嵌入,词表里加一个 IRQ token 表示「我被打断了」。三种融合位置的对比给出干净结论:early 毁掉语音生成、late 分不清噪声与人声、middle 恰到好处——这篇把这个全双工的解剖标本拆开讲透。
一直在听,也一直在说:深入拆解 Moshi
Kyutai 的 Moshi 是第一个真正实时的全双工语音大模型:Mimi 把声音压成 12.5 Hz 的离散 token,RQ-Transformer 用一大一小两个 Transformer 分担时间与深度,Inner Monologue 让模型先想文字再发声,多流建模直接取消了「轮次」概念,理论时延 160 毫秒。这篇顺着论文和开源代码把每个部件拆开讲透,再看它如何只改一个延迟参数就变身流式 ASR 与 TTS。
不是「能被打断」就算全双工:三张地图读懂语音对话系统
十几个语音对话系统都自称「全双工」,能力却天差地别。这篇 2026 年的综述给出三张地图:双工决策在模型栈哪一层做(L0–L3)、该支持哪些交互(T×I×R 六个试金石)、每一刻系统在干什么(五状态决策状态机),外加数据与评测两笔实证账——从此「是不是全双工」有了结构化的问法。
让 Agent 一边说话,一边干活:深入拆解 qwen-audio-agent
语音助手为什么一调用工具就沉默?qwen-audio-agent 的答案不是再造一个更大的端到端模型,而是把「实时对话」和「后台干活」拆成两条并行流水线:前台 Qwen Audio Realtime 只管听和说,后台任意 ACP Agent 负责执行,中间用 Work 状态机、权限中转和送达确认把两边缝回「同一个助理」。本文基于 0.9.1 源码逐层拆解。
不是算得慢,是搬得慢:深入浅出 FlashAttention 四代
注意力真正的瓶颈不是 O(N²) 的计算量,而是中间矩阵在显存里的来回搬运。从 FA1 的 IO 感知、FA2 的并行重构、FA3 的异步流水与 FP8,到 FA4 应对「不对称扩展」的协同设计——四代 FlashAttention 就是一部算法追着硬件跑的历史。
把 90 分钟会议塞进一次生成:深入浅出 MOSS Transcribe Diarize
会议转写不只是听清每句话,还要回答谁在何时说了什么。MOSS Transcribe Diarize 用一条 128k 上下文的自回归序列同时生成文字、说话人和时间戳,并以真实录音与可控模拟对话训练。本文拆解它的任务立意、0.9B 开源架构、时间标尺、数据模拟、三项指标与四组实验,也辨清论文尚未测到的时间戳精度。
从会思考、会用工具到会被评测:读懂 ReAct、Toolformer、AgentBench 与 AgentBoard
四篇论文串起 LLM Agent 的关键问题:ReAct 让推理与行动形成闭环,Toolformer 让模型自监督学习 API 调用,AgentBench 把 agent 放进八种环境考试,AgentBoard 再用进度率和轨迹诊断回答“究竟卡在哪里”。