<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>论文解读 on Jiaqi</title>
    <link>https://blog.jiaqiguo.xyz/tags/%E8%AE%BA%E6%96%87%E8%A7%A3%E8%AF%BB/</link>
    <description>Recent content in 论文解读 on Jiaqi</description>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Sun, 02 Aug 2026 16:20:00 +0800</lastBuildDate>
    <atom:link href="https://blog.jiaqiguo.xyz/tags/%E8%AE%BA%E6%96%87%E8%A7%A3%E8%AF%BB/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>你的 LLM 偷偷是个全双工预测器：双拆 SALMONN-omni 与 Covo-Audio</title>
      <link>https://blog.jiaqiguo.xyz/posts/salmonn-covo/</link>
      <pubDate>Sun, 02 Aug 2026 16:20:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/salmonn-covo/</guid>
      <description>Moshi 开创的「codec 进词表」路线有一笔绕不开的智能税：语音 token 挤占词表、模态鸿沟吞噬文本知识。2025–2026 年的两个回应殊途同归——清华与字节的 SALMONN-omni 把 codec 彻底请出 LLM，用连续嵌入直连编码器与合成器；腾讯的 Covo-Audio 折中为「连续进、离散出」的混合双流，把全双工塞进预训练。两家还共享同一个信条：状态切换不需要外挂模块，&lt;think&gt;、&lt;shift&gt;、BREAK——你的 LLM 偷偷就是个全双工预测器。这篇一次拆两个。</description>
    </item>
    <item>
      <title>不改模型，改数据：深入拆解 OmniFlatten</title>
      <link>https://blog.jiaqiguo.xyz/posts/omniflatten/</link>
      <pubDate>Sun, 02 Aug 2026 16:05:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/omniflatten/</guid>
      <description>Moshi 为全双工改了架构——双 Transformer、声学延迟、17 条并行流；阿里通义实验室的 OmniFlatten 反其道而行：标准 GPT 一行不改，把用户和助手的语音、文字全部摊平进一条序列，用「模态对齐 → 半双工 → 全双工三流 → 两流」四步课程渐进逼近全双工。0.5B 的 Qwen2 底座、全合成的对话数据、块级交错的伪并行——这篇拆解它的每一步取舍，包括那个诚实的负结果：去掉文字流，语义就崩。</description>
    </item>
    <item>
      <title>把「被打断」做成一个 token：深入拆解 LSLM</title>
      <link>https://blog.jiaqiguo.xyz/posts/lslm/</link>
      <pubDate>Sun, 02 Aug 2026 15:50:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/lslm/</guid>
      <description>与 Moshi 几乎同时，上海交大 X-LANCE 与字节跳动的 LSLM 用一个 106M 参数的小模型回答了一个最小问题：模型能不能一边说话一边听？说话通道是单码本的 token TTS，听觉通道是流式 SSL 的连续嵌入，词表里加一个 IRQ token 表示「我被打断了」。三种融合位置的对比给出干净结论：early 毁掉语音生成、late 分不清噪声与人声、middle 恰到好处——这篇把这个全双工的解剖标本拆开讲透。</description>
    </item>
    <item>
      <title>一直在听，也一直在说：深入拆解 Moshi</title>
      <link>https://blog.jiaqiguo.xyz/posts/moshi/</link>
      <pubDate>Sun, 02 Aug 2026 15:30:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/moshi/</guid>
      <description>Kyutai 的 Moshi 是第一个真正实时的全双工语音大模型：Mimi 把声音压成 12.5 Hz 的离散 token，RQ-Transformer 用一大一小两个 Transformer 分担时间与深度，Inner Monologue 让模型先想文字再发声，多流建模直接取消了「轮次」概念，理论时延 160 毫秒。这篇顺着论文和开源代码把每个部件拆开讲透，再看它如何只改一个延迟参数就变身流式 ASR 与 TTS。</description>
    </item>
    <item>
      <title>不是「能被打断」就算全双工：三张地图读懂语音对话系统</title>
      <link>https://blog.jiaqiguo.xyz/posts/full-duplex-sds/</link>
      <pubDate>Fri, 31 Jul 2026 15:00:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/full-duplex-sds/</guid>
      <description>十几个语音对话系统都自称「全双工」，能力却天差地别。这篇 2026 年的综述给出三张地图：双工决策在模型栈哪一层做（L0–L3）、该支持哪些交互（T×I×R 六个试金石）、每一刻系统在干什么（五状态决策状态机），外加数据与评测两笔实证账——从此「是不是全双工」有了结构化的问法。</description>
    </item>
    <item>
      <title>把 90 分钟会议塞进一次生成：深入浅出 MOSS Transcribe Diarize</title>
      <link>https://blog.jiaqiguo.xyz/posts/moss-transcribe-diarize/</link>
      <pubDate>Mon, 20 Jul 2026 17:00:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/moss-transcribe-diarize/</guid>
      <description>会议转写不只是听清每句话，还要回答谁在何时说了什么。MOSS Transcribe Diarize 用一条 128k 上下文的自回归序列同时生成文字、说话人和时间戳，并以真实录音与可控模拟对话训练。本文拆解它的任务立意、0.9B 开源架构、时间标尺、数据模拟、三项指标与四组实验，也辨清论文尚未测到的时间戳精度。</description>
    </item>
    <item>
      <title>从会思考、会用工具到会被评测：读懂 ReAct、Toolformer、AgentBench 与 AgentBoard</title>
      <link>https://blog.jiaqiguo.xyz/posts/llm-agent-four-papers/</link>
      <pubDate>Sun, 19 Jul 2026 18:30:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/llm-agent-four-papers/</guid>
      <description>四篇论文串起 LLM Agent 的关键问题：ReAct 让推理与行动形成闭环，Toolformer 让模型自监督学习 API 调用，AgentBench 把 agent 放进八种环境考试，AgentBoard 再用进度率和轨迹诊断回答“究竟卡在哪里”。</description>
    </item>
  </channel>
</rss>
