<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>开源模型 on Jiaqi</title>
    <link>https://blog.jiaqiguo.xyz/tags/%E5%BC%80%E6%BA%90%E6%A8%A1%E5%9E%8B/</link>
    <description>Recent content in 开源模型 on Jiaqi</description>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Tue, 18 Aug 2026 16:00:00 +0800</lastBuildDate>
    <atom:link href="https://blog.jiaqiguo.xyz/tags/%E5%BC%80%E6%BA%90%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>「稍等，我查一下」：深入拆解会调工具的全双工模型 NemotronLabs VoiceChat</title>
      <link>https://blog.jiaqiguo.xyz/posts/nemotron-voicechat/</link>
      <pubDate>Tue, 18 Aug 2026 16:00:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/nemotron-voicechat/</guid>
      <description>全双工语音模型聊天越来越顺，但都不会「办事」：工具调用是暂停—等待—恢复，而全双工的世界没有暂停键。NVIDIA 的 NemotronLabs VoiceChat 11B 是第一个支持工具调用的开源全双工模型：流式编码器加 9B Nemotron Nano v2 加帧同步 TTS，四条通道踩着 80 毫秒的节拍并行推进，第四条通道专门吐 TOOLCALL，等待 API 返回时 agent 还能说一句「稍等，我查一下」。这篇从模型架构、打断机制一路拆到 Triton 加双 vLLM 的推理容器，看全双工怎么从 demo 走向能干活的语音 agent。</description>
    </item>
    <item>
      <title>停顿不等于说完：拆解 8 MB 的开源判停模型 Smart Turn</title>
      <link>https://blog.jiaqiguo.xyz/posts/smart-turn/</link>
      <pubDate>Thu, 06 Aug 2026 09:00:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/smart-turn/</guid>
      <description>语音 agent 抢话的根源，是它拿静音时长猜「你说完没」。Pipecat 的 Smart Turn 用一个 8 MB 的模型直接听音频做判断：Whisper Tiny 编码器 + 注意力池化 + 三层分类头，CPU 上十几毫秒出结果，权重、数据、训练代码全部开源。这篇拆它的架构、三代演进、合成数据流水线，以及它在 VAD 之上怎么组成双保险。</description>
    </item>
  </channel>
</rss>
