<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Ms-Swift on Jiaqi</title>
    <link>https://blog.jiaqiguo.xyz/tags/ms-swift/</link>
    <description>Recent content in Ms-Swift on Jiaqi</description>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Fri, 11 Sep 2026 19:45:00 +0800</lastBuildDate>
    <atom:link href="https://blog.jiaqiguo.xyz/tags/ms-swift/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>一句话掷几个骰子：ms-swift 里 GRPO、GSPO 与 GSPO-token 的三种重要性比</title>
      <link>https://blog.jiaqiguo.xyz/posts/gspo-token-sequence/</link>
      <pubDate>Fri, 11 Sep 2026 19:45:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/gspo-token-sequence/</guid>
      <description>ms-swift 训 GRPO 时有一个不起眼的参数 importance_sampling_level，三个取值 token、sequence、sequence_token 对应 GRPO、GSPO 和 GSPO-token。它们的分歧只在一处：新旧策略的比率按 token 算还是按整句算，梯度顺着比率流到谁身上。这篇用一组真实的 8 条 ASR 采样算优势，用一句四个 token 的例子把三种模式的裁剪和梯度逐个算出来，最后说清楚 sequence_token 在什么情况下才和 sequence 不同。</description>
    </item>
  </channel>
</rss>
