一句话掷几个骰子:ms-swift 里 GRPO、GSPO 与 GSPO-token 的三种重要性比

ms-swift 训 GRPO 时有一个不起眼的参数 importance_sampling_level,三个取值 token、sequence、sequence_token 对应 GRPO、GSPO 和 GSPO-token。它们的分歧只在一处:新旧策略的比率按 token 算还是按整句算,梯度顺着比率流到谁身上。这篇用一组真实的 8 条 ASR 采样算优势,用一句四个 token 的例子把三种模式的裁剪和梯度逐个算出来,最后说清楚 sequence_token 在什么情况下才和 sequence 不同。

2026年9月11日 · 18 分钟 · 8725 字