看过答案的自己教没看过答案的自己:深入浅出 OPSD 在线自蒸馏
做错题后翻答案复盘,是最常见的学习方式;OPSD 把它搬进 LLM:同一个模型,看过参考解的当老师、没看过的当学生,老师在学生自己写的每个 token 上逐字批注。不需要外部大模型,不需要奖励函数,1024 token 的短采样追平 8 × 16k 的 GRPO。这篇拆开它的目标函数、两个稳定器和策略梯度视角,带数字算一遍裁剪到底裁掉了什么,也聊聊后来者的质疑。
做错题后翻答案复盘,是最常见的学习方式;OPSD 把它搬进 LLM:同一个模型,看过参考解的当老师、没看过的当学生,老师在学生自己写的每个 token 上逐字批注。不需要外部大模型,不需要奖励函数,1024 token 的短采样追平 8 × 16k 的 GRPO。这篇拆开它的目标函数、两个稳定器和策略梯度视角,带数字算一遍裁剪到底裁掉了什么,也聊聊后来者的质疑。
预训练教模型说话,SFT 教模型听话,但「哪个回答更好」没有标准答案可抄——只能试错加打分。从 PPO 的四模型重装旅,到 DPO 的掀桌极简,再到 GRPO 砍掉裁判、GSPO 把单位对齐到整句:贯穿始终的其实是同一道题——整句的分,怎么摊给每个 token。