看过答案的自己教没看过答案的自己:深入浅出 OPSD 在线自蒸馏

做错题后翻答案复盘,是最常见的学习方式;OPSD 把它搬进 LLM:同一个模型,看过参考解的当老师、没看过的当学生,老师在学生自己写的每个 token 上逐字批注。不需要外部大模型,不需要奖励函数,1024 token 的短采样追平 8 × 16k 的 GRPO。这篇拆开它的目标函数、两个稳定器和策略梯度视角,带数字算一遍裁剪到底裁掉了什么,也聊聊后来者的质疑。

2026年9月4日 · 18 分钟 · 8965 字