On-Policy Distillation

导言

On-Policy Distillation(OPD)不是 top-k,也不等于 RL。它先让学生模型生成自己的轨迹,再让教师在学生实际到达的前缀上提供 token 分布,以减少训练与部署时的状态分布偏移。

OPD 能否生效,关键不是教师参数量是否更大,而是师生是否共享可比较的动作空间、思维模式是否兼容,以及教师是否真的提供了学生尚未掌握的知识。本文同时梳理 DeepSeek V4、Qwen3/Qwen3.5、Qwen3.5-Omni 的公开流程,以及 verl/verl-omni 的现有能力与缺口。

Read more