← AI 情报

On-policy 蒸馏并非免费午餐:四种常见失败模式详解

讨论来源: x作者: BhavinJawade热度: 137发布于 2026年7月22日

本文系统分析了 on-policy distillation(OPD)和 on-policy self-distillation(OPSD)的四种失败模式:早期错误不可纠正、更强教师反成更差教师、特权信息条件化OPSD难以迁移、以及思考崩溃。并提出了改进方向如TRD、教师选择基于分布接近性而非排行榜等。

  • 后训练
  • 模型蒸馏
  • On-Policy Distillation
  • 失败模式
查看原文 →

评论

登录后即可评论

还没有评论,来发第一条吧。