On-policy 蒸馏并非免费午餐:四种常见失败模式详解
讨论来源: x作者: BhavinJawade热度: 137发布于 2026年7月22日
本文系统分析了 on-policy distillation(OPD)和 on-policy self-distillation(OPSD)的四种失败模式:早期错误不可纠正、更强教师反成更差教师、特权信息条件化OPSD难以迁移、以及思考崩溃。并提出了改进方向如TRD、教师选择基于分布接近性而非排行榜等。
- 后训练
- 模型蒸馏
- On-Policy Distillation
- 失败模式
评论
登录后即可评论
还没有评论,来发第一条吧。