← AI ニュース

On-policy蒸留は無料の昼食ではない:4つの失敗モードを解説

Discussionソース: x投稿者: BhavinJawade人気度: 137公開日 2026年7月22日

OPDとOPSDの4つの失敗モード(早期誤りの構造的修正不能、強い教師がむしろ悪い教師になる、特権情報条件付きOPSDの転移失敗、思考崩壊)を分析。TRDや分布近接性に基づく教師選択などの改善策を提案。

  • 后训练
  • 模型蒸馏
  • On-Policy Distillation
  • 失败模式
ソースを見る →

コメント

コメントするにはログイン

まだコメントはありません。最初の 1 件を投稿しましょう。