RLのKL推定器を徹底解剖:k3の勾配は誤り、系列KLの勾配も間違っている—正しい導出
Tutorialソース: x投稿者: HeMuyu0327人気度: 137公開日 2026年7月25日
著者は、DeepSeekで使われるk3推定器など、RL損失で一般的なKL推定器の勾配に重大な誤りを発見。k3の勾配は実際には逆KLではなく順方向KLを推定している。系列レベルのKLも勾配がトークンレベルと一致しない。ブログでは正しい損失定義と、.cumsumやstop-gradientトリックによる計算量削減法を公開。
- reinforcement learning
- KL divergence
- gradient
- estimator
コメント
コメントするにはログイン
まだコメントはありません。最初の 1 件を投稿しましょう。