← AI ニュース

RLのKL推定器を徹底解剖:k3の勾配は誤り、系列KLの勾配も間違っている—正しい導出

Tutorialソース: x投稿者: HeMuyu0327人気度: 137公開日 2026年7月25日

著者は、DeepSeekで使われるk3推定器など、RL損失で一般的なKL推定器の勾配に重大な誤りを発見。k3の勾配は実際には逆KLではなく順方向KLを推定している。系列レベルのKLも勾配がトークンレベルと一致しない。ブログでは正しい損失定義と、.cumsumやstop-gradientトリックによる計算量削減法を公開。

  • reinforcement learning
  • KL divergence
  • gradient
  • estimator
ソースを見る →

コメント

コメントするにはログイン

まだコメントはありません。最初の 1 件を投稿しましょう。