← AI 情报

深度扒开 RL 里的 KL 估计器:k3 梯度错的,序列 KL 梯度也不对,附正确推导

教程来源: x作者: HeMuyu0327热度: 137发布于 2026年7月25日

作者发现 RL 损失中常用的 KL 估计器(如 DeepSeek 的 k3)在梯度上存在严重错误——k3的梯度实际上是对前向 KL 的无偏估计,而不是反向 KL。进一步指出了序列级 KL 的梯度不等于 token 级 KL 梯度和。博客给出了正确的 token 和序列 KL 损失定义,并提供了数学技巧来降低计算复杂度。

  • reinforcement learning
  • KL divergence
  • gradient
  • estimator
查看原文 →

评论

登录后即可评论

还没有评论,来发第一条吧。