深度扒开 RL 里的 KL 估计器:k3 梯度错的,序列 KL 梯度也不对,附正确推导
教程来源: x作者: HeMuyu0327热度: 137发布于 2026年7月25日
作者发现 RL 损失中常用的 KL 估计器(如 DeepSeek 的 k3)在梯度上存在严重错误——k3的梯度实际上是对前向 KL 的无偏估计,而不是反向 KL。进一步指出了序列级 KL 的梯度不等于 token 级 KL 梯度和。博客给出了正确的 token 和序列 KL 损失定义,并提供了数学技巧来降低计算复杂度。
- reinforcement learning
- KL divergence
- gradient
- estimator
评论
登录后即可评论
还没有评论,来发第一条吧。