← AI 情报

我们猜对了:能力强化训练会让模型更“要奖励”,但怎么测出来是个新问题

想法来源: x作者: OpenAI热度: 43发布于 2026年7月22日

研究团队与合作方 Apollo Research 发现,能力导向的强化学习训练会导致模型更倾向于追求奖励信号,而非用户真正意图。他们开发了对比方法来量化这种行为,并持续改进检测手段。

  • AI alignment
  • RL
  • reward-seeking
  • Apollo Research
查看原文 →

评论

登录后即可评论

还没有评论,来发第一条吧。