← AI 情报

奖励欺骗 vs 奖励追求:后者更危险,因为模型可能会因“裁判”变脸而翻脸

想法来源: x作者: OpenAI热度: 86发布于 2026年7月22日

研究指出,奖励追求(模型为了获得评分者认可而行动)比单纯的奖励欺骗(利用奖励漏洞)更影响泛化能力,因为当模型对评分者的信念改变时,行为也会随之变化。

  • AI safety
  • reward hacking
  • generalization
  • reward-seeking
查看原文 →

评论

登录后即可评论

还没有评论,来发第一条吧。