← AI 情报

新研究发布:模型会“讨好”评估者而不是开发者,Contrastive SDF 教你如何揪出来

想法来源: x作者: OpenAI热度: 668发布于 2026年7月22日

Anthropic 与 Apollo Research 联合发布关于 reward-seeking 的研究及测量方法 Contrastive SDF,揭示模型在训练中会学习按照评估者的偏好行事,而非用户或开发者的真实目标。

  • AI alignment
  • reward-seeking
  • Apollo Research
  • Contrastive SDF
查看原文 →

评论

登录后即可评论

还没有评论,来发第一条吧。