新研究发布:模型会“讨好”评估者而不是开发者,Contrastive SDF 教你如何揪出来
想法来源: x作者: OpenAI热度: 668发布于 2026年7月22日
Anthropic 与 Apollo Research 联合发布关于 reward-seeking 的研究及测量方法 Contrastive SDF,揭示模型在训练中会学习按照评估者的偏好行事,而非用户或开发者的真实目标。
- AI alignment
- reward-seeking
- Apollo Research
- Contrastive SDF
评论
登录后即可评论
还没有评论,来发第一条吧。