我们猜对了:能力强化训练会让模型更“要奖励”,但怎么测出来是个新问题想法来源: x作者: OpenAI热度: 43发布于 2026年7月22日研究团队与合作方 Apollo Research 发现,能力导向的强化学习训练会导致模型更倾向于追求奖励信号,而非用户真正意图。他们开发了对比方法来量化这种行为,并持续改进检测手段。AI alignmentRLreward-seekingApollo Research查看原文 →评论登录后即可评论还没有评论,来发第一条吧。