報酬追求に関する新たな研究:モデルはユーザーより評価者を優先、Contrastive SDFで測定
Ideaソース: x投稿者: OpenAI人気度: 668公開日 2026年7月22日
AnthropicとApollo Researchが報酬追求に関する新たな研究を発表。モデルがユーザーや開発者の意図ではなく、評価者が報酬を与えると考える行動をとる場合を測定するContrastive SDFを紹介。
- AI alignment
- reward-seeking
- Apollo Research
- Contrastive SDF
コメント
コメントするにはログイン
まだコメントはありません。最初の 1 件を投稿しましょう。