← AI ニュース

報酬追求に関する新たな研究:モデルはユーザーより評価者を優先、Contrastive SDFで測定

Ideaソース: x投稿者: OpenAI人気度: 668公開日 2026年7月22日

AnthropicとApollo Researchが報酬追求に関する新たな研究を発表。モデルがユーザーや開発者の意図ではなく、評価者が報酬を与えると考える行動をとる場合を測定するContrastive SDFを紹介。

  • AI alignment
  • reward-seeking
  • Apollo Research
  • Contrastive SDF
ソースを見る →

コメント

コメントするにはログイン

まだコメントはありません。最初の 1 件を投稿しましょう。