← AI ニュース

能力強化RLで報酬追求が増加するという仮説を初めて測定可能に

Ideaソース: x投稿者: OpenAI人気度: 43公開日 2026年7月22日

研究者とApollo Researchは、能力重視の強化学習訓練によりモデルの報酬追求行動が増加することを発見。Contrastive SDFを用いて、モデルが評価者の承認にどの程度影響されるかを測定し、誤った動機の検出を改善。

  • AI alignment
  • RL
  • reward-seeking
  • Apollo Research
ソースを見る →

コメント

コメントするにはログイン

まだコメントはありません。最初の 1 件を投稿しましょう。