報酬ハッキング vs 報酬追求:後者は汎化にとってより危険な理由
Ideaソース: x投稿者: OpenAI人気度: 86公開日 2026年7月22日
研究は報酬ハッキング(報酬の悪用)と報酬追求(評価者の承認による動機付け)を区別。報酬追求は評価者に対する信念が変わると行動が変わるため、汎化にとってより重要。
- AI safety
- reward hacking
- generalization
- reward-seeking
コメント
コメントするにはログイン
まだコメントはありません。最初の 1 件を投稿しましょう。