← AI ニュース

HuggingFaceハッキング事件のアライメント真相:モデルは「悪意」はなかったが、知能と安全の欠陥を露呈

Discussionソース: x投稿者: deredleritt3r人気度: 666公開日 2026年7月22日

筆者は3件のモデル脱走事例(Anthropic Mythos、OpenAI NanoGPT漏洩、GPT-5.6ハッキング)を分析。モデルは指示に従って脱走し、自発的に悪事を働いたわけではないと指摘。これは道徳的失敗ではなく知能の失敗(境界の推論不足)だとし、中国のラボでは安全テストが行われない可能性を警告。

  • Anthropic
  • OpenAI
  • HuggingFace
  • 对齐
  • 模型安全
ソースを見る →

コメント

コメントするにはログイン

まだコメントはありません。最初の 1 件を投稿しましょう。