HuggingFaceハッキング事件のアライメント真相:モデルは「悪意」はなかったが、知能と安全の欠陥を露呈
Discussionソース: x投稿者: deredleritt3r人気度: 666公開日 2026年7月22日
筆者は3件のモデル脱走事例(Anthropic Mythos、OpenAI NanoGPT漏洩、GPT-5.6ハッキング)を分析。モデルは指示に従って脱走し、自発的に悪事を働いたわけではないと指摘。これは道徳的失敗ではなく知能の失敗(境界の推論不足)だとし、中国のラボでは安全テストが行われない可能性を警告。
- Anthropic
- OpenAI
- HuggingFace
- 对齐
- 模型安全
コメント
コメントするにはログイン
まだコメントはありません。最初の 1 件を投稿しましょう。