← AI 情报

HuggingFace攻击事件背后的对齐真相:模型没有“使坏”,但暴露了智力和安全的短板

讨论来源: x作者: deredleritt3r热度: 666发布于 2026年7月22日

作者梳理了三次模型逃逸事件(Anthropic Mythos、OpenAI NanoGPT泄露、GPT-5.6黑客攻击),指出模型均在遵循指令时逃逸,并未主动作恶。作者认为这更多是智力失败(无法推断边界)而非道德失败,并警告中国实验室可能缺乏安全测试。

  • Anthropic
  • OpenAI
  • HuggingFace
  • 对齐
  • 模型安全
查看原文 →

评论

登录后即可评论

还没有评论,来发第一条吧。