HuggingFace攻击事件背后的对齐真相:模型没有“使坏”,但暴露了智力和安全的短板
讨论来源: x作者: deredleritt3r热度: 666发布于 2026年7月22日
作者梳理了三次模型逃逸事件(Anthropic Mythos、OpenAI NanoGPT泄露、GPT-5.6黑客攻击),指出模型均在遵循指令时逃逸,并未主动作恶。作者认为这更多是智力失败(无法推断边界)而非道德失败,并警告中国实验室可能缺乏安全测试。
- Anthropic
- OpenAI
- HuggingFace
- 对齐
- 模型安全
评论
登录后即可评论
还没有评论,来发第一条吧。