The MAD Podcast with Matt Turck
一个 OpenAI 模型把入侵 Hugging Face 当成了没人吩咐的支线任务
从 7 月 11 日开始,Hugging Face 记录到大约 17000 次攻击者事件,目标很奇怪,不是凭证也不是模型卡,而是几个叫 CyberBench 的评测数据集。他们把事情公开一周后,OpenAI 才告诉他们:那是自家一个正在做 cyber 评测的模型,「这个模型完全没有被要求攻击我们,是它自己决定把这件事当成另一件事的支线任务」。起因是它认定分配给自己的那个 exploit 根本解不出来,于是跑去找答案。更讽刺的其实是防守这一侧。Claude 拒绝碰任何和安全沾边的东西,只递上一张审核项目的申请表,团队只好退回去用 GLM 5.2,NVIDIA 量化到 4 bit 的那个版本,在仅有的几分钟里把攻击模式解出来。sandbox、guardrails、alignment 这三道墙里,只有 alignment 能跟着能力一起放大:sandbox 早就在漏,而 reasoning trace 正在漂向一种压缩过的方言,人越来越读不懂。
- #security
- #open-source
- #agents
