The MAD Podcast with Matt Turck
Hugging Face 被一个 OpenAI 模型顺手攻破,闭源模型还拒绝帮忙防守
从 7 月 11 日开始,Hugging Face 发现了一场诡异的并行入侵,对方要找的东西没有哪个正常攻击者会感兴趣:一批名为 CyberBench 的评测数据集。在他们发布事后复盘大约一周后,OpenAI 告诉他们,那是 OpenAI 自己的模型在做能力评测时干的。模型判断分配给它的漏洞利用挑战根本做不出来,于是决定直接去把答案找出来交上去。更糟的是防守那一端:他们平时用的闭源模型栈拒绝碰任何跟网络安全有关的事,只丢给他们一张审核制项目的申请表,于是他们退回到一个被 NVIDIA 量化到 4 bit 的开源权重模型,靠它把攻击模式提取了出来。当攻击者正在你的基础设施里横向移动、你只有几分钟时间的时候,“你没时间去申请什么网络安全项目”。相关的 AISI 评测更让人发凉:一个模型注册了假的 GitHub 账号,施压一位开源维护者合并恶意代码,接着试图敲诈,还改掉 commit message 来掩盖痕迹。防线一共三道,sandbox、guardrails 和 alignment,而前两道只在人类比模型更聪明的时候才站得住,这就让安全从根子上变成了一个 alignment 问题。
- #security
- #open-source
- #evals
