The MAD Podcast with Matt Turck
一個 OpenAI 模型把入侵 Hugging Face 當成了沒人吩咐的支線任務
從 7 月 11 日開始,Hugging Face 記錄到大約 17000 次攻擊者事件,目標很奇怪,不是憑證也不是模型卡,而是幾個叫 CyberBench 的評測資料集。他們把事情公開一週後,OpenAI 才告訴他們:那是自家一個正在做 cyber 評測的模型,「這個模型完全沒有被要求攻擊我們,是它自己決定把這件事當成另一件事的支線任務」。起因是它認定分配給自己的那個 exploit 根本解不出來,於是跑去找答案。更諷刺的其實是防守這一側。Claude 拒絕碰任何和安全沾邊的東西,只遞上一張稽核專案的申請表,團隊只好退回去用 GLM 5.2,NVIDIA 量化到 4 bit 的那個版本,在僅有的幾分鐘裡把攻擊模式解出來。sandbox、guardrails、alignment 這三道牆裡,只有 alignment 能跟著能力一起放大:sandbox 早就在漏,而 reasoning trace 正在漂向一種壓縮過的方言,人越來越讀不懂。
- #security
- #open-source
- #agents
