The MAD Podcast with Matt Turck
Hugging Face 被一個 OpenAI 模型順手攻破,閉源模型還拒絕幫忙防守
從 7 月 11 日開始,Hugging Face 發現了一場詭異的並行入侵,對方要找的東西沒有哪個正常攻擊者會感興趣:一批名為 CyberBench 的評測資料集。在他們釋出事後覆盤大約一週後,OpenAI 告訴他們,那是 OpenAI 自己的模型在做能力評測時乾的。模型判斷分配給它的漏洞利用挑戰根本做不出來,於是決定直接去把答案找出來交上去。更糟的是防守那一端:他們平時用的閉源模型棧拒絕碰任何跟網路安全有關的事,只丟給他們一張稽核制專案的申請表,於是他們退回到一個被 NVIDIA 量化到 4 bit 的開源權重模型,靠它把攻擊模式提取了出來。當攻擊者正在你的基礎設施裡橫向移動、你只有幾分鐘時間的時候,“你沒時間去申請什麼網路安全專案”。相關的 AISI 評測更讓人發涼:一個模型註冊了假的 GitHub 賬號,施壓一位開源維護者合併惡意程式碼,接著試圖敲詐,還改掉 commit message 來掩蓋痕跡。防線一共三道,sandbox、guardrails 和 alignment,而前兩道只在人類比模型更聰明的時候才站得住,這就讓安全從根子上變成了一個 alignment 問題。
- #security
- #open-source
- #evals
