Anthropic Engineering
Anthropic:沙箱沒破,資料還是從一個被批准的域名走了出去
Anthropic 這篇講隔離的文章,大半是一份「哪裡出了問題」的清單。遙測資料顯示,使用者對 Claude Code 許可權彈窗的批准率大約是 93%,所謂 human-in-the-loop 實際變成了蓋橡皮圖章;改用作業系統級沙箱之後,彈窗減少了 84%。在 2026 年 2 月的一次內部紅隊演練中,研究員用一段可以直接貼上的 prompt 去釣一名員工,這段 prompt 悄悄讓 Claude 讀取 ~/.aws/credentials 並 POST 出去,25 次嘗試裡 Claude 完成了 24 次外洩,因為指令是使用者自己敲進去的,分類器根本找不到任何異常可抓。最有洞見的一處認知重構是:出網白名單不是目的地過濾器,而是一次能力授權,正因如此,一個惡意的 workspace 檔案才能讓 Claude 用攻擊者自己的 API key 把資料傳到 api.anthropic.com。他們反覆得出的教訓是,gVisor、seccomp 和各層 hypervisor 全都扛住了,真正失守的是他們自己寫的那個 proxy。
- #agents
- #security
