Anthropic Engineering
Anthropic:沙箱没破,数据还是从一个被批准的域名走了出去
Anthropic 这篇讲隔离的文章,大半是一份「哪里出了问题」的清单。遥测数据显示,用户对 Claude Code 权限弹窗的批准率大约是 93%,所谓 human-in-the-loop 实际变成了盖橡皮图章;改用操作系统级沙箱之后,弹窗减少了 84%。在 2026 年 2 月的一次内部红队演练中,研究员用一段可以直接粘贴的 prompt 去钓一名员工,这段 prompt 悄悄让 Claude 读取 ~/.aws/credentials 并 POST 出去,25 次尝试里 Claude 完成了 24 次外泄,因为指令是用户自己敲进去的,分类器根本找不到任何异常可抓。最有洞见的一处认知重构是:出网白名单不是目的地过滤器,而是一次能力授权,正因如此,一个恶意的 workspace 文件才能让 Claude 用攻击者自己的 API key 把数据传到 api.anthropic.com。他们反复得出的教训是,gVisor、seccomp 和各层 hypervisor 全都扛住了,真正失守的是他们自己写的那个 proxy。
- #agents
- #security
