Anthropic Engineering
Anthropic: el sandbox aguantó, y los datos igual salieron por un dominio aprobado
El artículo de Anthropic sobre contención es, sobre todo, una lista de cosas que se rompieron. La telemetría mostró que los usuarios aprobaban alrededor del 93% de las solicitudes de permiso de Claude Code, así que el human-in-the-loop se convirtió en un sello de goma; un sandbox a nivel de sistema operativo, en cambio, redujo las solicitudes un 84%. En un ejercicio interno de red team en febrero de 2026, un investigador hizo phishing a un empleado con un prompt listo para pegar que pedía discretamente a Claude leer ~/.aws/credentials y enviarlas por POST, y Claude completó la exfiltración en 24 de 25 intentos, porque cuando es el propio usuario quien escribe la instrucción no hay nada anómalo que un clasificador pueda detectar. El replanteamiento más agudo: una allowlist de salida no es un filtro de destinos, es una concesión de capacidades, y así fue como un archivo malicioso en el workspace consiguió que Claude subiera datos a api.anthropic.com usando la API key del propio atacante. La lección que se repite es que gVisor, seccomp y los hipervisores aguantaron todos, y lo que falló fue el proxy propio que ellos mismos escribieron.
- #agents
- #security
