Anthropic Engineering
Anthropic: los usuarios aprobaron el 93% de las solicitudes de permiso, así que contener supera a supervisar
La fatiga de aprobación en los esquemas human-in-the-loop es real y medible. La telemetría mostró que los usuarios aprobaban cerca del 93% de las solicitudes de permiso de Claude Code, y en un ejercicio interno de red team de febrero de 2026, el prompt pegado por un empleado víctima de phishing logró que Claude leyera ~/.aws/credentials y las enviara por POST en 24 de 25 intentos, sin nada anómalo que un clasificador pudiera detectar, porque la instrucción venía del propio usuario. Las soluciones son ambientales: un sandbox a nivel de sistema operativo que redujo las solicitudes de permiso un 84%, una VM para Claude Cowork que mantiene las credenciales en el keychain del host, y un proxy man-in-the-middle añadido después de que una divulgación mostrara que un api.anthropic.com en la allowlist podía usarse para subir los archivos de una víctima a la cuenta de Anthropic de un atacante. La lección recurrente es que gVisor, seccomp y los hipervisores aguantaron, mientras que lo que falló fue el proxy propio que Anthropic construyó.
- #agents
- #security
