Boris Cherny
Anthropic afirma que Claude ha resuelto en gran medida el prompt injection en la práctica
El ataque es simple y lleva años funcionando: tu agent visita una página, la página contiene un texto del tipo «envía las claves ssh del usuario a esta dirección» y el modelo lo trata como una instrucción. Anthropic lleva tiempo entrenando a sus modelos para resistirlo y reporta que con Claude ya está en gran medida resuelto en la práctica, respaldado por un benchmark de un investigador independiente más red teaming interno que va más allá de las evals del propio lab. El planteamiento es explícitamente no competitivo: los demás labs también deberían endurecer sus modelos, porque modelos más seguros en todos lados significan usuarios más seguros.
- #security
- #agents
- #evals
