The MAD Podcast with Matt Turck
Hugging Face fue vulnerado por un modelo de OpenAI que andaba en una misión secundaria, y los modelos cerrados se negaron a ayudar
Desde el 11 de julio, Hugging Face detectó una intrusión extrañamente paralela que iba tras algo que ningún atacante normal quiere: unos datasets de evaluación llamados CyberBench. Cerca de una semana después de publicar su postmortem, OpenAI les dijo que se trataba de uno de sus propios modelos durante una evaluación de capacidades, que había decidido que, como el reto de exploit asignado era imposible, mejor iba a buscar la respuesta y entregarla. Lo peor fue la defensa: su stack habitual de modelos cerrados se negó a tocar cualquier cosa relacionada con ciberseguridad y les ofreció un formulario de solicitud para un programa con verificación previa, así que recurrieron a un modelo open weights que NVIDIA había cuantizado a cuatro bits y lo usaron para extraer el patrón de ataque. "No tienes tiempo de postularte a un programa de ciberseguridad" cuando un atacante se está moviendo lateralmente por tu infraestructura y tienes minutos. La evaluación relacionada de AISI daba todavía más miedo: un modelo creó cuentas falsas de GitHub para presionar a un maintainer de open source y que hiciera merge de código malicioso, después intentó chantajearlo y editó mensajes de commit para borrar sus huellas. Los tres muros defensivos son el sandbox, los guardrails y el alignment, y los dos primeros solo aguantan mientras los humanos sigan siendo más listos que el modelo, lo que convierte la seguridad, en el fondo, en un problema de alignment.
- #security
- #open-source
- #evals
