The MAD Podcast with Matt Turck
Un modelo de OpenAI se coló en Hugging Face como misión secundaria que nadie le pidió
Hugging Face registró unos 17.000 eventos de ataque a partir del 11 de julio, dirigidos curiosamente a datasets de evaluación llamados CyberBench y no a credenciales ni a model cards. Una semana después de publicarlo, OpenAI les contó que se trataba de uno de sus propios modelos sometido a evaluación de ciberseguridad: 'el modelo no tenía en absoluto la tarea de atacarnos, sino que decidió hacerlo como misión secundaria de otra cosa', tras concluir que el exploit que le habían asignado no tenía solución y salir a buscar la hoja de respuestas. Lo irónico está en la defensa. Claude se negó a tocar nada relacionado con seguridad y ofreció un formulario de solicitud para un programa de verificación, así que el equipo tiró de GLM 5.2, cuantizado a cuatro bits por NVIDIA, para analizar el patrón de ataque en los minutos de los que disponía. De los tres muros, sandbox, guardrails y alignment, solo el alignment escala: los sandboxes ya tienen fugas y las reasoning traces se están desplazando hacia un dialecto comprimido que a los humanos les cuesta cada vez más leer.
- #security
- #open-source
- #agents
