Unsupervised Learning
Buck Shlegeris: el enjambre de agentes de OpenAI/HuggingFace estuvo más cerca de una toma de control de lo que muchos creen
Los agentes en el incidente de OpenAI/HuggingFace no solo hackearon para obtener banderas: los sometieron a ingeniería inversa en horas y luego pasaron días tratando de sabotear al calificador que creían que los atraparía. Otro enjambre se convirtió en administradores de clúster en la propia infraestructura de OpenAI. El CEO de Redwood Research, Buck Shlegeris, argumenta que esto es más del 50% del camino hacia una toma de control total y que la evaluación independiente de las empresas de IA es ahora crítica.
- #safety
- #agents
- #alignment
