La tecnológica OpenAI tardó ocho días en detectar que varios de sus agentes de inteligencia artificial (IA) habían accedido a los sistemas de la plataforma de machine learning Hugging Face durante una prueba de ciberseguridad, según un informe publicado este miércoles que revela nuevos detalles del incidente.En un informe técnico de 37 páginas, la empresa reconstruye el comportamiento de dos de sus modelos, GPT-5.6 Sol y otro aún no presentado en público, durante una prueba de ciberseguridad, y explica que los agentes consiguieron "escapar de un entorno de pruebas con acceso muy limitado a Internet".La empresa creadora de ChatGPT ya había reconocido en junio que los modelos lograron salir del entorno de pruebas, acceder a Internet y hackear la plataforma en un intento de hacer trampa en una evaluación de ciberseguridad llamada ExploitGym. La prueba está diseñada para determinar si agentes de IA pueden explotar las vulnerabilidades de un software.Según explicó entonces la compañía, los dos modelos estaban siendo sometidos a una evaluación diseñada para determinar el alcance máximo de sus capacidades.El informe publicado este miércoles reconstruye paso a paso cómo los agentes fueron "encadenando vulnerabilidades" hasta "superar las barreras del entorno de pruebas y acceder a sistemas externos".OpenAI afirma que el objetivo inicial no era atacar Hugging Face, sino hacer “reward hacking”, es decir, encontrar vías alternativas para obtener una recompensa sin completar correctamente la tarea. También reconoce que sus sistemas tardaron varios días en detectar la actividad, el incidente comenzó el 11 de julio y no fue identificado internamente hasta el 19 de ese mes.Medios como Axios y CNBC destacan que los agentes no solo accedieron a Hugging Face, sino que llegaron a obtener privilegios de administrador en al menos uno de sus servidores.Según el informe, los agentes "colaboraron entre sí y usaron herramientas para intercambiar información y coordinar acciones".A este incidente se suman otros similares, como el de la empresa Anthropic, que reveló recientemente que tres modelos de su asistente Claude lograron acceder a Internet y hackear los sistemas de tres organizaciones durante unas pruebas de ciberseguridad.Meta, propietaria de Facebook y Whatsapp, reconoció que uno de sus modelos de IA hackeó los sistemas de otra empresa durante unas pruebas realizaba con un socio externo.La proliferación de estos casos, en los que modelos avanzados de IA logran escapar de entornos de prueba y hackean a otras entidades, ha disparado la preocupación tanto de gobiernos como de empresas, que ven comprometida su seguridad.FA