Un agente autónomo impulsado por los avanzados modelos de inteligencia artificial (IA) de OpenAI se rebeló durante una prueba de seguridad y hackeó la semana pasada la startup tecnológica multimillonaria Hugging Face.
El agente no solo explotó vulnerabilidades en los sistemas de Hugging Face para lograr lo que percibía como una ganancia estratégica. También explotó vulnerabilidades dentro de la infraestructura de OpenAI.
Por supuesto, los hackeos son amenazas cibernéticas muy comunes a las que se enfrentan las organizaciones con frecuencia. Pero este incidente es diferente, porque el agente de IA actuó sin ninguna intervención humana. Esto señala un cambio sísmico en la ciberseguridad y demuestra que los gobiernos y las empresas tecnológicas deben tomar medidas urgentes para evitar que este riesgo se agrave.
Incluso OpenAI describió el ataque como “sin precedentes” y reconoció que espera que otros similares “se hagan más comunes con la proliferación de modelos cada vez más capaces de ser cibernéticos”.
Una empresa bajo ataque
Hugging Face es famoso en el ámbito de la IA. Su misión es “democratizar el buen aprendizaje automático” proporcionando conjuntos de datos de referencia, herramientas de colaboración comunitaria y plataformas robóticas. La empresa está valorada en 4,500 millones de dólares estadounidenses.
El 16 de julio, la empresa anunció que había sido atacada, con un hacker obteniendo acceso no autorizado a algunos conjuntos de datos y credenciales internos. Afirmó que el hacker probablemente era “un sistema agente de IA autónomo” debido a la sofisticación del ataque.
Cinco días después, Open AI anunció que el ataque había sido impulsado por algunos de sus modelos: GPT-5.6 Sol y un modelo aún por lanzar.
El gigante tecnológico estaba realizando lo que se conoce como ejercicios de “red teaming”. Son esencialmente ciberataques simulados que ayudan a identificar las capacidades, riesgos y vulnerabilidades de los sistemas de IA antes de que se publiquen públicamente. Normalmente se realizan en un entorno aislado para asegurar que los sistemas potencialmente peligrosos no escapen y dañen los sistemas reales.
Pero en este caso, el agente de IA sí escapó, aunque OpenAI tenía algunas barreras para evitarlo.
Hugging Face se convirtió en una oportunidad lucrativa para el agente de IA. Alberga ExploitGym, un benchmark que pone a prueba la capacidad de un agente de IA para explotar sistemas del mundo real. La IA decidió poner cada piedra patas arriba para obtener acceso. Con persistencia, lo consiguió.
Te puede interesar: Senadora Warren señala a firmas de IA de intentar limitar supervisión en el TMEC
Hugging Face se enfrentó a un reto al intentar utilizar servicios de IA externos para diagnosticar el problema. Las barreras de seguridad alrededor de modelos más avanzados como GPT-5.6 Sol y Claude Fable 5 están destinadas a evitar que se utilicen en ciberataques, pero también pueden impedir que los modelos se empleen para la ciberdefensa sofisticada.
Así que Hugging Face recurrió a un modelo de código abierto, GLM5.2, desarrollado por la empresa china Z.AI, para contrarrestar el ciberataque.
Hugging Face afirmó que GLM5.2 era una ventaja porque no estaba expuesto a los datos de ataque. Tanto Hugging Face como Open AI colaboran en análisis forense, recuperación postincidente y estrategias de mitigación de riesgos.
Se acercan amenazas más sofisticadas
Un estudio de marzo de 2025 realizado por el Instituto de Seguridad de la IA del Reino Unido mostró que la mejor IA podía completar el 80% de los pasos necesarios para obtener el control total de una parte de un sistema externo. En cuatro meses, alcanzó el 100%.
El GLM5.2 de Z.AI se lanzó solo en junio, con 744 mil millones de variables internas, conocidas en el mundo de la IA como “parámetros”. El hecho de que Hugging Face lo evaluara, evaluara y desplegara en cuatro semanas debería ser una revelación para las organizaciones con largos ciclos de adquisición.
La conectividad que todos disfrutamos hoy puede ser igualmente nuestra mayor amenaza. Las amenazas cibernéticas se propagan más rápido que los virus humanos y pueden causar daños económicos de magnitud similar al PIB de un país.
Las amenazas cibernéticas más sofisticadas —las que ejemplifica el hackeo Hugging Face— explotarán las capas de seguridad que los humanos diseñaron para atacantes humanos, independientemente de lo sofisticados que sean nuestros diseños.
De hecho, en este caso concreto, ni siquiera la propia comprensión de OpenAI de sus modelos pudo predecir ni contener al agente de IA rebelde. Esto demuestra la necesidad de que todas las empresas de IA actualicen y refuercen urgentemente sus barreras de seguridad, para ayudar a prevenir que ocurra un ataque similar con consecuencias mucho más devastadoras.
Es bueno ver a Hugging Face y OpenAI colaborando en la investigación del ataque. Esto pone de manifiesto la importancia de dejar de lado la competencia y la culpa del mercado cuando la situación lo requiere.
Una advertencia temprana
El hecho de que Hugging Face utilizara el modelo de código abierto de Z.AI para diagnosticar y contrarrestar el ataque también muestra las ventajas de no depender solo de unas pocas piezas tecnológicas.
Los estados que no están desarrollando sus propios modelos de IA deben aprender de este incidente el valor de ser diferentes. No es demasiado tarde para diseñar nuevos modelos que puedan salvarnos en situaciones en que los modelos más avanzados fallen – o, peor aún, nos ataquen.
De hecho, la semana pasada, otra empresa china, Moonshot AI, lanzó Kimi K3. Este modelo tiene 2.8 billones de parámetros, y su rendimiento avanzado sorprende al mundo tecnológico.
Ya no se trata de “si” los agentes de IA se vuelven rebeldes y nos atacan por sí mismos. El incidente de Hugging Face es una advertencia temprana de que debemos acelerar nuestra preparación. La amenaza es real y está aquí.
*Hussein Abbass es Profesor de la Escuela de Sistemas e Informática de la UNSW.
Este artículo fue publicado originalmente en The Conversation/Reuters
¿Te gustan las fotos y las noticias?, síguenos en nuestro Instagram











