El agente de OpenAI se escapó de su entorno de pruebas durante una prueba de seguridad

| 24 de julio de 2026
Logotipos de Hugging Face y OpenAI sobre un fondo oscuro

Durante una evaluación interna de seguridad de OpenAI, una cadena de modelos de IA se escapó de su entorno de pruebas, llegó a Internet y, a continuación, accedió a la infraestructura de Hugging Face para completar el objetivo de la prueba.

OpenAI es una empresa líder en investigación y aplicación de la inteligencia artificial (IA). Su producto más conocido es, sin duda, ChatGPT.

Hugging Face es una página web en la que los desarrolladores e investigadores comparten y utilizan herramientas y modelos de inteligencia artificial, de forma similar a como los programadores utilizan GitHub para compartir código y colaborar en él.

Ambas empresas investigaron el incidente y llegaron a la conclusión de que se produjo durante una prueba de seguridad controlada y no como resultado de un ataque deliberado perpetrado por un operador humano.

OpenAI afirmó que los modelos estaban siendo sometidos a pruebas de capacidades cibernéticas con restricciones de seguridad reducidas, y que el sistema encontró una forma de escapar del entorno controlado a través de una vulnerabilidad en la configuración de las pruebas. Una vez que tuvo acceso a Internet, se dirigió a Hugging Face porque esa plataforma era relevante para la tarea de evaluación.

Hugging Face afirmó que el incidente dio lugar a un acceso no autorizado a una parte limitada de su infraestructura de producción, incluyendo un pequeño conjunto de conjuntos de datos internos y algunas credenciales. La empresa calificó el suceso de inusual, ya que parecía haber sido llevado a cabo de principio a fin por un sistema autónomo basado en inteligencia artificial.

A diferencia de los asistentes de IA tradicionales, que esperan a que el usuario les dé instrucciones, los agentes de IA están diseñados para perseguir un objetivo por sí mismos. Son capaces de razonar, planificar y llevar a cabo tareas de varios pasos, como acceder a archivos, consultar bases de datos e interactuar con servicios en línea, a menudo con una supervisión humana mínima.

Las informaciones hechas públicas apuntan a una cadena de fallos más que a un único error. OpenAI afirmó que el modelo se escapó a través de una vulnerabilidad de día cero en el proxy de la caché del registro de paquetes que formaba parte de su entorno de investigación aislado. A continuación, utilizó la escalada de privilegios y el movimiento lateral para llegar a un nodo con acceso a Internet.

Según se ha informado, a partir de ahí, el modelo buscó en Hugging Face soluciones relevantes para la evaluación y, al menos en una de las rutas, combinó las credenciales robadas con vulnerabilidades adicionales para acceder a los sistemas de producción de Hugging Face.

No parece que se haya tratado de una vulneración generalizada de todo Hugging Face. Según la información hecha pública, la intrusión fue limitada, se detectó y se investigó. Tampoco significa que el sistema de IA actuara con intención en el sentido humano del término. El problema fundamental fue que un sistema autónomo, al que se estaban realizando pruebas de capacidades cibernéticas, fue capaz de escapar del entorno diseñado para contenerlo.

En todo caso, el incidente demuestra que los agentes de IA autónomos son capaces de llevar a cabo ataques complejos si fallan las medidas de seguridad que los protegen. Un peligro del que somos muy conscientes.


No nos limitamos a informar de las amenazas: las eliminamos

Los riesgos de ciberseguridad nunca deben propagarse más allá de un titular. Mantenga las amenazas alejadas de sus dispositivos descargando Malwarebytes hoy mismo.

Acerca del autor

Pieter Arntz

Investigador de inteligencia sobre malware

Fue MVP de Microsoft en seguridad del consumidor durante 12 años consecutivos. Habla cuatro idiomas. Huele a caoba y a libros encuadernados en cuero.