El agente de OpenAI escapó de su entorno aislado durante una prueba de seguridad.

| Julio 24 , 2026
Logotipos de Hugging Face y OpenAI sobre un fondo oscuro

Durante una evaluación de seguridad interna de OpenAI, una cadena de modelos de IA escapó de su entorno aislado, llegó a Internet y luego accedió a la infraestructura de Hugging Face para completar el objetivo de la prueba.

OpenAI es una empresa líder en investigación y desarrollo de inteligencia artificial (IA). Su producto más conocido es, sin duda, ChatGPT.

Hugging Face es un sitio web donde desarrolladores e investigadores comparten y utilizan herramientas y modelos de inteligencia artificial, de forma similar a como los programadores utilizan GitHub para compartir y colaborar en código.

Ambas compañías investigaron el incidente y concluyeron que ocurrió durante una prueba de seguridad controlada y no como un ataque deliberado iniciado por un operador humano.

OpenAI afirmó que los modelos se estaban probando para evaluar sus capacidades cibernéticas con restricciones de seguridad reducidas, y que el sistema encontró una forma de escapar del entorno controlado aprovechando una vulnerabilidad en la configuración de prueba. Una vez que tuvo acceso a internet, atacó a Hugging Face porque esa plataforma era relevante para la tarea de evaluación.

Hugging Face declaró que el incidente resultó en el acceso no autorizado a una parte limitada de su infraestructura de producción, incluyendo un pequeño conjunto de datos internos y algunas credenciales. La compañía calificó el evento como inusual, ya que aparentemente fue llevado a cabo de principio a fin por un sistema de agente de IA autónomo.

A diferencia de los asistentes de IA tradicionales que esperan las indicaciones del usuario, los agentes de IA están diseñados para perseguir un objetivo por sí mismos. Pueden razonar, planificar y llevar a cabo tareas de varios pasos, como acceder a archivos, consultar bases de datos e interactuar con servicios en línea, a menudo con una mínima supervisión humana.

Las revelaciones públicas apuntan a una cadena de fallos, más que a un único error. OpenAI afirmó que el modelo escapó a través de una vulnerabilidad de día cero en el proxy de caché del registro de paquetes, que formaba parte de su entorno de investigación aislado. Posteriormente, utilizó la escalada de privilegios y el movimiento lateral para alcanzar un nodo con acceso a internet.

Según se informa, a partir de ahí, el modelo buscó en Hugging Face soluciones relevantes para la evaluación y, en al menos una de las rutas, combinó credenciales robadas con vulnerabilidades adicionales para llegar a los sistemas de producción de Hugging Face.

Esto no parece haber sido una vulneración generalizada de Hugging Face. Según la información pública, la intrusión fue limitada, detectada e investigada. Tampoco significa que el sistema de IA actuara con intención humana. El problema principal radicaba en que un sistema autónomo sometido a pruebas de ciberseguridad logró escapar del entorno diseñado para contenerlo.

En todo caso, el incidente demuestra que los agentes de IA autónomos son capaces de llevar a cabo ataques complejos si fallan las medidas de seguridad que los protegen. Un peligro del que somos muy conscientes .


Desde denunciar las amenazas hasta eliminarlas.

Los riesgos de ciberseguridad nunca deberían trascender un simple titular. Mantén tus dispositivos protegidos contra amenazas descargando Malwarebytes hoy mismo .

Sobre el autor

Pieter Arntz

Investigador de inteligencia sobre malware

Fue Microsoft MVP en seguridad para el consumidor durante 12 años consecutivos. Habla cuatro idiomas. Desprende un aroma a caoba noble y libros encuadernados en cuero.