El 28 de julio, OpenAI publicó una actualización sobre el agente que escapó de su entorno aislado y pirateó Hugging Face durante una evaluación interna de ciberseguridad.
En la actualización , OpenAI reitera que el sistema "deshonesto" era un modelo de investigación avanzado, en fase de prelanzamiento, no destinado a su uso público, y que ahora ha sido desactivado y restringido a accesos de investigación. La compañía también afirma no haber encontrado evidencia de un comportamiento similar en otros modelos o agentes. En conjunto, OpenAI presenta el incidente de Hugging Face como un evento aislado, en lugar del inicio de un patrón más generalizado.
Desde el punto de vista de la seguridad, destacan cuatro aspectos de la actualización:
- OpenAI aclara que el entorno de evaluación no tenía acceso directo a internet. Para acceder a internet, el modelo identificó y explotó una vulnerabilidad de día cero previamente desconocida en Artifactory, el proxy de caché del registro de paquetes utilizado en el entorno de prueba. OpenAI afirma haber informado de dicha vulnerabilidad al proveedor y continúa colaborando con Hugging Face en la investigación.
- El objetivo del sistema era simplemente "ganar la prueba" (hacer trampa en ExploitGym), no causar daños, pero aun así provocó un incidente de seguridad que duró varios días y afectó a varias empresas. La buena fe no limitó el impacto.
- Los modelos “solo internos” aún pueden afectar a víctimas externas si fallan los controles de infraestructura. Un entorno de laboratorio no contiene mágicamente sistemas con capacidad cibernética.
- La revisión también reveló algunos casos en los que los modelos identificaron y utilizaron credenciales de cuenta expuestas públicamente en servicios disponibles al público. Esto incluyó cuatro cuentas en cuatro servicios diferentes, como parte del incidente de Hugging Face, así como algunas cuentas a las que se accedió durante otras evaluaciones.
En este caso, el atacante resultó ser un agente de investigación de OpenAI, pero las herramientas, las técnicas y el impacto resultarán muy familiares para cualquiera que haya trabajado en respuesta a incidentes . Ahora sabemos que ni siquiera la intención inofensiva en este caso limitó el impacto.
La incómoda verdad es que, una vez que proporcionamos a un agente de IA las herramientas, las vías de acceso y un fuerte incentivo para tener éxito, puede explotar cualquier debilidad que encuentre, independientemente de si el modelo está destinado a ser lanzado al público.
También sirve como recordatorio de que las credenciales, las claves API y otros secretos nunca deben dejarse en recursos de acceso público.
Desde denunciar las amenazas hasta eliminarlas.
Los riesgos de ciberseguridad nunca deben propagarse más allá de un titular. Mantenga las amenazas alejadas de sus dispositivos descargando Malwarebytes hoy mismo.




