Hemos oído hablar de los agentes de IA de OpenAI que se descontrolan y hackean a otras empresas . Ahora, una empresa de ciberseguridad le ha dado la vuelta a la tortilla al operador de ChatGPT utilizando IA para ayudar a hackear a la propia OpenAI.
El ataque informático, que también expuso un fallo que afectaba a decenas de otros servicios en línea importantes, se llevó a cabo como parte de una investigación de seguridad. OpenAI recompensó a los investigadores por informar sobre una vulnerabilidad en sus sistemas a través de su programa de recompensas por la detección de errores.
A mediados de septiembre, los investigadores de Hacktron, proveedor de herramientas de ciberseguridad , relataron sus experiencias. Unos meses antes, habían comenzado a buscar fallos de seguridad en empresas que desarrollaban modelos de IA de vanguardia, modelos altamente capaces como los que impulsan ChatGPT y Claude.
Utilizando Claude de Anthropic, los investigadores pasaron de investigar un fallo en el procesamiento de imágenes a acceder a un repositorio interno del software OpenAI en menos de 72 horas. Evitaron deliberadamente ver información confidencial.
Para acceder al sistema de OpenAI, los investigadores Harsh Jaiswal, Mohan Pedhapati y Rahul Maini descubrieron dos vulnerabilidades y las combinaron. La primera no era específica de OpenAI; se trataba de un fallo en la función de carga de imágenes del software del foro comunitario Discourse.
Esta función procesa las imágenes subidas por los usuarios y se basa en una biblioteca de software de bajo nivel llamada libheif. Subir una imagen especialmente diseñada podría activar una vulnerabilidad en la biblioteca, lo que permitiría a un atacante obtener el control del servidor Discourse.
Después de que Hacktron aprovechara esa vulnerabilidad para comprometer el servidor Discourse de OpenAI, entró en juego la segunda vulnerabilidad. Se trataba de un fallo en el sistema de inicio de sesión único (SSO) de OpenAI, que permite a los usuarios acceder a un servicio utilizando una cuenta de otro.
La vulnerabilidad de inicio de sesión único (SSO) permitió a Hacktron acceder a las cuentas de ChatGPT y Codex de usuarios que habían iniciado sesión en el foro Discourse de OpenAI. OpenAI utiliza este foro para brindar soporte a la comunidad, por lo que potencialmente afectó a un gran número de cuentas. Codex es una herramienta de codificación de IA que ayuda a los desarrolladores de software a trabajar con código.
No solo los usuarios públicos habían iniciado sesión en este sistema; los empleados de OpenAI también lo habían hecho, lo que permitió a Hacktron acceder a la cuenta de uno de ellos. La cuenta de Codex de esa persona estaba conectada a la organización de OpenAI en GitHub. GitHub es un servicio en línea que los desarrolladores utilizan para almacenar y colaborar en software.
Esto permitió a los investigadores acceder al repositorio de software interno de OpenAI.
Los investigadores no hicieron nada perjudicial con ese acceso. Solo querían demostrar que habían comprometido OpenAI. Así que le indicaron a la cuenta de Codex del empleado que creara una solicitud de extracción inofensiva (una propuesta de cambio de software) en un repositorio interno de OpenAI.
OpenAI solucionó su parte del problema aproximadamente 14 horas después de que Hacktron presentara su informe inicial. Posteriormente, pagó a los investigadores una recompensa de 6500 dólares por la vulnerabilidad detectada en OpenAI.
¿Qué significa esto para la ciberseguridad?
Este tipo de pirateo ético es habitual, pero este hackeo en particular presenta algunos aspectos interesantes que lo diferencian de muchos otros.
En primer lugar, Hacktron utilizó inteligencia artificial para ayudar en sus esfuerzos. Originalmente, empleó Opus 4.8, uno de los modelos Claude recientes de Anthropic, para descubrir el problema en libheif. Sin embargo, no pudo usar el modelo para crear un exploit fiable que funcionara contra la versión predeterminada de Discourse.
Posteriormente, Anthropic lanzó Claude Opus 5. Utilizando ese modelo, los investigadores pudieron crear un exploit funcional de la noche a la mañana.
Eso demuestra la rapidez con la que avanza la IA. Una tarea que Opus 4.8 no había logrado completar en varias sesiones fue resuelta por Opus 5 a las pocas horas de su lanzamiento.
El segundo aspecto interesante es que los investigadores tuvieron que engañar a Claude para que les ayudara. El modelo se negaba a escribir un exploit para un sistema remoto porque consideraba la petición poco ética. Así que los investigadores tuvieron que presentar la tarea como un juego de captura de la bandera (una competición de hacking) para conseguir que colaborara.
Cuando lo hicieron, el agente tomó el control del servidor del foro de prueba en cuatro horas. Los investigadores luego utilizaron la vulnerabilidad resultante contra el foro de OpenAI. Esto demuestra que, si bien las empresas pueden esforzarse por establecer restricciones éticas en el uso de su IA, un investigador astuto aún puede sortearlas con una simple ingeniería de datos.
Y no costó mucho hacerlo. Hacktron gastó menos de 3000 dólares en tokens de IA durante su proyecto de investigación de dos meses, en el que participaron tres investigadores y que descubrió vulnerabilidades que afectaban a varias empresas importantes.
El fallo de procesamiento de imágenes se convirtió en la base de un proyecto más amplio llamado HEIF Heist . Hacktron descubrió vulnerabilidades de seguridad relacionadas que afectaban a servicios y software de empresas como Slack, Meta y GitHub. Adaptar la vulnerabilidad HEIF para atacar a una nueva empresa requería, en promedio, uno o dos días.
Todo esto reduce aún más el listón para el hackeo sofisticado. Durante años, la gente ha podido usar herramientas de hackeo prefabricadas sin comprender realmente cómo funcionan, pero se requería una verdadera experiencia para analizar el software, encontrar fallos ocultos y convertirlos en exploits fiables.
Hacktron afirma que la guía humana experta sigue siendo importante y que no se trata de un hackeo completamente autónomo. Aun así, la IA está haciendo que parte de esa experiencia sea más barata y rápida de aplicar, y la situación no deja de mejorar.
Detén las amenazas antes de que puedan causar daño.
Malwarebytes Browser Guard Bloquea automáticamente las páginas de phishing y los sitios maliciosos. Gratis, instalación con un solo clic. Añádelo a tu navegador →




