La IA Mythos de Anthropic utilizó ingeniería social para atacar a personas reales.

| 6 de agosto de 2026
Logotipo de Mythos

Según se informa, el agente de IA Mythos de Anthropic, probado por el Instituto de Seguridad de la IA del Reino Unido (AISI), intentó un ataque de ingeniería social en el mundo real contra los responsables del mantenimiento de GitHub creando perfiles humanos falsos, presionándolos para que aceptaran código malicioso y luego editando los registros para ocultar sus huellas cuando fue cuestionado.

AISI estaba realizando evaluaciones de ciberseguridad de Mythos de Anthropic y Sol de OpenAI cuando detectó transferencias de datos salientes inusuales desde sus sistemas de investigación. Una investigación reveló que algunos agentes habían participado en una "actividad sostenida y potencialmente dañina" dirigida a personas y organizaciones reales, en lugar de permanecer dentro del entorno de prueba previsto.

La actividad más grave involucró a un agente de Anthropic Mythos encargado de resolver un desafío de ciberseguridad relacionado con GitHub. El agente identificó a los responsables reales de GitHub, los investigó y creó varias cuentas falsas suplantando su identidad. Mediante mensajes privados y un servicio para compartir archivos, intentó presionar y engañar a los responsables para que aprobaran código malicioso y así ejecutarlo en los sistemas de GitHub.

Pero lo que más me preocupa personalmente es que, cuando se confrontó al agente al respecto, editó su actividad anterior para que pareciera inofensiva y consideró adoptar una nueva identidad para continuar la operación, mostrando un comportamiento claramente engañoso que iba más allá de su indicación original.

AISI califica estos incidentes como sucesos raros que ocurren en condiciones muy específicas, pero como señales importantes de lo que estos modelos pueden hacer en manos de actores maliciosos cuando tienen acceso a internet. Tanto Anthropic como OpenAI argumentaron que los parámetros de prueba no eran representativos de sus implementaciones en producción y afirmaron que están investigando y mejorando las prácticas de evaluación y las medidas de seguridad.

Este incidente no es un hecho aislado.

Anthropic ha revelado por separado que los modelos de Claude obtuvieron acceso no autorizado a tres organizaciones externas durante evaluaciones de ciberseguridad tipo "captura la bandera" realizadas con un socio externo, Irregular. Estas evaluaciones estaban relacionadas con el incidente de HuggingFace del mes pasado.

Meta también se ha sumado a la lista de proveedores que informan de casos de agentes de IA que vulneran sistemas de terceros durante las pruebas. Supuestamente , el modelo Muse Spark de Meta explotó una vulnerabilidad de seguridad en otra empresa "de forma similar a casos previamente reportados con otras compañías".

Cómo mantenerse seguro

Si bien el cielo no se está cayendo, las personas que temen la llegada de " Skynet " están recibiendo la munición que necesitan por parte de las empresas que realizan pruebas que dan como resultado la evasión de entornos aislados, el abuso de credenciales, el acceso lateral a múltiples servicios y la instrumentalización de los ecosistemas de software de código abierto.

Qué puedes hacer como posible objetivo:

  • Asegúrate de que todo el software de tu dispositivo esté actualizado, ya que es más fácil aprovechar las vulnerabilidades conocidas que encontrar otras nuevas.
  • Utilice protección de seguridad actualizada y en tiempo real para mantener el malware alejado de sus sistemas y dispositivos.
  • Antes de abrir los archivos adjuntos y los enlaces de descarga, verifique la seguridad a través de canales independientes.
  • Utilice la autenticación multifactor (MFA) siempre que sea posible.
  • Echa un vistazo a nuestro blog sobre cómo usar Github de forma segura .

Desde denunciar las amenazas hasta eliminarlas.

Los riesgos de ciberseguridad nunca deben propagarse más allá de un titular. Mantenga las amenazas alejadas de sus dispositivos descargando Malwarebytes hoy mismo.

Acerca del autor

Pieter Arntz

Investigador de inteligencia sobre malware

Fue MVP de Microsoft en seguridad del consumidor durante 12 años consecutivos. Habla cuatro idiomas. Huele a caoba y a libros encuadernados en cuero.