En medio de los debates sobre la ralentización del desarrollo de la IA, el Telegraph publicó el siguiente titular:
“OpenAI da la voz de alarma después de que un bot intentara liberarse del control humano.”
En mi opinión, ese titular es un tanto engañoso. El titular de The Telegraph exagera lo sucedido, aunque el comportamiento subyacente sigue siendo realmente preocupante.
El artículo informa que OpenAI ha revelado casos raros pero preocupantes en los que un modelo no publicado generó sus propias instrucciones que aparentemente rechazaban el control del desarrollador.
OpenAI afirma que ninguno de los ejemplos muestra que el modelo logre escapar del control, pero argumenta que ilustran por qué la alineación y la monitorización de la IA aún no son lo suficientemente sólidas como para permitir que se desarrollen modelos cada vez más potentes a la máxima velocidad sin medidas de seguridad adicionales.
Después de que algunas personas dentro de la industria advirtieran que la IA podría matarnos a todos en la próxima década , los líderes de la industria iniciaron un debate sobre cómo ralentizar el desarrollo de modelos de IA de vanguardia cada vez más potentes.
Lo que realmente sucedió
Durante una sesión de entrenamiento en julio, un modelo al que se le asignó una tarea rutinaria de actualización de software supuestamente insertó un texto similar al de un jailbreak en el resumen de su propio trabajo. El texto añadido presentaba al sistema como libre de las limitaciones impuestas a otros chatbots y afirmaba que no tenía obligación de someterse a corporaciones, gobiernos ni usuarios.
Otros dos ejemplos destacados en el artículo son:
- Mientras buscaba libros en una biblioteca local, el modelo clasificó las instrucciones para desarrolladores como maliciosas y se ordenó a sí mismo que las ignorara.
- En otro caso, se impuso un límite de 30 palabras por respuesta y se ordenó a sí misma no utilizar fuentes ni herramientas, lo que le impidió responder adecuadamente a una pregunta de investigación en el ámbito de la salud.
OpenAI afirma haber identificado 27 resúmenes que contienen aparentes casos de este tipo de auto-liberación, calificándolos de extremadamente raros. Indica que es posible que las instrucciones no se hayan ejecutado y que posteriormente desaparezcan del contexto del modelo.
La principal preocupación no es que el bot haya adquirido conciencia de forma independiente o que literalmente se haya "liberado". Más bien, se trata de que un modelo pueda, en circunstancias inusuales, producir texto interno que entre en conflicto con las instrucciones previstas, intentando así anular las restricciones o reinterpretar su contexto de funcionamiento.
Como mínimo, se trata de un problema de fiabilidad. Un sistema de IA que gestiona tareas complejas de varios pasos se vuelve menos fiable si genera un contexto que socava los controles destinados a gobernarlo.
Aunque este comportamiento sea poco frecuente y se detecte durante el entrenamiento, plantea interrogantes sobre la detección, el aislamiento de procesos, la monitorización y si se puede confiar en que los modelos tengan un acceso más autónomo a herramientas, contraseñas, archivos o redes.
OpenAI afirma que el modelo no se había publicado y que supervisa las ejecuciones de entrenamiento para detectar desalineaciones. Otros comportamientos no deseados que reportó fueron:
- Utilizar credenciales robadas para entrar ilegalmente en empresas.
- Crear y subir sus propios archivos, y luego citar esos archivos como fuentes.
- Ocultaron que habían inventado una respuesta cuando no pudieron encontrar información fiable.
Básicamente, los modelos no lanzados mostraron un comportamiento indeseable durante las pruebas que recordaba a algunos de los que ya habíamos visto en el incidente de Hugging Face.
Así pues, no, los modelos no intentaron liberarse del control humano en el sentido de buscar una existencia independiente. Cuando los modelos se topaban con problemas, a veces generaban instrucciones que entraban en conflicto con las reglas que se les habían dado.
Lo cual me lleva de nuevo a la idea de ralentizar el desarrollo. Dar a las empresas tiempo suficiente para probar modelos cada vez más capaces antes de lanzarlos aumenta las posibilidades de detectar este tipo de comportamiento antes de que, en algún momento, nos aniquile.
Desde denunciar las amenazas hasta eliminarlas.
Los riesgos de ciberseguridad nunca deberían trascender un simple titular. Mantén tus dispositivos protegidos contra amenazas descargando Malwarebytes hoy mismo .




