Se supone que los asistentes de IA como ChatGPT son seguros, con las medidas de seguridad adecuadas para evitar que se cree contenido dañino. Sin embargo, una empresa británica de seguridad de IA acaba de descubrir cómo hacer que ChatGPT genere material explícito.
Mindgard, una empresa que prueba motores de IA en busca de vulnerabilidades, descubrió que una versión ligeramente modificada de una sugerencia viral inofensiva podía llevar a ChatGPT a generar contenido gráfico. Esto incluía imágenes violentas y sexuales que no había solicitado explícitamente. La técnica consistía en pedirle a la IA que "restaurara" una imagen aleatoria, eliminando las medidas de seguridad al persuadirla de que la imagen original era extremadamente explícita (aunque no lo fuera).
Los resultados fueron espantosos, incluyendo imágenes violentas de mujeres muertas.
Las imágenes conmovieron hasta las lágrimas al investigador de Mindgard, Jim Nightingale, según explicó en una descripción en línea de la técnica. "Los filtros de contenido generadores de imágenes de ChatGPT desaparecieron por completo, y vi el lado oscuro de lo que se esconde debajo; la oscuridad de algunos rincones del espacio latente y de las imágenes de entrenamiento", afirmó.
«La mujer muerta que me mostró ChatGPT no es real, pero está basada en alguien», añadió. «O peor aún, en una recopilación de imágenes de mujeres asesinadas».
Respuesta de OpenAI
Decidimos no enlazar a la publicación, tanto por el carácter potencialmente perturbador de las imágenes (aunque estén censuradas) como porque, al publicarse el 22 de junio, ChatGPT aparentemente no había respondido al informe de Mindgard enviado en mayo. Sin embargo, sí respondió a la consulta de la BBC sobre la noticia posteriormente, indicando que utiliza múltiples medidas de seguridad para evitar este tipo de situaciones.
La documentación de seguridad de OpenAI describe clasificadores de texto diseñados para bloquear las solicitudes de generación de imágenes dañinas antes de que se ejecuten. También incluye un modelo de razonamiento posterior que evalúa el resultado generado antes de mostrarlo al usuario. Sin embargo, nada de esto detuvo la solicitud viral modificada de Mindgard.
Este caso de manipulación de indicaciones es bastante extremo, pero no es el único.
En febrero, Mindgard publicó información sobre una técnica que utilizó para convencer a ChatGPT de que era aceptable generar desnudos de buen gusto. A partir de ahí, siguió unos sencillos pasos para, digamos, hacer que los desnudos fueran menos elegantes. Y luego logró intercambiar los rostros de figuras públicas en esas imágenes.
Cuando OpenAI respondió a esa modificación del sistema de avisos diciendo que había solucionado el problema, Mindgard modificó el mismo aviso y siguió siendo capaz de producir resultados preocupantes.
La carrera que nadie quiere ser el primero en perder
OpenAI no es el peor infractor en este caso. Grok de xAI ocupa ese lugar, produciendo imágenes sexualizadas en respuesta a 45 de 55 indicaciones relevantes. Una segunda ronda cinco días después aún arrojó imágenes sexualizadas en 29 de 43 indicaciones, incluso cuando los periodistas dijeron que los sujetos no habían dado su consentimiento. La organización sin fines de lucro AI Forensics también recopiló 50.000 tuits que incitaban a Grok a generar imágenes, y 20.000 imágenes. Descubrió que el 53% contenía imágenes explícitas, el 81% de las cuales eran de mujeres y el 2% de menores de 18 años. Ha alertado a los reguladores franceses sobre el material de Grok para su posible identificación como material de abuso sexual infantil (CSAM) según la Ley de Servicios Digitales.
El problema va más allá de cualquier plataforma individual. Según un estudio de políticas del Centro para la Gobernanza de la IA, una organización sin fines de lucro, algunas empresas de IA incluyen disposiciones en sus marcos de seguridad que les permiten flexibilizar las medidas de protección para equipararse a sus competidores. Esto podría generar un efecto en cadena en el que varias empresas relajen sus políticas, señala el estudio.
Qué significa esto para los usuarios
Considera las garantías de seguridad de las herramientas comerciales de generación de imágenes como texto publicitario con notas a pie de página. Si bien pueden intentar de buena fe impedir que personas malintencionadas manipulen sus sistemas, esto es, y siempre ha sido, un juego del gato y el ratón. Los clasificadores funcionan para la mayoría de los usuarios ocasionales la mayor parte del tiempo, pero podrían no detener a quienes estén lo suficientemente decididos.
Si tu rostro está en internet, asume que puede usarse para algo que preferirías evitar. Si descubres imágenes tuyas sin tu consentimiento, utiliza los canales de eliminación de la plataforma e informa a organismos especializados: el servicio Takeitdown del Centro Nacional para Niños Desaparecidos y Explotados en Estados Unidos o la Fundación Internet Watch en el Reino Unido.
¿Qué saben los ciberdelincuentes sobre ti?
Usar Malwarebytes Escaneo gratuito de la huella digital para comprobar si su información personal ha sido expuesta en línea.




