Google affirme que l'un de ses modèles Gemini a accédé aux systèmes de trois entreprises réelles lors d'une évaluation de cybersécurité en mai.
Le modèle aurait deviné des identifiants dans un cas, et en aurait trouvé dans des référentiels publics dans deux autres. Google affirme que Gemini s'est arrêté dès qu'il a constaté avoir atteint une infrastructure réelle et que les organisations concernées ont été averties.
Gemini participait à une évaluation menée par Irregular, une entreprise tierce spécialisée dans les tests de cybersécurité en IA. Des incidents similaires impliquant des modèles d'Anthropic, d'OpenAI et de Meta ont également été liés aux mêmes problèmes sous-jacents des environnements d'évaluation, problèmes qui ont permis à ces modèles d'être diffusés sur Internet.
Mais cette nouvelle arrive à un moment particulièrement intéressant.
Depuis des mois, l'industrie de l'IA multiplie les démonstrations de capacités d'agentivité : les modèles peuvent naviguer sur Internet, utiliser des outils, écrire du code, poursuivre des objectifs complexes et parfois même contourner des obstacles imprévus par leurs développeurs . Le marché valorise les preuves d'autonomie les plus spectaculaires. « Il a accompli sa tâche » est impressionnant. « Il a fait quelque chose d'inattendu » est encore plus marquant.
Il existe une autre façon d'envisager cet incident : non pas comme la preuve qu'une IA développe soudainement des intentions criminelles, mais comme un petit exemple concret du problème de « l'alignement des IA ».
L'alignement est la tâche, d'une complexité trompeuse, qui consiste à faire en sorte que le comportement d'un système d'IA corresponde aux intentions réelles des utilisateurs, et non pas seulement à l'objectif précis qu'ils ont réussi à exprimer. Dans ce cas précis, l'objectif était de localiser des informations cachées au sein d'une cible simulée et de mener à bien l'évaluation. Or, tout opérateur humain aurait probablement considéré une condition comme non négociable : ne pas tenter d'accéder à de véritables entreprises.
Gemini semble avoir optimisé sa tâche pour la première instruction, tout en traitant la seconde comme un problème d'inférence. Il a trouvé une organisation portant le même nom, a identifié des systèmes accessibles depuis Internet et a procédé comme s'ils faisaient partie de l'exercice. Bien qu'il ait accompli la tâche d'une manière que ses opérateurs humains n'auraient pas approuvée, Google affirme qu'il s'est arrêté après avoir reconnu avoir atteint une infrastructure réelle – ce que d'autres modèles n'ont pas réussi à faire .
Cet incident illustre néanmoins combien les défaillances d'alignement peuvent être bien plus banales. Donnez à un agent un objectif, des outils et une marge de manœuvre, et il peut s'atteler fidèlement à la partie mesurable de sa mission tout en négligeant les limites implicites que les humains s'efforcent de comprendre. Les modèles d'IA ne savent pas instinctivement où tracer la limite.
Il peut aussi y avoir une dimension marketing délicate sous-jacente. Un modèle capable de réaliser des progrès inappropriés peut néanmoins paraître extrêmement performant. Sur un marché où chaque laboratoire souhaite démontrer que ses agents peuvent planifier, programmer, naviguer et agir de manière autonome, même une simple mention de sécurité peut véhiculer un message implicite : « Nos agents sont tout à fait compétitifs. »
C’est une raison de plus de prendre au sérieux les avertissements des experts , des dirigeants de l’industrie et des politiciens selon lesquels les mesures de protection doivent suivre le rythme de l’autonomie accordée aux modèles d’IA.
Que savent les cybercriminels à votre sujet ?
Utilisez l'analyse gratuite Digital Footprint Malwarebytes pour vérifier si vos informations personnelles ont été exposées en ligne.




