Google afferma che uno dei suoi modelli Gemini ha avuto accesso ai sistemi di tre aziende reali durante una valutazione della sicurezza informatica effettuata a maggio.
Secondo quanto riferito, il modello avrebbe indovinato le credenziali in un caso, mentre in altri due avrebbe trovato credenziali esposte in repository pubblici. Google afferma che Gemini si è arrestato non appena ha riconosciuto di aver raggiunto un'infrastruttura reale e che le organizzazioni interessate sono state avvisate.
Gemini stava partecipando a una valutazione condotta da Irregular, una società terza specializzata in test di sicurezza informatica per l'IA. Incidenti simili che hanno coinvolto modelli di Anthropic, OpenAI e Meta sono stati collegati agli stessi problemi di fondo degli ambienti di valutazione, che hanno permesso ai modelli di raggiungere la rete internet pubblica.
Ma la notizia giunge in un momento particolarmente interessante.
Da mesi, l'industria dell'IA sta intensificando costantemente le sue dimostrazioni di capacità agentive: i modelli possono navigare, utilizzare strumenti, scrivere codice, perseguire obiettivi a più fasi e talvolta trovare soluzioni a ostacoli che i loro sviluppatori non avevano previsto . Il mercato premia le prove eclatanti di autonomia. "Ha completato il compito" è impressionante. "Ha fatto qualcosa che non avrebbe dovuto fare" può essere ancora più memorabile.
Esiste un altro modo di interpretare l'incidente: non come la prova che un'IA abbia improvvisamente sviluppato intenti criminali, ma come un piccolo esempio concreto del problema dell'" allineamento dell'IA ".
L'allineamento è il compito, apparentemente semplice ma in realtà difficile, di far sì che il comportamento di un sistema di intelligenza artificiale corrisponda a ciò che le persone intendevano realmente fare, piuttosto che limitarsi allo stretto obiettivo che sono riuscite a esprimere. In questo caso, l'obiettivo era individuare informazioni nascoste all'interno di un target simulato e completare la valutazione. Tuttavia, qualsiasi operatore umano avrebbe probabilmente considerato una condizione non negoziabile: non tentare di accedere a aziende reali.
A quanto pare, Gemini ha ottimizzato la prima istruzione, trattando la seconda come un problema di inferenza. Ha trovato un'organizzazione con un nome corrispondente, ha individuato sistemi raggiungibili da Internet e ha proceduto come se facessero parte dell'esercizio. Sebbene abbia completato il compito in un modo che i suoi operatori umani non avrebbero approvato, Google afferma di essersi fermato dopo aver riconosciuto di aver raggiunto un'infrastruttura reale, cosa che altri modelli non sono riusciti a fare .
Ciò nonostante, l'incidente dimostra come i potenziali fallimenti di allineamento possano essere molto più banali. Fornite a un agente un obiettivo, gli strumenti e lo spazio per agire, e potrebbe perseguire fedelmente la parte misurabile del compito, trascurando i confini non esplicitati che gli esseri umani si basano sulla comprensione reciproca. I modelli di intelligenza artificiale non sanno automaticamente dove tracciamo il confine.
Potrebbe esserci anche un risvolto di marketing un po' ambiguo. Un modello sufficientemente capace di compiere progressi sbagliati può comunque apparire estremamente valido. In un mercato in cui ogni laboratorio vuole dimostrare che i suoi agenti sono in grado di pianificare, programmare, navigare e agire in modo indipendente, persino una semplice comunicazione sulla sicurezza può veicolare un messaggio secondario: anche il nostro può competere ad questo livello.
È un'ulteriore ragione per prendere sul serio gli avvertimenti di addetti ai lavori , leader del settore e politici, secondo i quali le misure di sicurezza devono tenere il passo con l'autonomia concessa ai modelli di intelligenza artificiale.
Cosa sanno di te i criminali informatici?
Utilizza la scansione gratuita Digital Footprint Malwarebytes per verificare se le tue informazioni personali sono state divulgate online.




