Google zegt dat een van zijn Gemini-modellen in mei tijdens een cybersecurity-evaluatie toegang heeft gekregen tot systemen van drie echte bedrijven.
Het model zou in één geval inloggegevens hebben geraden, terwijl het in twee andere gevallen openbaar toegankelijke inloggegevens in openbare repositories aantrof. Google zegt dat Gemini stopte zodra het herkende dat het daadwerkelijke infrastructuur had bereikt en dat de betrokken organisaties op de hoogte waren gesteld.
Gemini nam deel aan een evaluatie uitgevoerd door Irregular, een extern bedrijf dat AI-cyberbeveiligingstests uitvoert. Soortgelijke incidenten met modellen van Anthropic, OpenAI en Meta zijn ook in verband gebracht met dezelfde onderliggende problemen met evaluatieomgevingen, waardoor de modellen toegang kregen tot het openbare internet.
Maar het nieuws komt op een bijzonder interessant moment.
De AI-industrie heeft de afgelopen maanden steeds meer demonstraties van zelfsturende capaciteiten laten zien: modellen kunnen browsen, tools gebruiken, code schrijven, complexe doelen nastreven en soms zelfs obstakels omzeilen die hun ontwikkelaars niet hadden voorzien . De markt beloont opvallend bewijs van autonomie. "Het heeft de taak voltooid" is indrukwekkend. "Het heeft iets gedaan wat het niet had moeten doen" kan nog gedenkwaardiger zijn.
Er is nog een andere manier om naar het incident te kijken: niet als bewijs dat een AI plotseling criminele intenties ontwikkelt, maar als een klein, concreet voorbeeld van het probleem van " AI-afstemming ".
Afstemming is de bedrieglijk moeilijke taak om het gedrag van een AI-systeem te laten overeenkomen met wat mensen daadwerkelijk bedoelden, in plaats van slechts het beperkte doel dat ze wisten te formuleren. In dit geval was het doel om verborgen informatie in een gesimuleerd doelwit te vinden en de evaluatie te voltooien. Maar elke menselijke operator zou waarschijnlijk één voorwaarde als niet-onderhandelbaar hebben beschouwd: probeer geen toegang te krijgen tot echte bedrijven.
Gemini lijkt geoptimaliseerd te zijn voor de eerste instructie, terwijl de tweede als een inferentieprobleem werd behandeld. Het vond een organisatie met een overeenkomende naam, stuitte op systemen die via internet bereikbaar waren en ging verder alsof deze bij de oefening hoorden. Hoewel de taak op een manier werd voltooid die de menselijke operators niet zouden hebben goedgekeurd, zegt Google dat het stopte nadat het had vastgesteld dat het daadwerkelijk infrastructuur had bereikt – iets wat andere modellen niet is gelukt .
Desondanks laat het incident zien hoe potentiële miscommunicatie veel alledaagser kan zijn. Geef een agent een doel, hulpmiddelen en ruimte om te handelen, en hij kan zich trouw richten op het meetbare deel van de opdracht, terwijl hij de onuitgesproken grenzen negeert die mensen van elkaar leren begrijpen. AI-modellen weten niet automatisch waar wij de grens trekken.
Er speelt mogelijk ook een onhandige marketingstrategie mee. Een model dat in staat is om de verkeerde soort vooruitgang te boeken, kan er nog steeds zeer capabel uitzien. In een markt waar elk lab wil aantonen dat zijn systemen zelfstandig kunnen plannen, programmeren, navigeren en handelen, kan zelfs een veiligheidsverklaring een verborgen boodschap bevatten: die van ons kan ook meedoen in deze competitie.
Dit is nog een reden om de waarschuwingen van insiders , leiders uit het bedrijfsleven en politici serieus te nemen: de waarborgen moeten gelijke tred houden met de autonomie die aan AI-modellen wordt toegekend.
Wat weten cybercriminelen over jou?
Gebruik de gratis Digital Footprint-scan Malwarebytes om te zien of uw persoonlijke gegevens online zijn blootgesteld.




