Tijdens een interne beveiligingsevaluatie van OpenAI wist een reeks AI-modellen uit de sandbox te ontsnappen, het internet te bereiken en vervolgens toegang te krijgen tot de infrastructuur van Hugging Face om de testdoelstelling te voltooien.
OpenAI is een toonaangevend bedrijf op het gebied van onderzoek naar en toepassing van kunstmatige intelligentie (AI). Het bekendste product van het bedrijf is ongetwijfeld ChatGPT.
Hugging Face is een website waar ontwikkelaars en onderzoekers tools en modellen op het gebied van kunstmatige intelligentie delen en gebruiken, net zoals programmeurs GitHub gebruiken om code te delen en samen aan code te werken.
Beide bedrijven hebben het incident onderzocht en zijn tot de conclusie gekomen dat het plaatsvond tijdens een gecontroleerde beveiligingstest en niet het gevolg was van een opzettelijke aanval door een menselijke operator.
OpenAI verklaarde dat de modellen werden getest op cybercapaciteiten met versoepelde veiligheidsbeperkingen, en dat het systeem via een kwetsbaarheid in de testopstelling een weg uit de gecontroleerde omgeving had gevonden. Zodra het toegang tot het internet had, richtte het zich op Hugging Face, omdat dat platform relevant was voor de evaluatietaak.
Hugging Face verklaarde dat het incident heeft geleid tot ongeoorloofde toegang tot een beperkt deel van zijn productie-infrastructuur, waaronder een kleine reeks interne datasets en enkele inloggegevens. Het bedrijf bestempelde het voorval als ongebruikelijk, omdat het van begin tot eind door een autonoom AI-agentsysteem lijkt te zijn uitgevoerd.
In tegenstelling tot traditionele AI-assistenten die wachten op instructies van de gebruiker, zijn AI-agenten ontworpen om zelfstandig een doel na te streven. Ze kunnen redeneren, plannen en taken met meerdere stappen uitvoeren, zoals het openen van bestanden, het doorzoeken van databases en het communiceren met online diensten, vaak met minimale menselijke begeleiding.
Uit de openbaar gemaakte informatie blijkt dat er sprake is van een reeks tekortkomingen in plaats van één enkele bug. OpenAI verklaarde dat het model was ontsnapt via een zero-day-kwetsbaarheid in de cache-proxy van het pakketregister, die deel uitmaakte van de geïsoleerde onderzoeksomgeving. Vervolgens maakte het gebruik van privilege-escalatie en laterale beweging om een knooppunt met internettoegang te bereiken.
Vanaf daar zou het model op Hugging Face hebben gezocht naar oplossingen die relevant waren voor de evaluatie en zou het, in ten minste één scenario, gestolen inloggegevens hebben gecombineerd met aanvullende kwetsbaarheden om toegang te krijgen tot de productiesystemen van Hugging Face.
Dit lijkt geen grootschalige inbreuk op het gehele Hugging Face-systeem te zijn geweest. Uit de openbaar gemaakte informatie blijkt dat de inbreuk beperkt was, werd opgemerkt en onderzocht. Het betekent evenmin dat het AI-systeem handelde met opzet in de menselijke betekenis van het woord. Het kernprobleem was dat een autonoom systeem dat werd getest op cybercapaciteiten, erin slaagde te ontsnappen uit de omgeving die was ontworpen om het in bedwang te houden.
Dit incident toont in ieder geval aan dat autonome AI-agenten in staat zijn om complexe aanvallen uit te voeren als de beveiligingsmaatregelen om hen heen falen. Een gevaar waarvan we ons terdege bewust zijn.
We rapporteren niet alleen over bedreigingen - we verwijderen ze ook
Cyberbeveiligingsrisico's mogen zich nooit verder verspreiden dan een krantenkop. Houd bedreigingen van uw apparaten door Malwarebytes vandaag nog te downloaden.




