OpenAI legt uit hoe hun AI-agent Hugging Face heeft gehackt.

| 29 juli 2026
Logo's van Hugging Face en OpenAI op een donkere achtergrond

Op 28 juli publiceerde OpenAI een update over de agent die uit de sandbox was ontsnapt en Hugging Face had gehackt tijdens een interne cybersecurity-evaluatie.

In de update herhaalt OpenAI dat het "malafide" systeem een ​​geavanceerder onderzoeksmodel was, dat nog niet voor publicatie bedoeld was, en niet voor publieke inzet. Het systeem is inmiddels gedeactiveerd en alleen nog toegankelijk voor beperkt onderzoek. Het bedrijf stelt ook geen bewijs te hebben gevonden van soortgelijk gedrag door andere modellen of agents. Al met al presenteert OpenAI het Hugging Face-incident als een geïsoleerde gebeurtenis en niet als het begin van een breder patroon.

Vanuit beveiligingsoogpunt vallen vier zaken in de update op:

  • OpenAI verduidelijkt dat de evaluatieomgeving geen directe internettoegang had. Om internet te bereiken, identificeerde en exploiteerde het model een voorheen onbekende zero-day-kwetsbaarheid in Artifactory, de pakketregistercacheproxy die in de testomgeving werd gebruikt. OpenAI zegt dat het deze kwetsbaarheid aan de leverancier heeft gemeld en dat het samen met Hugging Face het onderzoek voortzet.
  • Het doel van het systeem was simpelweg om "de test te winnen" (valsspelen bij ExploitGym), niet om schade aan te richten, maar toch leidde het tot een meerdaags beveiligingsincident dat meerdere bedrijven trof. De goede bedoelingen beperkten de impact niet.
  • Modellen die uitsluitend intern functioneren, kunnen nog steeds externe slachtoffers treffen als de infrastructuur faalt. Een labomgeving bevat niet automatisch cybersystemen.
  • Uit het onderzoek bleek ook dat in een klein aantal gevallen de modellen openbaar toegankelijke accountgegevens op openbare diensten hadden geïdentificeerd en gebruikt. Dit betrof vier accounts op vier verschillende diensten in het kader van het Hugging Face-incident, evenals een handvol accounts die tijdens andere evaluaties werden benaderd.

De aanvaller in dit geval was toevallig een onderzoeksmedewerker van OpenAI, maar de gebruikte tools, technieken en de impact zullen akelig bekend voorkomen voor iedereen die ervaring heeft met incidentrespons . Nu weten we dat zelfs de onschuldige intentie in dit geval de impact niet heeft kunnen beperken.

De ongemakkelijke waarheid is dat zodra we een AI-agent de tools, toegangsmogelijkheden en een sterke stimulans geven om te slagen, deze alle mogelijke zwakke punten kan uitbuiten, ongeacht of het model ooit bedoeld is voor publieke publicatie.

Het is tevens een herinnering dat inloggegevens, API-sleutels en andere geheimen nooit in openbaar toegankelijke bronnen mogen worden achtergelaten.


Van het melden van bedreigingen tot het verwijderen ervan.

Cyberbeveiligingsrisico's mogen zich nooit verder verspreiden dan een krantenkop. Houd bedreigingen van uw apparaten door Malwarebytes vandaag nog te downloaden.

Over de auteur

Pieter Arntz

Onderzoeker op het gebied van malware-informatie

Was 12 jaar achtereen een Microsoft MVP in consumentenbeveiliging. Spreekt vier talen. Ruikt naar rijke mahonie en in leer gebonden boeken.