Onderzoekers gebruikten Claude om OpenAI te hacken.

| 22 september 2026
Onderzoekers gebruikten Claude om OpenAI te hacken.

We hebben al gehoord dat de AI-agenten van OpenAI amok maken en andere bedrijven hacken . Nu heeft een cybersecuritybedrijf de rollen omgedraaid door AI in te zetten om OpenAI zelf te hacken.

De hack, die ook een bug aan het licht bracht die tientallen andere grote online diensten trof, werd uitgevoerd als beveiligingsonderzoek. OpenAI betaalde de onderzoekers via hun bug bounty-programma voor het melden van een kwetsbaarheid in hun systemen.

Onderzoekers van Hacktron, een leverancier van cybersecuritytools, beschreven hun bevindingen medio september. Een paar maanden eerder waren ze begonnen met het zoeken naar beveiligingslekken bij bedrijven die geavanceerde AI-modellen ontwikkelen, zeer krachtige modellen zoals die welke ChatGPT en Claude aandrijven.

Met behulp van Anthropic's Claude konden de onderzoekers binnen 72 uur van het onderzoeken van een fout in de beeldverwerking overstappen naar toegang tot een interne softwareopslagplaats van OpenAI. Ze vermeden bewust het bekijken van gevoelige informatie.

Om toegang te krijgen tot OpenAI, ontdekten de onderzoekers Harsh Jaiswal, Mohan Pedhapati en Rahul Maini twee kwetsbaarheden en koppelden deze aan elkaar. De eerste was niet specifiek voor OpenAI. Het betrof een bug in een functie voor het uploaden van afbeeldingen in de Discourse-communityforumsoftware.

Deze functie verwerkt door gebruikers geüploade afbeeldingen en is afhankelijk van een softwarebibliotheek op laag niveau genaamd libheif. Het uploaden van een speciaal geprepareerde afbeelding kan een kwetsbaarheid in de bibliotheek activeren, waardoor een aanvaller de controle over de Discourse-server kan overnemen.

Nadat Hacktron die kwetsbaarheid had gebruikt om de Discourse-server van OpenAI te compromitteren, kwam de tweede kwetsbaarheid aan het licht. Dit was een fout in het single sign-on (SSO)-systeem van OpenAI, waarmee gebruikers toegang krijgen tot de ene dienst met een account van een andere dienst.

Het SSO-lek gaf Hacktron toegang tot de ChatGPT- en Codex-accounts van mensen die waren ingelogd op het Discourse-forum van OpenAI. OpenAI gebruikt het forum voor communityondersteuning, dus dat betrof potentieel een groot aantal accounts. Codex is een AI-codeertool die softwareontwikkelaars helpt bij het werken met code.

Niet alleen publieke gebruikers hadden zich aangemeld bij dit systeem; ook medewerkers van OpenAI waren ingelogd, waardoor Hacktron toegang kreeg tot het account van één medewerker. Het Codex-account van die persoon was gekoppeld aan de GitHub-organisatie van OpenAI. GitHub is een online dienst die ontwikkelaars gebruiken om software op te slaan en eraan samen te werken.

Dit gaf de onderzoekers toegang tot de interne softwareopslagplaats van OpenAI.

De onderzoekers hebben met die toegang niets schadelijks gedaan. Ze wilden alleen bewijzen dat ze OpenAI hadden gehackt. Daarom gaven ze het Codex-account van de medewerker de opdracht om een ​​onschadelijk pull-verzoek – een voorgestelde softwarewijziging – aan te maken in een interne OpenAI-repository.

OpenAI loste zijn deel van het probleem ongeveer 14 uur nadat Hacktron zijn eerste rapport had ingediend op. Later betaalde het de onderzoekers een beloning van $6.500 voor de fout aan de OpenAI-kant.

Wat dit betekent voor cyberbeveiliging

Ethisch hacken zoals dit komt veel voor, maar deze specifieke hack kent een aantal interessante aspecten die hem onderscheiden van vele andere.

Ten eerste maakte Hacktron gebruik van AI om het probleem te verhelpen. Oorspronkelijk gebruikten ze Opus 4.8, een van Anthropics recente Claude-modellen, om het probleem in libheif te ontdekken. Maar ze konden het model niet gebruiken om een ​​betrouwbare exploit te ontwikkelen die werkte tegen de standaardversie van Discourse.

Vervolgens bracht Anthropic Claude Opus 5 uit. Met behulp van dat model konden de onderzoekers binnen een nacht een werkende exploit ontwikkelen.

Dat laat zien hoe snel AI zich ontwikkelt. Een taak die Opus 4.8 in meerdere sessies niet had kunnen voltooien, werd door Opus 5 binnen enkele uren na de release opgelost.

Het tweede interessante aspect is dat de onderzoekers Claude moesten misleiden om hem zover te krijgen dat hij meewerkte. Het model weigerde een exploit te schrijven voor een extern systeem, omdat het de vraag onethisch vond. De onderzoekers moesten de taak daarom presenteren als een capture-the-flag-oefening (een hackwedstrijd) om hem over te halen mee te werken.

Toen ze dat deden, nam de agent binnen vier uur de server van het testforum over. De onderzoekers gebruikten de ontstane kwetsbaarheid vervolgens tegen het forum van OpenAI. Dit laat zien dat, hoewel bedrijven hun best doen om ethische beperkingen op te leggen aan het gebruik van hun AI, een slimme onderzoeker die nog steeds kan omzeilen met een paar simpele prompt-engineeringtrucs.

En het kostte niet veel om dit te doen. Hacktron besteedde minder dan $3.000 aan AI-tokens tijdens het twee maanden durende onderzoeksproject, waarbij drie onderzoekers betrokken waren en kwetsbaarheden aan het licht kwamen die verschillende grote bedrijven troffen.

De bug in de beeldverwerking vormde de basis voor een groter project genaamd HEIF Heist . Hacktron ontdekte verwante beveiligingslekken in diensten en software van bedrijven zoals Slack, Meta en GitHub. Het aanpassen van de HEIF-exploit om een ​​nieuw bedrijf aan te vallen duurde gemiddeld een dag of twee.

Dit alles verlaagt de drempel voor geavanceerd hacken nog verder. Mensen konden jarenlang kant-en-klare hacktools gebruiken zonder echt te begrijpen hoe ze werkten, maar het vergde echte expertise om software te doorgronden, verborgen fouten te vinden en deze om te zetten in betrouwbare exploits.

Hacktron stelt dat deskundige menselijke begeleiding nog steeds belangrijk was en dat dit geen volledig autonoom hacken was. Desondanks maakt AI een deel van die expertise goedkoper en sneller toepasbaar – en het wordt alleen maar beter.


Voorkom bedreigingen voordat ze schade kunnen aanrichten.

Malwarebytes Browser Guard automatisch phishingpagina’s en schadelijke websites. Gratis en met één klik te installeren. Voeg het toe aan je browser →

Over de auteur

Danny Bradbury is sinds 1989 journalist gespecialiseerd in technologie en sinds 1994 freelance schrijver. Hij behandelt een breed scala aan technologische onderwerpen voor doelgroepen variërend van consumenten tot softwareontwikkelaars en CIO's. Hij schrijft ook als ghostwriter artikelen voor veel C-suite business executives in de technologiesector. Hij komt uit het Verenigd Koninkrijk maar woont nu in West-Canada.