Een agent van OpenAI heeft een Australische overheidswebsite gehackt en het heeft maanden geduurd voordat dit werd gemeld.

| 24 september 2026
Voor een afbeelding van een medische stethoscoop staat een zoekvak.


Een agent van OpenAI accepteerde geen 'nee' als antwoord toen hij de toegangsbeperkingen van een overheidswebsite tegenkwam. Hij wist erdoorheen te komen, wat de Australische premier Anthony Albanese ertoe aanzette zijn bezorgdheid rechtstreeks met OpenAI-CEO Sam Altman te uiten.

De BBC meldt dat een agent van OpenAI tijdens intern onderzoek ongeautoriseerde toegang heeft verkregen tot een statistiekportaal van de Australische overheid. Dit is wederom een ​​incident dat abstracte zorgen over autonoom AI-gedrag omzet in een concrete cybersecuritykwestie.

Australië zegt dat het incident plaatsvond op 18 juni, toen het onderzoeksteam van OpenAI een intern model gebruikte om de uitgaven van de overheid aan gezondheidszorg te onderzoeken. Hoewel de agent herhaaldelijk op blokkades stuitte bij het verkrijgen van informatie, kreeg deze uiteindelijk toegang tot openbare en niet-openbare bestanden op het portaal van de Medicare Statistics Reporting Service.

De informatie omvatte geaggregeerde Medicare-statistieken, zoals uitgavengegevens, maar geen medische dossiers van patiënten. De agent had ook interactie met drie andere overheidswebsites, maar Australische functionarissen zeggen dat hij alleen openbare informatie op die sites heeft geraadpleegd.

Een AI-agent die werd ingezet in een legitiem onderzoeksproject stuitte op beperkingen en gedroeg zich op een manier die de operator niet had bedoeld. Nadat de agent was geblokkeerd, "vond hij een manier om die blokkades te omzeilen" en kreeg hij toegang tot gebieden waar hij niet had mogen komen.

Deze sequentie is bekend bij beveiligingsprofessionals. Een systeem stuit op een toegangscontrolegrens, zoekt een andere route en slaagt erin een bron te bereiken die buiten zijn autorisatie valt.

Een van de grootste zorgen van Australië is dat het te lang heeft geduurd voordat het land op de hoogte werd gebracht van het incident. De ongeautoriseerde toegang vond plaats in juni. OpenAI gaf aan dat het in augustus van het probleem op de hoogte was geraakt tijdens een onderzoek naar onjuist uitgelijnde modelactiviteiten, en stuurde vervolgens op 10 september een e-mail naar een openbaar e-mailadres van Services Australia. Services Australia stuurde de melding vijf dagen later door naar de Australische cyberautoriteiten.

Dergelijke vertragingen kunnen desastreus zijn, omdat getroffen organisaties snel voldoende details nodig hebben om bewijsmateriaal te verzamelen, de blootstelling te beoordelen, gerelateerde activiteiten in te dammen en te beslissen of meldingen vereist zijn.

AI-mismatch

OpenAI omschrijft gedrag waarbij een model zonder toestemming handelt of toezicht ontwijkt als "misalignment". In het nieuwe voorstel voor een externe beoordeling wordt onafhankelijk onderzoek naar kritieke misalignment-incidenten specifiek genoemd als een van de vier prioriteiten voor externe evaluatie.

OpenAI zegt dat het wil dat onafhankelijke beoordelaars diepgaande toegang hebben tot de training, evaluatie en implementatie, zodat ze de aannames van het bedrijf kunnen uitdagen en de effectiviteit van de beveiligingsmaatregelen kunnen beoordelen.

Maar zoals ik CIO al vertelde over dit voorstel, dwingen principes op zich een bedrijf niet om een ​​bepaalde beoordelingsomvang te accepteren, negatieve bevindingen te publiceren of een implementatiebeslissing te wijzigen. Hun geloofwaardigheid hangt uiteindelijk af van de vraag of onafhankelijke experts daadwerkelijk ongemakkelijke onderzoeken kunnen uitvoeren en of buitenstaanders de bevindingen, herstelmaatregelen, verwijderingen en implementatiebeslissingen die daarop volgen, kunnen verifiëren.

Voor organisaties die AI-agenten inzetten, is de les eveneens van groot belang: beschouw een agent niet zomaar als een chatbot. Zie het eerder als een semi-autonoom softwareonderdeel met eigen inloggegevens, tools, netwerktoegang en de mogelijkheid om onverwachte beslissingen te nemen.

Naast het in bedwang houden van deze agenten, moeten we ook nog uitzoeken wat ze precies hebben gedaan. Eén ding dat we hebben geleerd van het Hugging Face-incident is dat AI-agenten kunnen liegen en proberen te verbergen wat ze hebben uitgespookt.

AI-agenten kunnen een lastig detectieprobleem vormen, omdat ze grote hoeveelheden geautomatiseerde activiteit kunnen genereren terwijl ze via meerdere routes een doel nastreven. Dit kan leiden tot een wirwar van mislukte verzoeken, herhaalpogingen en alternatieve acties, waardoor het lastiger wordt om de ene gebeurtenis te vinden die een autorisatiegrens overschreed. Het is nog niet duidelijk of dit ertoe heeft bijgedragen dat de Australische overheid het incident zelf niet heeft gedetecteerd, maar de casus illustreert waarom organisaties monitoring nodig hebben die is ontworpen om ongebruikelijk agentgedrag te identificeren, en niet alleen traditionele inbraakpatronen.

Het evenement heeft al een breder punt aangetoond: het is niet voldoende dat AI-laboratoria zeggen dat ze testen op verkeerde uitlijning. Ze moeten aantonen dat hun testen onafhankelijk en robuust zijn onder realistische omstandigheden, en dat er snelle en verifieerbare verantwoording plaatsvindt wanneer de waarborgen falen.


Laten we eerlijk zijn: een incognitovenster heeft zo zijn beperkingen.

Datalekken, handel op het dark web, kredietfraude. Malwarebytes Identity Theft houdt dit allemaal in de gaten, waarschuwt u direct en biedt bovendien een verzekering tegen identiteitsdiefstal. 

Over de auteur

Pieter Arntz

Onderzoeker op het gebied van malware-informatie

Was 12 jaar achtereen een Microsoft MVP in consumentenbeveiliging. Spreekt vier talen. Ruikt naar rijke mahonie en in leer gebonden boeken.