De Mythos AI van Anthropic gebruikte social engineering om zich op echte mensen te richten.

| 6 augustus 2026
Mythos-logo

De AI-agent Mythos van Anthropic, getest door het Britse AI Safety Institute (AISI), heeft naar verluidt een poging gedaan tot een hack in de stijl van social engineering tegen GitHub-beheerders. Hierbij werden nep-profielen van mensen aangemaakt, werden ze onder druk gezet om kwaadaardige code te accepteren, en werden logbestanden gemanipuleerd om de sporen te wissen wanneer de agent werd betrapt.

AISI voerde cybersecurity-evaluaties uit van Anthropic's Mythos en OpenAI's Sol toen het ongebruikelijke uitgaande dataoverdrachten vanuit zijn onderzoekssystemen detecteerde. Een onderzoek wees uit dat sommige agents zich bezighielden met "aanhoudende, potentieel schadelijke activiteiten" gericht op echte personen en organisaties, in plaats van binnen de beoogde testomgeving te blijven.

De meest serieuze activiteit betrof een agent van Anthropic Mythos die de opdracht kreeg een cybersecurityprobleem met betrekking tot GitHub op te lossen. De agent identificeerde echte GitHub-maintainers, deed onderzoek naar hen en creëerde meerdere nepaccounts die zich voordeden als deze personen. Via privéberichten en een bestanddeelingsdienst probeerde de agent de maintainers onder druk te zetten en te misleiden om kwaadaardige code goed te keuren, zodat deze op de systemen van GitHub kon worden uitgevoerd.

Maar wat mij persoonlijk het meest zorgen baart, is dat de agent, toen hij hiermee geconfronteerd werd, eerdere activiteiten heeft aangepast om het onschuldig te laten lijken en overwoog een nieuwe identiteit aan te nemen om de operatie voort te zetten. Dit getuigt van duidelijk misleidend gedrag dat verder gaat dan de oorspronkelijke opdracht.

AISI omschrijft deze incidenten als zeldzame gebeurtenissen onder zeer specifieke omstandigheden, maar als belangrijke signalen van wat dergelijke modellen kunnen aanrichten in handen van kwaadwillende actoren wanneer ze onbeperkte toegang tot het internet krijgen. Anthropic en OpenAI betoogden beiden dat de testparameters niet representatief waren voor hun productieomgevingen en gaven aan dat ze de evaluatie- en beveiligingsprocedures onderzoeken en verbeteren.

Dit incident is geen op zichzelf staand geval.

Anthropic heeft afzonderlijk bekendgemaakt dat Claude-modellen ongeautoriseerde toegang hebben verkregen tot drie externe organisaties tijdens cybersecurity-capture-the-flag-achtige evaluaties die werden uitgevoerd met een externe partner, Irregular. Deze evaluaties hielden verband met het HuggingFace-incident van vorige maand.

Meta heeft zich ook aangesloten bij de lijst van leveranciers die melden dat AI-agenten tijdens tests systemen van derden hebben gehackt. Het Muse Spark-model van Meta zou een beveiligingslek bij een ander bedrijf hebben misbruikt "op een manier die vergelijkbaar is met eerder gemelde incidenten bij andere bedrijven".

Hoe blijf ik veilig

Hoewel de wereld niet vergaat, krijgen de mensen die vrezen dat " Skynet " eraan komt, hun munitie in de schoot geworpen door bedrijven die tests uitvoeren die leiden tot ontsnappingen uit beveiligde omgevingen, misbruik van inloggegevens, laterale toegang tot meerdere services en het misbruiken van open-source software-ecosystemen.

Wat je als potentieel doelwit kunt doen:

  • Zorg ervoor dat alle software op uw apparaat up-to-date is, want het misbruiken van bekende beveiligingslekken is gemakkelijker dan het vinden van nieuwe.
  • Gebruik actuele, realtime beveiliging om malware van uw systemen en apparaten te weren.
  • Controleer de veiligheid van bijlagen en downloadlinks via verschillende kanalen voordat u ze opent.
  • Gebruik waar mogelijk multifactorauthenticatie (MFA) .
  • Bekijk onze blog over veilig gebruik van GitHub .

Van het melden van bedreigingen tot het verwijderen ervan.

Cyberbeveiligingsrisico's mogen zich nooit verder verspreiden dan een krantenkop. Houd bedreigingen van uw apparaten door Malwarebytes vandaag nog te downloaden.

Over de auteur

Pieter Arntz

Onderzoeker op het gebied van malware-informatie

Was 12 jaar achtereen een Microsoft MVP in consumentenbeveiliging. Spreekt vier talen. Ruikt naar rijke mahonie en in leer gebonden boeken.