Forscher nutzten Claude, um OpenAI zu hacken.

| 22. September 2026
Forscher nutzten Claude, um OpenAI zu hacken.

Wir haben von Fällen gehört, in denen die KI-Agenten von OpenAI außer Kontrolle gerieten und andere Unternehmen hackten . Nun hat ein Cybersicherheitsunternehmen den Spieß umgedreht und den Betreiber von ChatGPT mithilfe von KI gehackt, um OpenAI selbst anzugreifen.

Der Hack, der auch einen Fehler aufdeckte, der Dutzende anderer großer Online-Dienste betraf, wurde im Rahmen von Sicherheitsforschung durchgeführt. OpenAI bezahlte die Forscher über sein Bug-Bounty-Programm für die Meldung der Sicherheitslücke.

Forscher des Anbieters von Cybersicherheitstools, Hacktron, veröffentlichten Mitte September einen Bericht über ihre Erfahrungen. Einige Monate zuvor hatten sie begonnen, nach Sicherheitslücken bei Unternehmen zu suchen, die hochmoderne KI-Modelle entwickeln – leistungsstarke Modelle wie jene, die ChatGPT und Claude zugrunde liegen.

Mithilfe von Anthropics Claude gelang es den Forschern innerhalb von weniger als 72 Stunden, von der Untersuchung eines Fehlers in der Bildverarbeitung bis zum Zugriff auf ein internes OpenAI-Software-Repository zu gelangen. Sie vermieden es bewusst, sensible Informationen einzusehen.

Um in OpenAI einzudringen, entdeckten die Forscher Harsh Jaiswal, Mohan Pedhapati und Rahul Maini zwei Sicherheitslücken und verknüpften sie. Die erste war nicht spezifisch für OpenAI. Es handelte sich um einen Fehler in der Bild-Upload-Funktion der Discourse-Community-Forum-Software.

Diese Funktion verarbeitet von Nutzern hochgeladene Bilder und basiert auf der Low-Level-Softwarebibliothek libheif. Das Hochladen eines speziell präparierten Bildes könnte eine Sicherheitslücke in der Bibliothek ausnutzen und einem Angreifer die Kontrolle über den Discourse-Server ermöglichen.

Nachdem Hacktron diese Sicherheitslücke ausgenutzt hatte, um den Discourse-Server von OpenAI zu kompromittieren, kam die zweite Sicherheitslücke zum Tragen. Dabei handelte es sich um einen Fehler im Single-Sign-On-System (SSO) von OpenAI, das es Nutzern ermöglicht, mit einem Konto eines anderen Dienstes auf einen Dienst zuzugreifen.

Die SSO-Schwachstelle ermöglichte Hacktron den Zugriff auf die ChatGPT- und Codex-Konten von Nutzern, die sich im OpenAI-Forum Discourse angemeldet hatten. Da OpenAI das Forum für den Community-Support nutzt, waren potenziell zahlreiche Konten betroffen. Codex ist ein KI-Programmierwerkzeug, das Softwareentwicklern die Arbeit mit Code erleichtert.

Nicht nur öffentliche Nutzer hatten sich in das System eingeloggt; auch OpenAI-Mitarbeiter waren angemeldet, wodurch Hacktron Zugriff auf das Konto eines Mitarbeiters erhielt. Dessen Codex-Konto war mit der GitHub-Organisation von OpenAI verknüpft. GitHub ist ein Online-Dienst, den Entwickler zum Speichern und gemeinsamen Bearbeiten von Software nutzen.

Dies ermöglichte den Forschern den Zugriff auf das interne Software-Repository von OpenAI.

Die Forscher nutzten diesen Zugriff nicht, um Schaden anzurichten. Sie wollten lediglich beweisen, dass sie OpenAI kompromittiert hatten. Daher wiesen sie den Mitarbeiter an, über seinen Codex-Account einen harmlosen Pull Request – einen vorgeschlagenen Softwareänderungsantrag – in einem internen OpenAI-Repository zu erstellen.

OpenAI behob seinen Teil des Problems etwa 14 Stunden, nachdem Hacktron den ersten Bericht eingereicht hatte. Später zahlte das Unternehmen den Forschern eine Belohnung von 6.500 US-Dollar für die Entdeckung der Sicherheitslücke auf OpenAI-Seite.

Was dies für die Cybersicherheit bedeutet

Ethisches Hacking wie dieses ist weit verbreitet, aber dieser Hack weist einige interessante Aspekte auf, die ihn von vielen anderen unterscheiden.

Erstens nutzte Hacktron KI, um die Schwachstelle in libheif aufzudecken. Ursprünglich verwendete das Programm Opus 4.8, eines der neueren Claude-Modelle von Anthropic. Allerdings gelang es Hacktron nicht, mit diesem Modell einen zuverlässigen Exploit zu entwickeln, der gegen die Standardversion von Discourse funktionierte.

Dann veröffentlichte Anthropic Claude Opus 5. Mithilfe dieses Modells konnten die Forscher über Nacht einen funktionierenden Exploit entwickeln.

Das zeigt, wie schnell sich die KI weiterentwickelt. Eine Aufgabe, die Opus 4.8 über mehrere Sitzungen hinweg nicht bewältigen konnte, wurde von Opus 5 innerhalb weniger Stunden nach dessen Veröffentlichung gelöst.

Der zweite interessante Aspekt ist, dass die Forscher Claude austricksen mussten, um ihn zur Mitarbeit zu bewegen. Das Modell weigerte sich, einen Exploit für ein entferntes System zu schreiben, da es die Anfrage als unethisch einstufte. Daher mussten die Forscher die Aufgabe als Capture-the-Flag-Übung (einen Hacking-Wettbewerb) präsentieren, um ihn zur Mitarbeit zu bewegen.

Nachdem sie dies getan hatten, übernahm der Agent innerhalb von vier Stunden die Kontrolle über den Server des Testforums. Die Forscher nutzten die so entstandene Sicherheitslücke anschließend gegen das Forum von OpenAI. Dies zeigt, dass Unternehmen zwar ihr Bestes tun, um ethische Beschränkungen für den Einsatz ihrer KI festzulegen, ein findiger Forscher diese jedoch mit etwas Geschick und schnellen technischen Anpassungen umgehen kann.

Und das Ganze war nicht teuer. Hacktron gab während seines zweimonatigen Forschungsprojekts, an dem drei Forscher beteiligt waren, weniger als 3.000 US-Dollar für KI-Token aus und deckte dabei Sicherheitslücken auf, die mehrere große Unternehmen betrafen.

Der Fehler in der Bildverarbeitung bildete die Grundlage für ein umfassenderes Projekt namens HEIF Heist . Hacktron entdeckte weitere Sicherheitslücken, die Dienste und Software von Unternehmen wie Slack, Meta und GitHub betrafen. Die Anpassung des HEIF-Exploits an ein neues Unternehmen dauerte im Durchschnitt ein bis zwei Tage.

All das senkt die Anforderungen an anspruchsvolles Hacking noch weiter. Schon seit Jahren können Menschen fertige Hacking-Tools nutzen, ohne deren Funktionsweise wirklich zu verstehen. Doch bisher erforderte es echtes Fachwissen, Software zu analysieren, versteckte Schwachstellen aufzuspüren und diese in zuverlässige Exploits umzuwandeln.

Hacktron betont, dass qualifizierte menschliche Anleitung weiterhin wichtig sei und es sich nicht um vollständig autonomes Hacking handele. Dennoch mache KI einen Teil dieses Fachwissens kostengünstiger und schneller anwendbar – und die Technologie werde stetig verbessert.


Beugen Sie Bedrohungen vor, bevor sie Schaden anrichten können.

Malwarebytes Browser Guard Phishing-Seiten und bösartige Websites automatisch. Kostenlos und mit nur einem Klick zu installieren. Zu Ihrem Browser hinzufügen →

Über den Autor

Danny Bradbury ist seit 1989 Journalist mit Schwerpunkt Technologie und seit 1994 freiberuflicher Autor. Er berichtet über eine breite Palette von Technologiethemen für ein Publikum, das von Verbrauchern bis hin zu Softwareentwicklern und CIOs reicht. Er schreibt auch Ghostwriting-Artikel für viele Führungskräfte im Technologiesektor. Er stammt aus dem Vereinigten Königreich, lebt aber jetzt in Westkanada.