I ricercatori hanno utilizzato Claude per hackerare OpenAI.

| 22 settembre 2026
I ricercatori hanno utilizzato Claude per hackerare OpenAI.

Abbiamo sentito parlare degli agenti di intelligenza artificiale di OpenAI che impazziscono e hackerano altre aziende . Ora, un'azienda di sicurezza informatica ha ribaltato la situazione, usando l'IA per contribuire ad hackerare OpenAI stessa.

L'attacco informatico, che ha anche portato alla luce una vulnerabilità che interessava decine di altri importanti servizi online, è stato condotto a scopo di ricerca sulla sicurezza. OpenAI ha ricompensato i ricercatori per aver segnalato una falla nei suoi sistemi tramite il suo programma di bug bounty.

A metà settembre, i ricercatori di Hacktron, azienda fornitrice di strumenti per la sicurezza informatica, hanno descritto le loro avventure. Qualche mese prima, avevano iniziato a cercare falle di sicurezza nelle aziende che sviluppano modelli di intelligenza artificiale all'avanguardia, ovvero modelli altamente performanti come quelli alla base di ChatGPT e Claude.

Utilizzando Claude di Anthropic, i ricercatori sono passati dall'indagare su una falla nell'elaborazione delle immagini all'accedere a un repository software interno di OpenAI in meno di 72 ore. Hanno deliberatamente evitato di visualizzare informazioni sensibili.

Per penetrare in OpenAI, i ricercatori Harsh Jaiswal, Mohan Pedhapati e Rahul Maini hanno individuato due vulnerabilità e le hanno collegate tra loro. La prima non era specifica di OpenAI, ma riguardava un bug in una funzionalità di caricamento immagini del software del forum della community Discourse.

Questa funzionalità elabora le immagini caricate dagli utenti e si basa su una libreria software di basso livello chiamata libheif. Il caricamento di un'immagine appositamente creata potrebbe attivare una vulnerabilità nella libreria, consentendo a un utente malintenzionato di ottenere il controllo del server Discourse.

Dopo che Hacktron ha sfruttato quella vulnerabilità per compromettere il server Discourse di OpenAI, è emersa una seconda vulnerabilità. Si trattava di un difetto nel sistema di single sign-on (SSO) di OpenAI, che consente agli utenti di accedere a un servizio utilizzando un account di un altro servizio.

La falla nel sistema SSO ha consentito a Hacktron di accedere agli account ChatGPT e Codex di persone che avevano effettuato l'accesso al forum Discourse di OpenAI. OpenAI utilizza il forum per il supporto alla community, quindi potenzialmente un gran numero di account erano compromessi. Codex è uno strumento di programmazione per l'intelligenza artificiale che aiuta gli sviluppatori di software a lavorare con il codice.

Non erano solo gli utenti pubblici ad aver effettuato l'accesso a questo sistema; anche i dipendenti di OpenAI erano connessi, consentendo a Hacktron di accedere all'account di un dipendente. L'account Codex di quella persona era collegato all'organizzazione GitHub di OpenAI. GitHub è un servizio online che gli sviluppatori utilizzano per archiviare e collaborare allo sviluppo di software.

Ciò ha consentito ai ricercatori di accedere al repository software interno di OpenAI.

I ricercatori non hanno fatto nulla di dannoso con quell'accesso. Volevano solo dimostrare di aver compromesso OpenAI. Quindi hanno dato istruzioni all'account Codex del dipendente di creare una pull request innocua, ovvero una proposta di modifica del software, in un repository interno di OpenAI.

OpenAI ha risolto la sua parte del problema circa 14 ore dopo che Hacktron aveva inviato la sua segnalazione iniziale. In seguito, ha pagato ai ricercatori una ricompensa di 6.500 dollari per aver individuato la falla nel sistema di OpenAI.

Cosa significa questo per la sicurezza informatica

L'hacking etico come questo è comune, ma ci sono alcuni aspetti interessanti in questo caso che lo distinguono da molti altri.

Il primo punto è che Hacktron ha utilizzato l'intelligenza artificiale per supportare i suoi sforzi. Inizialmente ha utilizzato Opus 4.8, uno dei recenti modelli Claude di Anthropic, per scoprire la vulnerabilità in libheif. Tuttavia, non è stato possibile utilizzare il modello per creare un exploit affidabile che funzionasse contro la versione predefinita di Discourse.

Successivamente, Anthropic ha rilasciato Claude Opus 5. Utilizzando quel modello, i ricercatori sono stati in grado di creare un exploit funzionante nel giro di una notte.

Questo dimostra la rapidità con cui si sta evolvendo l'intelligenza artificiale. Un compito che Opus 4.8 non era riuscito a completare in diverse sessioni è stato risolto da Opus 5 a poche ore dal suo rilascio.

Il secondo aspetto interessante è che i ricercatori hanno dovuto ingannare Claude per convincerlo ad aiutarli. Il modello si è rifiutato di scrivere un exploit per un sistema remoto perché considerava la richiesta non etica. Quindi i ricercatori hanno dovuto presentare il compito come un esercizio di "cattura la bandiera" (una competizione di hacking) per convincerlo a collaborare.

Una volta fatto ciò, l'agente ha preso il controllo del server del forum di prova entro quattro ore. I ricercatori hanno quindi utilizzato l'exploit risultante contro il forum di OpenAI. Questo dimostra che, sebbene le aziende possano fare del loro meglio per imporre vincoli etici all'uso della loro IA, un ricercatore astuto può comunque aggirarli con alcune semplici tecniche di prompt engineering.

E non è costato molto. Hacktron ha speso meno di 3.000 dollari in token AI durante il suo progetto di ricerca di due mesi, che ha coinvolto tre ricercatori e ha portato alla luce vulnerabilità che interessano diverse grandi aziende.

La vulnerabilità di elaborazione delle immagini è diventata la base di un progetto più ampio chiamato HEIF Heist . Hacktron ha scoperto falle di sicurezza correlate che interessavano servizi e software di aziende come Slack, Meta e GitHub. Modificare l'exploit HEIF per colpire una nuova azienda richiedeva in media uno o due giorni.

Tutto ciò abbassa ulteriormente la soglia di difficoltà per l'hacking sofisticato. Da anni è possibile utilizzare strumenti di hacking preconfezionati senza comprenderne realmente il funzionamento, ma in passato era necessaria una vera competenza per analizzare a fondo un software, individuare le vulnerabilità nascoste e trasformarle in exploit affidabili.

Hacktron afferma che la guida umana qualificata è rimasta importante e che non si è trattato di hacking completamente autonomo. Ciononostante, l'intelligenza artificiale sta rendendo parte di questa competenza più economica e veloce da applicare, e i risultati sono destinati a migliorare ulteriormente.


Blocca le minacce prima che possano causare danni.

Malwarebytes Browser Guard automaticamente le pagine di phishing e i siti dannosi. È gratuito e si installa con un solo clic. Aggiungilo al tuo browser →

Informazioni sull'autore

Danny Bradbury è giornalista specializzato in tecnologia dal 1989 e scrittore freelance dal 1994. Si occupa di un'ampia gamma di argomenti tecnologici per un pubblico che va dai consumatori agli sviluppatori di software e ai CIO. Inoltre, scrive articoli per molti dirigenti del settore tecnologico. È originario del Regno Unito, ma ora vive nel Canada occidentale.