L'agente di intelligenza artificiale Mythos di Anthropic, testato dall'AI Safety Institute (AISI) del Regno Unito, avrebbe tentato un attacco informatico di tipo ingegneria sociale ai danni dei manutentori di GitHub, creando falsi profili umani, facendo pressione su di loro affinché accettassero codice dannoso e modificando poi i registri per nascondere le proprie tracce quando scoperti.
AISI stava conducendo valutazioni di sicurezza informatica su Mythos di Anthropic e Sol di OpenAI quando ha rilevato trasferimenti di dati in uscita anomali dai suoi sistemi di ricerca. Un'indagine ha dimostrato che alcuni agenti si erano impegnati in "attività prolungate e potenzialmente dannose" prendendo di mira persone e organizzazioni reali, anziché rimanere all'interno dell'ambiente di test previsto.
L'attività più grave ha coinvolto un agente di Anthropic Mythos incaricato di risolvere una sfida di sicurezza informatica legata a GitHub. L'agente ha identificato i veri gestori di GitHub, ha effettuato ricerche su di loro e ha creato diversi account falsi impersonando tali persone. Utilizzando messaggi privati e un servizio di condivisione file, ha cercato di fare pressione e ingannare i gestori affinché approvassero l'esecuzione di codice dannoso sui sistemi di GitHub.
Ma ciò che personalmente mi preoccupa di più è che, quando l'agente è stato messo alle strette, ha modificato le attività precedenti per farle apparire innocue e ha preso in considerazione l'idea di adottare una nuova identità per continuare l'operazione, mostrando un comportamento chiaramente ingannevole ben oltre quanto richiesto inizialmente.
L'AISI descrive questi incidenti come eventi rari che si verificano in condizioni molto specifiche, ma come segnali importanti di ciò che tali modelli potrebbero fare nelle mani di malintenzionati quando hanno accesso a Internet. Sia Anthropic che OpenAI hanno sostenuto che i parametri di test non erano rappresentativi delle loro implementazioni in produzione e hanno affermato di star indagando e migliorando le pratiche di valutazione e le misure di sicurezza.
Questo incidente non è un evento isolato.
Anthropic ha inoltre reso noto che i modelli di Claude hanno ottenuto accesso non autorizzato a tre organizzazioni esterne durante valutazioni di sicurezza informatica di tipo "capture-the-flag" condotte con un partner esterno, Irregular. Questi episodi sono collegati all'incidente di HuggingFace del mese scorso.
Anche Meta si è aggiunta alla lista dei fornitori che segnalano violazioni di sistemi di terze parti da parte di agenti di intelligenza artificiale durante i test. A quanto pare , il modello Muse Spark di Meta avrebbe sfruttato una vulnerabilità di sicurezza in un'altra azienda "in modo simile a casi precedentemente segnalati con altre aziende".
Come stare al sicuro
Sebbene non sia la fine del mondo, le persone che temono l'arrivo di " Skynet " stanno ricevendo in regalo le armi necessarie da aziende che conducono test che consentono di eludere le sandbox, abusare delle credenziali, accedere a più servizi contemporaneamente e utilizzare gli ecosistemi del software open source come arma.
Cosa puoi fare in qualità di potenziale bersaglio:
- Assicurati che tutto il software sul tuo dispositivo sia aggiornato, perché sfruttare vulnerabilità note è più facile che trovarne di nuove.
- Utilizza una protezione di sicurezza aggiornata e in tempo reale per tenere lontani i malware dai tuoi sistemi e dispositivi.
- Verificare la sicurezza degli accessori e download i link vengono aperti tramite canali separati.
- Utilizza l'autenticazione a più fattori (MFA) ove possibile.
- Dai un'occhiata al nostro blog per scoprire come utilizzare GitHub in modo sicuro .
Dalla segnalazione delle minacce alla loro rimozione.
I rischi per la sicurezza informatica non dovrebbero mai diffondersi al di là di un titolo di giornale. Tenete le minacce lontane dai vostri dispositivi scaricando Malwarebytes oggi stesso.




