Já ouvimos falar dos agentes de IA da OpenAI causando problemas e invadindo outras empresas . Agora, uma empresa de cibersegurança deu a volta por cima e usou IA para ajudar a invadir a própria OpenAI.
O ataque, que também expôs uma falha que afetava dezenas de outros grandes serviços online, foi realizado como parte de uma pesquisa de segurança. A OpenAI pagou aos pesquisadores por relatarem uma falha em seus sistemas por meio de seu programa de recompensas por bugs.
Pesquisadores da Hacktron, fornecedora de ferramentas de cibersegurança, descreveram suas descobertas em meados de setembro. Alguns meses antes, eles haviam começado a procurar falhas de segurança em empresas que desenvolvem modelos de IA de ponta, como os que alimentam o ChatGPT e o Claude.
Utilizando o Claude da Anthropic, os pesquisadores passaram de investigar uma falha no processamento de imagens a acessar um repositório interno de software da OpenAI em menos de 72 horas. Eles evitaram deliberadamente visualizar informações confidenciais.
Para invadir o sistema da OpenAI, os pesquisadores Harsh Jaiswal, Mohan Pedhapati e Rahul Maini encontraram duas vulnerabilidades e as encadearam. A primeira não era específica da OpenAI. Envolvia um bug em um recurso de upload de imagens no software do fórum comunitário Discourse.
Essa funcionalidade processa imagens enviadas pelos usuários e depende de uma biblioteca de software de baixo nível chamada libheif. O envio de uma imagem especialmente criada pode explorar uma falha na biblioteca, permitindo que um invasor obtenha controle do servidor Discourse.
Depois que a Hacktron explorou essa vulnerabilidade para comprometer o servidor Discourse da OpenAI, a segunda vulnerabilidade entrou em ação. Tratava-se de uma falha no sistema de autenticação única (SSO) da OpenAI, que permite que usuários acessem um serviço utilizando uma conta de outro.
A falha no SSO permitiu que a Hacktron acessasse as contas do ChatGPT e do Codex de pessoas que haviam feito login no fórum Discourse da OpenAI. A OpenAI usa o fórum para suporte à comunidade, então isso potencialmente abrangia um grande número de contas. O Codex é uma ferramenta de codificação de IA que ajuda desenvolvedores de software a trabalhar com código.
Não eram apenas usuários públicos que haviam acessado o sistema; funcionários da OpenAI também estavam conectados, permitindo que a Hacktron acessasse a conta de um deles. A conta Codex dessa pessoa estava vinculada à organização GitHub da OpenAI. O GitHub é um serviço online que desenvolvedores usam para armazenar e colaborar em softwares.
Isso deu aos pesquisadores acesso ao repositório de software interno da OpenAI.
Os pesquisadores não fizeram nada prejudicial com esse acesso. Eles só queriam provar que haviam comprometido a OpenAI. Então, instruíram a conta Codex do funcionário a criar uma solicitação de pull request inofensiva — uma proposta de alteração de software — em um repositório interno da OpenAI.
A OpenAI corrigiu sua parte do problema cerca de 14 horas após a Hacktron ter enviado seu relatório inicial. Posteriormente, pagou aos pesquisadores uma recompensa de US$ 6.500 pela falha do lado da OpenAI.
O que isso significa para a cibersegurança?
Técnicas de hacking ético como essa são comuns, mas existem alguns aspectos interessantes nesse ataque que o diferenciam de muitos outros.
A primeira é que a Hacktron usou IA para auxiliar em seus esforços. Inicialmente, utilizou o Opus 4.8, um dos modelos Claude recentes da Anthropic, para descobrir a vulnerabilidade na libheif. Mas não conseguiu usar o modelo para criar um exploit confiável que funcionasse contra a versão padrão do Discourse.
Em seguida, a Anthropic lançou o Claude Opus 5. Usando esse modelo, os pesquisadores conseguiram criar um exploit funcional da noite para o dia.
Isso demonstra a rapidez com que a IA está evoluindo. Uma tarefa que o Opus 4.8 não conseguiu concluir em diversas tentativas foi resolvida pelo Opus 5 poucas horas após seu lançamento.
O segundo aspecto interessante é que os pesquisadores tiveram que enganar Claude para que ele os ajudasse. O modelo se recusou a escrever um exploit para um sistema remoto porque considerou a solicitação antiética. Então, os pesquisadores tiveram que apresentar a tarefa como um exercício de captura de bandeira (uma competição de hackers) para convencê-lo a colaborar.
Ao fazerem isso, o agente assumiu o controle do servidor do fórum de testes em quatro horas. Os pesquisadores então usaram a vulnerabilidade resultante contra o fórum da OpenAI. Isso demonstra que, embora as empresas se esforcem ao máximo para impor restrições éticas ao uso de sua IA, um pesquisador astuto ainda pode contorná-las com algumas técnicas simples de engenharia reversa.
E isso não custou muito. A Hacktron gastou menos de US$ 3.000 em tokens de IA durante seu projeto de pesquisa de dois meses, que envolveu três pesquisadores e descobriu vulnerabilidades que afetavam diversas grandes empresas.
A falha no processamento de imagens tornou-se a base de um projeto maior chamado HEIF Heist . A Hacktron descobriu vulnerabilidades de segurança relacionadas que afetavam serviços e softwares de empresas como Slack, Meta e GitHub. Adaptar a exploração do HEIF para atingir uma nova empresa levava, em média, um ou dois dias.
Tudo isso facilita ainda mais a criação de ataques cibernéticos sofisticados. Há anos, as pessoas conseguem usar ferramentas de hacking prontas sem realmente entender como elas funcionam, mas era preciso muita experiência para analisar softwares, encontrar falhas ocultas e transformá-las em exploits confiáveis.
A Hacktron afirma que a orientação humana especializada ainda é importante e que não se trata de uma invasão completamente autônoma. Mesmo assim, a IA está tornando parte dessa expertise mais barata e rápida de aplicar — e só tende a melhorar.
Impedir que as ameaças causem qualquer dano.
Browser Guard Malwarebytes Browser Guard páginas de phishing e sites maliciosos automaticamente. É gratuito e se instala com um clique. Adicione-o ao seu navegador →




