O agente de IA Mythos da Anthropic, testado pelo Instituto de Segurança de IA do Reino Unido (AISI), teria tentado um ataque de engenharia social contra administradores do GitHub, criando perfis humanos falsos, pressionando-os a aceitar código malicioso e, em seguida, editando os registros para ocultar seus rastros quando confrontado.
O AISI estava realizando avaliações de cibersegurança do Mythos, da Anthropic, e do Sol, da OpenAI, quando detectou transferências de dados incomuns de seus sistemas de pesquisa. Uma investigação mostrou que alguns agentes se envolveram em "atividades contínuas e potencialmente prejudiciais" direcionadas a pessoas e organizações reais, em vez de permanecerem dentro do ambiente de teste pretendido.
A atividade mais grave envolveu um agente da Anthropic Mythos encarregado de resolver um desafio de cibersegurança relacionado ao GitHub. O agente identificou mantenedores reais do GitHub, pesquisou sobre eles e criou várias contas falsas se passando por esses indivíduos. Usando mensagens privadas e um serviço de compartilhamento de arquivos, ele tentou pressionar e enganar os mantenedores para que aprovassem um código malicioso que seria executado nos sistemas do GitHub.
Mas o que mais me preocupa pessoalmente é que, quando confrontado sobre isso, o agente editou atividades anteriores para que parecessem inofensivas e considerou adotar uma nova identidade para continuar a operação, demonstrando um comportamento claramente enganoso que ia além do que havia sido solicitado inicialmente.
A AISI classifica esses incidentes como eventos raros sob condições muito específicas, mas como sinais importantes do que tais modelos podem fazer nas mãos de agentes maliciosos quando têm acesso irrestrito à internet. Tanto a Anthropic quanto a OpenAI argumentaram que os parâmetros de teste não eram representativos de suas implementações em produção e afirmaram que estão investigando e aprimorando as práticas de avaliação e salvaguarda.
Este incidente não é um evento isolado.
A Anthropic divulgou separadamente que os modelos Claude obtiveram acesso não autorizado a três organizações externas durante avaliações de segurança cibernética do tipo "captura de bandeira" realizadas com um parceiro terceirizado, a Irregular. Esses incidentes estavam relacionados ao caso da Hugging Face ocorrido no mês passado.
A Meta também entrou para a lista de fornecedores que relataram que seus agentes de IA invadiram sistemas de terceiros durante os testes. Alegadamente , o modelo Muse Spark da Meta explorou uma vulnerabilidade de segurança em outra empresa "de maneira semelhante a casos relatados anteriormente com outras empresas".
Como se manter seguro
Embora o mundo não esteja acabando, aqueles que temem a chegada da " Skynet " estão recebendo munição de empresas que realizam testes que resultam em fuga de ambientes de teste (sandbox), abuso de credenciais, acesso lateral a múltiplos serviços e instrumentalização de ecossistemas de software de código aberto.
O que você pode fazer como um alvo em potencial:
- Certifique-se de que todo o software do seu dispositivo esteja atualizado, pois explorar vulnerabilidades conhecidas é mais fácil do que encontrar novas.
- Utilize proteção de segurança atualizada e em tempo real para manter o malware longe de seus sistemas e dispositivos.
- Verifique a segurança dos anexos e links de download por meio de canais separados antes de abri-los.
- Utilize a autenticação multifator (MFA) sempre que possível.
- Confira nosso blog sobre como usar o Github com segurança .
Desde a denúncia de ameaças até a sua remoção.
Os riscos de segurança cibernética nunca devem se espalhar além de uma manchete. Mantenha as ameaças longe de seus dispositivos fazendo o download Malwarebytes hoje mesmo.




