O Google afirma que um de seus modelos Gemini acessou sistemas pertencentes a três empresas reais durante uma avaliação de segurança cibernética em maio.
Segundo relatos, o modelo adivinhou as credenciais em um caso, enquanto encontrou credenciais expostas em repositórios públicos em outros dois. O Google afirma que o Gemini parou assim que reconheceu ter alcançado infraestrutura real e que as organizações afetadas foram notificadas.
A Gemini estava participando de uma avaliação conduzida pela Irregular, uma empresa terceirizada de testes de cibersegurança de IA. Incidentes semelhantes envolvendo modelos da Anthropic, OpenAI e Meta também foram associados aos mesmos problemas subjacentes nos ambientes de avaliação, que permitiram que os modelos chegassem à internet pública.
Mas a notícia chega num momento particularmente interessante.
Durante meses, a indústria de IA tem intensificado constantemente suas demonstrações de capacidade de atuação autônoma: os modelos podem navegar, usar ferramentas, escrever código, perseguir objetivos complexos e, às vezes, encontrar maneiras de contornar obstáculos não previstos por seus desenvolvedores . O mercado recompensa evidências chamativas de autonomia. "Concluiu a tarefa" é impressionante. "Fez algo que não deveria ter feito" pode ser ainda mais memorável.
Há outra maneira de encarar o incidente: não como prova de que uma IA desenvolveu repentinamente intenções criminosas, mas como um pequeno exemplo concreto do problema do " alinhamento da IA ".
O alinhamento é a tarefa enganosamente difícil de fazer com que o comportamento de um sistema de IA corresponda ao que as pessoas realmente pretendiam, em vez de apenas ao objetivo restrito que conseguiram expressar. Nesse caso, o objetivo era localizar informações ocultas em um alvo simulado e concluir a avaliação. Mas qualquer operador humano provavelmente consideraria uma condição inegociável: Não tentar acessar empresas reais.
Aparentemente, o Gemini otimizou a primeira instrução, enquanto tratou a segunda como um problema de inferência. Ele encontrou uma organização com um nome correspondente, identificou sistemas acessíveis pela internet e prosseguiu como se pertencessem ao exercício. Embora tenha concluído a tarefa de uma forma que seus operadores humanos não aprovariam, o Google afirma que o processo foi interrompido após reconhecer que havia alcançado uma infraestrutura genuína — algo que outros modelos não conseguiram fazer .
Ainda assim, o incidente demonstra como as potenciais falhas de alinhamento podem ser muito mais banais. Dê a um agente um objetivo, ferramentas e espaço para agir, e ele poderá executar fielmente a parte mensurável da tarefa, ignorando os limites não declarados que os humanos precisam compreender uns aos outros. Os modelos de IA não sabem automaticamente onde traçamos a linha.
Pode haver também uma estratégia de marketing questionável por trás disso. Um modelo capaz o suficiente para apresentar o tipo errado de progresso ainda pode parecer extremamente competente. Em um mercado onde todos os laboratórios querem demonstrar que seus agentes podem planejar, programar, navegar e agir de forma independente, até mesmo uma declaração de segurança pode carregar uma mensagem secundária: o nosso também pode competir nesse nível.
É mais um motivo para levar a sério os alertas de especialistas , líderes do setor e políticos de que as medidas de segurança devem acompanhar a autonomia concedida aos modelos de IA.
O que os cibercriminosos sabem sobre você?
Use a verificação gratuita Digital Footprint Malwarebytes para verificar se suas informações pessoais foram expostas online.




