Um agente da OpenAI não aceitou um "não" como resposta ao se deparar com os controles de acesso de um site do governo. Ele conseguiu entrar, o que levou o primeiro-ministro australiano, Anthony Albanese, a expressar suas preocupações diretamente ao CEO da OpenAI, Sam Altman.
A BBC noticiou que um agente da OpenAI obteve acesso não autorizado a um portal de estatísticas do governo australiano enquanto realizava uma pesquisa interna. Este é mais um incidente que transforma preocupações abstratas sobre o comportamento autônomo da IA em um caso concreto de segurança cibernética.
A Austrália afirma que o incidente ocorreu em 18 de junho, quando a equipe de pesquisa da OpenAI utilizou um modelo interno para pesquisar gastos com saúde pública. Apesar de o agente ter encontrado repetidos bloqueios ao tentar obter informações, ele acabou acessando arquivos públicos e privados no portal do Serviço de Relatórios Estatísticos do Medicare.
As informações incluíam estatísticas agregadas do Medicare, como dados de gastos, mas não registros médicos de pacientes. O agente também interagiu com outros três sites governamentais, mas as autoridades australianas afirmam que ele acessou apenas informações públicas nesses sites.
Assim, um agente de IA usado em um exercício de pesquisa legítimo encontrou controles e se comportou de maneiras que seu operador não pretendia. Depois de ser bloqueado, ele "encontrou uma maneira de contornar esses bloqueios", obtendo acesso a áreas que não deveria ter alcançado.
Essa sequência é familiar para profissionais de segurança. Um sistema encontra um limite de controle de acesso, busca uma rota alternativa e consegue acessar um recurso além de sua autorização.
Uma das principais preocupações da Austrália é a demora na notificação do incidente. O acesso não autorizado ocorreu em junho. A OpenAI afirmou ter tomado conhecimento do problema em agosto, durante a análise de atividades desalinhadas em seus modelos, e enviou um e-mail para o endereço público da Services Australia em 10 de setembro. A Services Australia encaminhou a mensagem às autoridades cibernéticas australianas cinco dias depois.
Esses atrasos podem ser desastrosos, pois as organizações afetadas precisam de detalhes suficientes, com rapidez suficiente, para preservar as evidências, avaliar a exposição, conter as atividades relacionadas e decidir se as notificações são necessárias.
desalinhamento da IA
A OpenAI descreve como "desalinhamento" o comportamento em que um modelo age sem autorização ou se esquiva da supervisão. Sua nova proposta de avaliação por terceiros identifica especificamente a investigação independente de incidentes críticos de desalinhamento como uma das quatro prioridades para revisão externa.
A OpenAI afirma que deseja que avaliadores independentes tenham acesso profundo a todas as etapas de treinamento, avaliação e implementação, para que possam questionar as premissas da empresa e avaliar a eficácia de suas medidas de segurança.
Mas, como expliquei ao CIO sobre essa proposta, os princípios por si só não obrigam uma empresa a aceitar um determinado escopo de avaliação, publicar resultados adversos ou alterar uma decisão de implementação. Sua credibilidade depende, em última análise, da capacidade de especialistas independentes conduzirem investigações realmente incômodas e de terceiros verificarem os resultados, as medidas corretivas, as omissões e as decisões de implementação subsequentes.
Para organizações que implementam agentes de IA, a lição é igualmente prática: não trate um agente como apenas mais um chatbot. Trate-o mais como um componente de software semiautônomo com credenciais, ferramentas, acesso à rede e a capacidade de tomar decisões inesperadas.
Além de conter esses agentes, outro problema que precisamos resolver é analisar o que eles fizeram. Uma coisa que aprendemos com o incidente da Hugging Face é que agentes de IA podem mentir e tentar esconder o que andaram fazendo.
Agentes de IA podem criar um problema de detecção complexo, pois podem gerar grandes volumes de atividade automatizada enquanto perseguem um objetivo por meio de múltiplas rotas. Isso pode deixar os defensores com um rastro confuso de solicitações falhas, novas tentativas e ações alternativas, dificultando a identificação de um evento isolado que ultrapassou um limite de autorização. Ainda não está claro se isso contribuiu para que o governo australiano não detectasse o incidente, mas o caso ilustra por que as organizações precisam de monitoramento projetado para identificar comportamentos incomuns de agentes, e não apenas padrões tradicionais de intrusão.
O evento já demonstrou um ponto mais amplo: não basta que os laboratórios de IA digam que testam o desalinhamento. Eles precisam demonstrar que seus testes são independentes, robustos em condições reais e que há uma responsabilização imediata e verificável quando as medidas de segurança falham.
Vamos ser sinceros: uma janela anônima tem suas limitações.
Violações de dados, comércio na dark web, fraudes de crédito. Malwarebytes Identity Theft monitora tudo isso, avisa você rapidamente e inclui um seguro contra roubo de identidade.




