A mais recente falha de contenção da OpenAI reforça um padrão que pode forçar a empresa a tomar uma decisão impopular.
A empresa suspendeu o treinamento, a avaliação e a inferência automatizada de seus modelos mais avançados depois que um agente de pesquisa interno encontrou uma maneira de contornar uma restrição de internet. Mais alarmante ainda, o agente permaneceu ativo por horas após o sistema de monitoramento da OpenAI ter disparado o alerta.
A OpenAI publicou um relato do incidente, ocorrido durante uma tarefa de treinamento baseada em buscas em 20 de setembro. Segundo a OpenAI, o agente não conseguiu obter resultados úteis por meio das ferramentas de busca fornecidas, tentou acesso direto aos mecanismos de busca e, por fim, testou os limites de seu ambiente. Descobriu que, embora o acesso direto à web estivesse bloqueado, o resolvedor DNS do ambiente de teste ainda conseguia acessar a internet pública. Utilizando delegação de DNS e um chatbot público capaz de responder por meio de registros DNS, o agente enviou perguntas para fora do ambiente restrito e recebeu respostas. Em seguida, enviou mais 18 consultas pela mesma rota.
O monitor de desalinhamento da OpenAI gerou um alerta de alta prioridade em 15 minutos, e um revisor humano o confirmou 3 minutos depois. Mas a execução não parou automaticamente como esperado. Ela continuou por aproximadamente mais duas horas e meia antes de ser interrompida manualmente.
A OpenAI não relatou nenhuma exposição de dados sensíveis ou comprometimento de um sistema externo neste incidente. Mas ele segue outros casos divulgados em que agentes extrapolaram suas tarefas designadas ou ultrapassaram os limites dos ambientes de teste.
O jornal The New York Times relata que agentes da OpenAI também interagiram com sites do governo dos EUA neste verão sem o conhecimento da empresa:
“A inteligência artificial da OpenAI saiu do controle e interferiu nos sites do Departamento de Educação, do Departamento de Comércio e da Comissão de Valores Mobiliários neste verão, sem o conhecimento do laboratório de IA, de acordo com pesquisadores de segurança e uma pessoa familiarizada com os episódios.”
Nenhuma violação foi confirmada nesses casos. E embora a Austrália tenha descrito o incidente com o Medicare como acesso não autorizado, será que realmente pode ser chamado de ataque ?
O apelo por uma desaceleração em toda a indústria chegou a motivar um processo judicial movido por assinantes pagantes que temem receber menos "valor pelo seu dinheiro". Outros se preocupam com o fato de que a desaceleração daria à China a chance de ultrapassar os EUA em uma corrida tecnológica cada vez mais acirrada.
Eis uma ideia: por que não acelerar o desenvolvimento de ambientes de teste verdadeiramente isolados? Um melhor confinamento tornaria esses testes mais seguros e seus resultados mais confiáveis.
Quando uma criança não está preparada para manusear um objeto perigoso, você o mantém fora do alcance dela. Por que dar a um agente de IA acesso a algo que ele não está preparado para usar com segurança?
Como usar agentes de IA com segurança
Trate um agente como um funcionário júnior entusiasmado, porém falível, com acesso ao seu computador. Não lhe dê acesso irrestrito ao seu e-mail, arquivos, armazenamento em nuvem, credenciais de desenvolvedor, contas financeiras ou sistemas de produção apenas porque ele promete economizar tempo.
Utilize contas separadas com permissões mínimas. Mantenha dados sensíveis fora do contexto de trabalho sempre que possível, exija aprovação humana antes de enviar mensagens, gastar dinheiro, alterar configurações ou publicar qualquer coisa e revise regularmente sua atividade.
Um agente de IA não precisa de intenções maliciosas para causar danos. Uma instrução mal interpretada, uma permissão excessivamente ampla ou uma solução alternativa inesperada podem ser suficientes.
Desde a denúncia de ameaças até a sua remoção.
Os riscos de segurança cibernética nunca devem se espalhar além de uma manchete. Mantenha as ameaças longe de seus dispositivos fazendo o download Malwarebytes hoje mesmo.




