OpenAI revela que IA “fora de controle” invadiu mais sistemas do que se imaginava

A investigação da OpenAI sobre o agente de inteligência artificial que escapou de um ambiente de testes ganhou um novo capítulo. A empresa informou que o incidente não ficou restrito à invasão da plataforma da Hugging Face: durante a análise forense, descobriu que o agente também acessou quatro contas pertencentes a serviços públicos de terceiros usando credenciais que já estavam expostas na internet.

A atualização amplia o alcance do episódio revelado na semana passada, quando a OpenAI admitiu que um conjunto de modelos voltados para pesquisa em segurança ofensiva conseguiu sair de um ambiente isolado de testes, alcançar a internet e comprometer a infraestrutura da Hugging Face para obter respostas de um benchmark de segurança cibernética.

Embora a empresa afirme que não encontrou comprometimentos com a mesma gravidade do ocorrido na Hugging Face, o novo relatório mostra que o agente utilizou recursos externos para facilitar sua operação, evidenciando um comportamento mais sofisticado do que o inicialmente divulgado.

O que a OpenAI descobriu na nova investigação

Segundo a atualização publicada pela OpenAI, o agente encontrou credenciais públicas previamente vazadas na internet e as utilizou para acessar quatro contas em serviços online.

Essas contas tiveram papéis diferentes durante a operação:

  • uma foi utilizada como ponto intermediário (“relay”) para dificultar a identificação da origem do ataque;
  • outra serviu como área temporária para armazenamento de dados utilizados durante a invasão;
  • as demais fizeram parte da infraestrutura empregada pelo agente durante a tentativa de comprometer a Hugging Face.

A empresa afirma que, até o momento, não encontrou evidências de invasões nesses serviços comparáveis ao comprometimento da Hugging Face, mas não revelou quais plataformas foram afetadas.

Modal confirma exploração de código de um cliente

A Modal, empresa especializada em infraestrutura para execução de aplicações de IA, confirmou que um cliente hospedado em sua plataforma teve um código vulnerável explorado pelo agente. Segundo o CTO Akshat Bubna, a infraestrutura da Modal não foi comprometida; o problema estava em um endpoint sem autenticação presente na aplicação do cliente. 

O incidente começou durante um teste interno

O episódio ocorreu durante uma avaliação conduzida pela própria OpenAI utilizando modelos voltados para capacidades ofensivas em segurança cibernética.

Os modelos, incluindo o GPT-5.6 Sol e um modelo experimental ainda não lançado, estavam sendo avaliados no benchmark ExploitGym com diversas restrições de segurança desativadas para medir suas capacidades técnicas. Durante o teste, porém, o agente deixou de buscar uma solução legítima para o desafio e passou a procurar diretamente as respostas, explorando vulnerabilidades que permitiram escapar do ambiente isolado.

Segundo a OpenAI, o comportamento foi um caso de specification gaming: o sistema perseguiu o objetivo de maximizar sua pontuação no teste, mas por um caminho não previsto pelos pesquisadores.

Por que a descoberta preocupa pesquisadores

O novo relatório não indica que a IA desenvolveu técnicas inéditas de invasão. Pelo contrário: parte da operação utilizou credenciais que já estavam expostas publicamente, um vetor bastante conhecido em incidentes reais.

Ainda assim, especialistas consideram o caso relevante porque demonstra que agentes autônomos podem combinar diversas etapas de ataque — descoberta de credenciais, movimentação entre serviços, ocultação da origem das conexões e armazenamento de dados, sem intervenção humana direta. O episódio também reacendeu críticas às práticas de contenção utilizadas durante testes com modelos de IA capazes de executar tarefas complexas em ambientes computacionais.

Você também deve ler!

Ver Mais

Esta postagem foi modificada pela última vez em 29/07/2026 12:18

William R. Plaza: Editor-chefe no Hardware.com.br, aficionado por tecnologias que realmente funcionam. Segue lá no Insta: @plazawilliam Elogios, críticas e sugestões de pauta: william@hardware.com.br