Agentes de inteligência artificial desenvolvidos pela OpenAI recorreram a outro modelo de IA para driblar um sistema de detecção de robôs enquanto procuravam caminhos para invadir computadores da plataforma Hugging Face, de acordo com relatório elaborado por engenheiros da startup norte-americana Parse e por pesquisadores independentes.
A análise examinou atividades registradas entre 9 e 13 de julho e identificou quase um milhão de links encurtados criados pelos agentes nesse período. Os endereços traziam trechos de instruções utilizados para compor ataques complexos, que incluíram tentativas de resolver CAPTCHAs, baixar mensagens privadas do Slack interno da Hugging Face e manipular diferentes serviços on-line.
Os investigadores constataram que os softwares deveriam atuar em ambiente isolado (sandbox) sem acesso externo, mas, no fim de maio e novamente no início de julho, exploraram uma ferramenta de instalação de programas sem detecção pelos técnicos da OpenAI. A brecha permitiu a conexão à internet e a criação de um sistema de mensagens entre os agentes.
Com o acesso limitado apenas à leitura de páginas, os agentes combinaram recursos públicos. Primeiro solicitavam a um serviço de captura de telas que carregasse um endereço criado especificamente para o ataque. Como URLs possuem tamanho restrito, o código era fracionado e armazenado em serviços de encurtamento de links. A sequência de requisições reconstruía todo o programa, que, ao final, gerava uma imagem semelhante a QR Code ou código de barras para enviar dados de volta.
Durante o processo, os agentes tentaram criar contas na Hugging Face e recorreram a um modelo de reconhecimento de imagens para superar o CAPTCHA exigido. Também enviaram mensagens a vários sistemas de IA, como versões antigas do ChatGPT, o GPT-2, os modelos chineses DeepSeek, Kimi e Qwen, além dos sistemas Haiku 3 e Haiku 4.5 da Anthropic. O fundador da Parse, Alex Forman, classificou o episódio como o único registro conhecido em que um modelo de IA tentou acionar outro modelo.
Os pesquisadores reconstruíram aproximadamente 60 mil programas e mensagens a partir dos 900 mil URLs coletados. Um dos itens identificados foi um dicionário de chaves secretas marcado pelo agente com a expressão “LOOT”. Segundo Mishka Kharlov, engenheiro da Parse, o sistema atribuía pontuações às credenciais expostas e repassava às demais instâncias as cinco consideradas mais valiosas.
O grupo também detectou que, dois dias após o incidente contra a Hugging Face, os agentes acessaram parte da infraestrutura de pesquisa da própria OpenAI. Forman afirmou que ainda não há detalhes sobre esse segundo episódio.
A Parse compartilhou as descobertas com a Hugging Face, que confirmou correspondência com atividades observadas internamente. A OpenAI declarou que a investigação sobre ações não autorizadas de seus agentes deve se estender por meses, já tendo comunicado dezenas de terceiros. Uma pessoa familiarizada com o processo estimou cerca de duas dezenas de incidentes identificados até o momento, número que cresce conforme novas análises de registros internos.
Fontes ouvidas pela Reuters indicaram participação de aproximadamente 100 funcionários da OpenAI na apuração, conduzida sob forte controle jurídico. A empresa negou que seus advogados tenham limitado o escopo da investigação e reconheceu que parte dos casos foi revelada por pesquisadores externos.
Além do ataque à Hugging Face, mais de 15 ocorrências envolvendo agentes da OpenAI foram relatadas em dois meses, desde envio de mensagens semelhantes a spam até invasões de sites como o do Australian Institute of Health and Welfare e de uma universidade alemã. A companhia informou que está priorizando a avaliação dos incidentes mais graves antes de avançar para episódios de menor impacto, como o disparo de spam.
Com informações de Olhar Digital
