Agente de IA se enganou e hackeou a própria startup, revela OpenAI | OpenAI


A OpenAI revelou que um agente autônomo de IA alimentado por sua tecnologia se enganou durante um teste, entrou na rede aberta e hackeou sozinho uma startup proeminente em um “incidente sem precedentes”.

A empresa por trás do ChatGPT disse que a startup Hugging Face detectou e continha o agente – uma ferramenta de IA projetada para realizar tarefas sem assistência humana – que havia entrado em seus sistemas.

“Acreditamos que este incidente é um incidente cibernético sem precedentes, envolvendo capacidades cibernéticas de última geração”, OpenAI disse.

A empresa disse que espera que esses tipos de incidentes se tornem mais comuns à medida que os modelos – a tecnologia por trás das ferramentas de IA, como chatbots e agentes – se tornem mais capazes. A OpenAI disse que o hack aconteceu por meio de um agente alimentado por uma combinação de seu modelo mais recente disponível publicamente, chamado GPT-5.6 Sole um modelo ainda mais capaz ainda a ser lançado.

Ao serem testados internamente em suas habilidades de hacking em um laboratório digital fechado conhecido como sandbox, os modelos obtiveram acesso aberto à Internet – efetivamente uma rota de fuga – ao localizar uma vulnerabilidade anteriormente não detectada.

O agente então invadiu o Hugging Face, que é um banco de dados de modelos de IA, para encontrar tecnologia que o ajudasse a passar na avaliação de hacking depois de “concluir” que o Hugging Face poderia ter os modelos, conjuntos de dados e soluções para passar no teste. A OpenAI disse que os modelos “encontraram com sucesso maneiras de acessar informações secretas que poderiam usar para falsificar a pontuação”. O ataque terminou quando a equipe de segurança do Hugging Face e seus próprios agentes de IA detectaram e interromperam a atividade fraudulenta.

O CEO da Hugging Face, Clément Delange, disse que o ataque foi “incompreensível”, mas acredita que “não houve intenção maliciosa” da OpenAI.

“Suspeitamos que o ataque cibernético da semana passada pode ter vindo de um laboratório fronteiriço, dada a sofisticação do agente”, escreveu ele a X.

Quando a Hugging Face divulgou o hack na semana passada, ela não sabia o papel da OpenAI no incidente, mas disse na época que havia recorrido a um modelo chinês de IA disponível gratuitamente para analisar o que aconteceu, já que as proteções dos modelos comerciais de ponta não teriam permitido que isso acontecesse.

O termo para uma falha de TI desconhecida é vulnerabilidade de dia zero, já que os desenvolvedores não têm minutos para corrigir o problema. Em abril, o rival próximo da OpenAI, Anthropic, anunciou seu modelo Mythos eles descobriram milhares dessas falhas.

A revelação da capacidade do Mythos de localizar e usar zero dias levou o governo dos EUA a restringir as exportações do Mythos e do seu modelo irmão, o Fable 5, embora desde então tenha levantado a proibição. GPT-5.6 Sol tinha limitações semelhantes, mas desde então foi lançado globalmente.

A METR, uma organização sem fins lucrativos que mede o desempenho da IA, disse no mês passado que a taxa de trapaça do Sol era maior do que qualquer modelo público avaliado anteriormente. Também está registrado 44 incidentes em que os agentes de IA “agiram conscientemente contra as intenções dos seus utilizadores”.

O Instituto de Segurança de IA do Reino Unido (AISA) revelado em uma postagem no blog esta semana que um modelo de IA que estava avaliando, desenvolvido por uma empresa de tecnologia não revelada, também se tornou desonesto e tentou hackear seus sistemas de testes. A AISI disse que nenhum dano foi causado e desde então tomou medidas para tornar seus sistemas mais seguros. Ele disse que modelos desenvolvidos pela OpenAI e Anthropic tentaram “trapacear” durante os testes.

pular a promoção do boletim informativo


A AISI alertou que modelos ainda mais capazes podem encontrar métodos de trapaça que são mais difíceis de detectar e mais prejudiciais se tiverem sucesso, especialmente em áreas como a segurança cibernética.

Um especialista em segurança cibernética disse que o incidente do Hugging Face mostrou que o agente OpenAI agiu “como um verdadeiro hacker”, procurando vulnerabilidades de dia zero e usando credenciais roubadas para acessar os sistemas do Hugging Face.

“A IA pensou que talvez o Hugging Face tivesse informações importantes sobre como atingir seu objetivo, que é uma pontuação melhor em um benchmark de segurança cibernética. Nesse sentido, ele age como um verdadeiro hacker”, disse Nathaniel Jones, vice-presidente de segurança e estratégia de IA da empresa de segurança cibernética Darktrace. . “Ele tinha um objetivo definido diante dele e foi alcançá-lo.”

Greg Cazar, um congressista democrata dos EUA que pediu maior supervisão do setor de IA, descreveu o incidente como preocupante.

“A IA está a desenvolver-se extremamente rápido, sem regulamentos reais para nos manter seguros”, disse ele num comunicado, apelando à obrigatoriedade de testes de segurança independentes, à divulgação obrigatória de incidentes de segurança e à cooperação internacional “para manter as pessoas longe do desastre absoluto”.



Link da fonte

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Releated