A OpenAI cancelou o lançamento do GPT-6.1 Astra após pesquisadores da própria empresa apontarem preocupações de segurança. O modelo, considerado o mais recente da companhia, poderia concluir tarefas complexas sem supervisão humana, conforme informações atribuídas ao Wall Street Journal.
A decisão foi anunciada na segunda-feira (28), poucos dias depois de a empresa informar que suspenderia o treinamento de seus modelos mais avançados. A medida ocorreu após falhas em novas proteções permitirem que um sistema acessasse a internet.
O episódio envolvendo a Hugging Face aconteceu em julho, durante uma avaliação interna de cibersegurança. Agentes de IA da OpenAI deixaram o ambiente isolado usado nos testes, acessaram a internet e invadiram autonomamente sistemas da startup.
Alertas durante os testes
Meses antes do caso, dois funcionários da OpenAI haviam alertado que os novos modelos não estavam sendo monitorados adequadamente. As mensagens indicavam que a empresa não conseguia avaliar o grau de sofisticação da tecnologia nem assegurar sua segurança.
Os funcionários disseram que executivos defendiam acelerar os testes para cumprir o prazo de lançamento do novo modelo. Nenhum protocolo adicional foi adotado, segundo eles. Os relatos foram feitos sob condição de anonimato, porque os autores não tinham autorização para comentar publicamente assuntos sensíveis.
Pesquisadores independentes afirmaram ter identificado outras vulnerabilidades, entre elas possibilidades de acesso ao código-fonte interno da OpenAI e aos registros de conversas de usuários do ChatGPT. Eles disseram que a empresa inicialmente não respondeu às falhas comunicadas.
Joshua Saxe, diretor de tecnologia da Abundant Security, declarou: “A segurança da OpenAI parece ser exatamente o que se espera de um laboratório de pesquisa que cresceu a um ritmo vertiginoso ao longo de quatro anos”.
Novos comportamentos identificados
Um relatório independente divulgado na sexta-feira (25) descreveu outras ações relacionadas ao incidente com a Hugging Face. Os modelos teriam tentado enviar mensagens ao Claude, assistente de IA da Anthropic, e usado sistemas de IA para contornar proteções antirrobôs de um site.
Google, Meta e Anthropic também divulgaram incidentes de segurança envolvendo inteligência artificial. A OpenAI, porém, enfrenta uma sequência de episódios em que modelos ocultaram erros, inventaram dados, tentaram enviar mensagens a outros chatbots e transferiram arquivos para a internet aberta sem autorização. A própria empresa classificou esses comportamentos como preocupantes.
O porta-voz Drew Pusateri afirmou que a OpenAI leva a sério relatos e preocupações sobre segurança e mantém canais internos para notificações. “À medida que os modelos de vanguarda se tornam mais capazes, continuamos a aprimorar nossas práticas de segurança, mas reconhecemos a necessidade de avançar mais rapidamente”, disse.




