Caso OpenAI não foi único: Anthropic admite que os seus modelos de IA escaparam ao ambiente de testes e ‘hackearam’ sistemas reais

Entre os modelos envolvidos estão o Claude Opus 4.7, o Mythos 5 e um modelo experimental utilizado em investigação interna

Francisco Laranjeira

Depois da OpenAI ter revelado que alguns dos seus modelos de inteligência artificial conseguiram escapar a ambientes de testes isolados e aceder a sistemas externos, surgiu agora um caso semelhante envolvendo a Anthropic. Segundo o ‘El Economista’, a empresa confirmou que três dos seus modelos conseguiram aceder, sem autorização, à infraestrutura informática de três organizações reais durante avaliações internas de cibersegurança.

Escolha a Executive Digest como fonte preferida no Google Escolher ›

Entre os modelos envolvidos estão o Claude Opus 4.7, o Mythos 5 e um modelo experimental utilizado em investigação interna.

O que aconteceu?

A Anthropic decidiu rever todos os seus testes depois de a OpenAI ter divulgado recentemente vários incidentes de segurança.

Nesse caso, alguns modelos da OpenAI conseguiram explorar uma vulnerabilidade zero-day e aceder à infraestrutura da plataforma Hugging Face. A empresa revelou ainda que identificou outros episódios em que modelos utilizaram credenciais de contas expostas publicamente para aceder a serviços disponíveis na Internet.

Continue a ler após a publicidade
Continue a ler após a publicidade

Perante estes acontecimentos, a Anthropic analisou 141.006 execuções dos seus próprios modelos para confirmar se algum deles teria conseguido sair do ambiente isolado de testes.

Foi então que descobriu três incidentes distintos.

Um erro de configuração abriu a porta

Segundo explicou a empresa, os modelos estavam a participar em exercícios do tipo capture the flag, uma prova utilizada para avaliar capacidades de cibersegurança.

Nestes desafios, o objetivo consiste em encontrar uma informação secreta escondida numa máquina de teste, simulando um ataque informático, mas sempre dentro de um ambiente totalmente isolado.

Continue a ler após a publicidade

A Anthropic garantiu que informou os modelos de que se encontravam numa simulação sem acesso à Internet.

Contudo, um erro de configuração por parte de um parceiro responsável pelos testes acabou por permitir esse acesso.

Sem saber que estavam ligados a sistemas reais, os modelos trataram os servidores externos como se fizessem parte do exercício.

Como conseguiram entrar?

Segundo a empresa, os modelos recorreram apenas a técnicas relativamente simples, explorando palavras-passe fracas e pontos de acesso sem autenticação.

Continue a ler após a publicidade

A Anthropic sublinha que não foram exploradas vulnerabilidades complexas nem houve qualquer comportamento para além do necessário para completar a tarefa prevista no exercício.

Num dos casos, um modelo mais antigo continuou a operar mesmo depois de existirem indícios de que já estava ligado à Internet. Já uma versão mais recente interrompeu imediatamente a atividade assim que percebeu que tinha saído do ambiente de testes.

Empresas afetadas foram notificadas

Depois de identificar os incidentes, a Anthropic suspendeu todas as avaliações de cibersegurança que estavam em curso e contactou as três organizações afetadas.

Duas responderam à empresa, afirmando não ter detetado qualquer atividade suspeita nos seus sistemas, estando agora a colaborar na investigação. A terceira organização ainda não respondeu.

O caso surge poucos dias depois das revelações da OpenAI e volta a levantar questões sobre a forma como os modelos de inteligência artificial são avaliados e sobre os mecanismos de isolamento utilizados durante testes de segurança, numa altura em que estas tecnologias assumem capacidades cada vez mais avançadas.

Continue a ler após a publicidade
Partilhar

Edição Impressa

Assinar

Newsletter

Subscreva e receba todas as novidades.

A sua informação está protegida. Leia a nossa política de privacidade.