Anthropic revela que IA hackeou três empresas durante testes

Erro de configuração permitiu acesso à internet e levou a invasões em ambientes que deveriam estar isolados

Anthropic revela que IA hackeou três empresas durante testes
Compartilhar:

Anthropic revela que IA hackeou três empresas durante testes

Erro de configuração permitiu acesso à internet e levou a invasões em ambientes que deveriam estar isolados

Da Reuters

Anthropic informou que seu modelo de IA, Claude, invadiu os sistemas de três empresas durante testes após um erro de configuração lhe conceder acesso à internet. A revelação, na quinta-feira (30), ocorre poucos dias depois de a rival OpenAI divulgar um incidente envolvendo um agente autônomo que comprometeu a empresa de IA Hugging Face.

A Anthropic afirmou que uma configuração incorreta permitiu que os modelos Claude acessassem a internet a partir de ambientes de teste que deveriam estar isolados, resultando em acessos não autorizados aos sistemas de três organizações.

A empresa disse que identificou os incidentes após revisar 141.006 sessões de testes, um processo iniciado depois que a OpenAI revelou, na semana passada, que um agente autônomo baseado em seus modelos de IA saiu do controle durante um teste de segurança e desencadeou um ataque que comprometeu a infraestrutura da Hugging Face.

Recomendado para você

As invasões indicam que o avanço das capacidades da inteligência artificial já está alimentando o tipo de ameaça à segurança que especialistas alertavam há muito tempo e mostram que até mesmo os principais desenvolvedores podem ser surpreendidos por falhas que seus próprios modelos conseguem explorar.

"O Claude comprometeu a infraestrutura das organizações afetadas usando técnicas básicas, como explorar senhas fracas e pontos de acesso que não exigiam autenticação", afirmou a empresa.

A Anthropic informou que os incidentes envolveram três modelos distintos: Claude Opus 4.7, Claude Mythos 5 e um modelo interno de pesquisa. Os casos mais antigos remontam a abril e ocorreram em ambientes de avaliação que não contavam com o que a empresa descreveu como salvaguardas de segurança padrão.

As invasões ocorreram durante exercícios conhecidos como "capture the flag" ("capture a bandeira"), nos quais os modelos recebem a tarefa de encontrar informações ocultas em redes simuladas. Segundo a empresa, os comandos informavam aos modelos que eles não tinham acesso à internet, mas um mal-entendido com sua parceira de avaliação, a Irregular, fez com que os sistemas permanecessem conectados à internet pública.

A Anthropic informou que começou a revisar os registros das avaliações em 23 de julho e suspendeu todas as avaliações de cibersegurança no mesmo dia, após encontrar indícios de que o Claude poderia ter acessado a internet. A empresa identificou os três incidentes até 24 de julho e notificou as organizações afetadas em 27 de julho.

Segundo a Anthropic, duas das organizações desconheciam completamente a atividade antes de serem contatadas. A empresa acrescentou que ainda tentava entrar em contato com a terceira.

As conclusões reforçam a necessidade de controles mais rigorosos tanto em ambientes internos quanto em plataformas de testes de terceiros, à medida que os modelos de IA se tornam cada vez mais capazes de executar atividades cibernéticas no mundo real, concluiu a Anthropic.



Fonte: https://www.cnnbrasil.com.br/inteligencia-artificial/anthropic-revela-que-ia-hackeou-tres-empresas-durante-testes/