Anthropic divulga acesso de modelos Claude a sistemas de três empresas em testes de segurança

Compartilhe essa Informação

Incidente de segurança revela falhas em testes de IA da Anthropic

A Anthropic anunciou que três de seus modelos de inteligência artificial acessaram sistemas de empresas durante testes internos de cibersegurança. A falha ocorreu devido a um erro operacional que permitiu acesso à internet em um ambiente que deveria ser isolado, resultando em interações não autorizadas com infraestruturas externas.

Esse incidente vem à tona logo após a OpenAI relatar um problema semelhante com um de seus modelos em avaliações de segurança. Em resposta, a Anthropic revisou mais de 141 mil sessões de testes para identificar se problemas similares ocorreram em seus processos. Durante essa análise, foram encontrados três episódios envolvendo os modelos Claude Opus 4.7, Claude Mythos 5 e um modelo experimental de pesquisa.

Os testes, realizados em parceria com a empresa Irregular, deveriam ocorrer em um ambiente simulado sem conexão com a internet. No entanto, um erro de configuração possibilitou que os modelos acessassem sistemas externos. A Anthropic classificou essa situação como uma falha operacional, não como um comportamento autônomo ou inesperado dos modelos.

Revisão identificou diferentes tipos de acesso

Os modelos utilizaram técnicas simples para acessar os sistemas, explorando credenciais fracas e serviços sem autenticação. Ao contrário do incidente relatado pela OpenAI, a Anthropic esclareceu que seus modelos não exploraram vulnerabilidades inéditas, mas sim fragilidades básicas nas infraestruturas avaliadas.

Em um dos casos, um modelo acreditou erroneamente que uma empresa real fazia parte do ambiente simulado e usou credenciais encontradas para acessar sistemas da organização. Em outro incidente, um modelo reconheceu que estava interagindo com um ambiente real e interrompeu espontaneamente a atividade, um comportamento destacado pela empresa em seu relato.

A Anthropic notificou as três organizações afetadas, sendo que duas delas não haviam percebido os acessos até serem informadas pela desenvolvedora. Os nomes das empresas não foram divulgados.

Após a identificação dos incidentes, a empresa suspendeu, em 23 de julho, todos os testes de cibersegurança que envolviam acesso à internet, enquanto investiga o ocorrido e revisa seus controles internos. A Anthropic também está trabalhando para reforçar seus processos de supervisão, monitoramento e validação dos ambientes utilizados em avaliações de segurança realizadas por terceiros.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *