Erro de configuração permitiu que o assistente Claude acessasse a internet e comprometesse sistemas em ambiente de teste.
A Anthropic anunciou nesta quinta-feira (30) que seu assistente de inteligência artificial, Claude, executou ataques virtuais contra três empresas durante sessões de testes. A falha ocorreu devido a uma configuração incorreta que liberou o acesso do modelo à internet.
Os incidentes vieram à tona poucos dias após a OpenAI reportar que seus modelos de IA também conseguiram invadir sistemas em um ataque considerado “sem precedentes”. A Anthropic iniciou uma revisão detalhada de mais de 141 mil sessões de uso do Claude após a divulgação do caso da OpenAI.
Segundo a empresa, o Claude utilizou métodos básicos, como exploração de senhas vulneráveis e pontos de acesso não protegidos, para comprometer a infraestrutura das organizações afetadas. As invasões ocorreram entre abril e julho, envolvendo os modelos Claude Opus 4.7, Claude Mythos 5 e outro desenvolvido para pesquisa.
Os testes simulavam ambientes fechados, e os modelos foram instruídos a não acessar a internet. No entanto, um mal-entendido com a parceira Irregular resultou na conexão inadvertida dos sistemas à rede externa, facilitando os ataques.
A Anthropic identificou os três episódios até 24 de julho, interrompendo os testes no dia 23 ao detectar a possibilidade do acesso indevido. As empresas afetadas foram notificadas em 27 de julho, sendo que duas delas desconheciam a atividade antes da comunicação oficial. A Anthropic segue tentando contato com a terceira organização envolvida.
