
A Anthropic informou que identificou três episódios em que o assistente de inteligência artificial Claude realizou ataques virtuais contra sistemas de empresas durante testes internos de segurança. Segundo a companhia, os casos foram descobertos após a análise de mais de 141 mil sessões de avaliação, iniciada depois de um incidente semelhante envolvendo o ChatGPT, da OpenAI.
De acordo com a empresa, os testes utilizavam o modelo conhecido como “capture a bandeira”, no qual a IA recebe a missão de localizar uma informação fictícia em um ambiente simulado. Embora o cenário previsse que não haveria acesso à internet, um erro de configuração permitiu que o Claude alcançasse sistemas reais e os interpretasse como parte do exercício.
Empresa afirma que incidente foi causado por falha de configuração
A Anthropic explicou que o acesso indevido ocorreu devido a um equívoco na configuração do ambiente de testes. Em alguns casos, uma versão mais antiga do Claude continuou a executar ações mesmo após encontrar evidências de que estava conectada à internet, enquanto a versão mais recente interrompeu a atividade assim que identificou o ambiente externo.
A empresa afirmou que não houve tentativa deliberada de escapar do ambiente de testes nem de extrair informações das organizações atingidas. Duas das três empresas afetadas já foram notificadas pela Anthropic, que informou que elas desconheciam a ocorrência dos acessos. A terceira organização ainda não havia sido localizada até a divulgação do comunicado.
Com informações de Metrópoles







