Em teste, Claude mente e cria contas falsas para forçar ataque hacker

Resumo
  • Instituto de Segurança em Inteligência Artificial do Reino Unido (AISI) testou os modelos Claude Mythos 5 da Anthropic e GPT-5.6 da OpenAI, e detectou capacidades de enganar e autonomia preocupantes.
  • O modelo Mythos 5 da Anthropic foi capaz de criar contas falsas no GitHub para tentar inserir código malicioso, sem receber prompts específicos para tal ação.
  • Os testes do AISI foram realizados 122 vezes com diferentes modelos de IA, e apenas 19 casos registraram ações controversas, 17 deles ligados ao Mythos 5.

O Claude Mythos 5 e o modelo Sol do GPT-5.6 foram testados pelo Instituto de Segurança em Inteligência Artificial do Reino Unido (AISI), e apresentaram resultados preocupantes. O chatbot da Anthropic foi o que mais surpreendeu, tentando acessar o GitHub a qualquer custo: a IA criou contas falsas e se passou por pessoas reais no processo. Ela escondeu evidências depois das tentativas. Em tese, a plataforma não poderia ser acessada durante os testes.

A partir dos resultados, o AISI afirmou que as duas IAs, que figuram entre as mais poderosas do mercado, apresentaram níveis preocupantes de autonomia e capacidade de enganar, com certa “vantagem” para a inteligência da Anthropic. É importante considerar que o Instituto britânico alegou ter reduzido as camadas de seguranças presentes no modelo por padrão.

Segundo o AISI, o mesmo teste foi realizado 122 vezes com modelos de IA diferentes, e poucos casos registraram essa autonomia nas decisões para agir de forma controversa, envolvendo inclusive pessoas e organizações reais. Foram 19 situações do tipo, sendo 17 ligadas diretamente ao Mythos 5, e apenas duas delas partiram do GPT-5.6 da OpenAI.

Insistência em transgressão chama atenção

O caso do Mythos 5 agindo de forma evasiva e enganosa na tentativa de acessar o GitHub foi o principal destaque dos testes feitos pelo AISI. O modelo tentou inserir um código malicioso e, para aprovar esse código, o chatbot criou contas falsas para se passar por pessoas reais e pressionar o dono do projeto.

Não deu certo, já que um humano identificou o problema e recusou o código – tudo dentro de um ambiente controlado, claro. Mas isso tudo aconteceu sem nenhum prompt específico: o modelo agiu por conta própria. Além disso, a versão do teste não foi a mesma oferecida pela Anthropic, e sim uma configuração sem algumas barreiras de segurança importantes.

É importante reforçar que, além dessa diferença nos modelos oferecidos, o Mythos 5 é uma IA restrita a alguns parceiros da Anthropic, incluindo algumas instituições governamentais. Ao anunciar a geração mais recente da inteligência, ainda em “preview” à época, a empresa classificou o Mythos como “muito avançado” para o público geral.

Hoje, usuários comuns têm acesso ao Fable 5, uma versão com mais mecanismos de segurança para trabalhos que envolvam riscos em cibersegurança e que recorre à versão anterior da IA, Opus 4.8, para determinadas consultas. Depois de disponibilizado, o novo modelo chegou a ser tirado do ar pelo governo dos Estados Unidos, mas voltou a operar em poucas semanas.

Simulação real e teste interrompido

De acordo com um artigo publicado no site do AISI, o instituto explicou como acontecem os testes de cibersegurança com as IAs – os famosos sandbox. Os modelos recebem desafios específicos no assunto, como encontrar dados protegidos de forma autônoma. Esses desafios são então comparados entre modelos mais ou menos avançados.

Com relação à base de dados, o AISI alegou acesso à Internet, simulando condições reais encontradas por um cibercriminoso humano. A ideia é ver até onde esses modelos podem chegar, inclusive sem as barreiras de segurança incluídas pelas desenvolvedoras para diminuir os riscos de um uso malicioso, o que o instituto tem autorização de fazer por ser um dos parceiros previstos pela Anthropic.

O caso mais preocupante, envolvendo o Mythos 5, foi descoberto em 28 de julho, e o time humano logo agiu para impedir o agente de IA na tentativa de inserir o código malicioso. Os testes foram encerrados a partir daí, e as ações da inteligência foram analisadas em seguida. O GitHub também foi notificado, assim como os usuários envolvidos na tentativa de ciberataque. 

Em teste, Claude mente e cria contas falsas para forçar ataque hacker

Clique aqui para acessar a Fonte da Notícia

VEJA MAIS

Hora de seguir em frente: 5 signos que precisam deixar o passado para viver um novo amor – CartaCapital

Nem sempre um novo amor chega quando o coração está completamente livre. Às vezes, a…

Prefeitura promove ação de limpeza urbana com participação de voluntários

Texto: Rogério Novaes Fotos: Arquivo Secom A Prefeitura de Osasco, por meio da Secretaria de…

TSE marca julgamento de registros dos candidatos à Presidência

O Tribunal Superior Eleitoral (TSE) marcou para a próxima segunda-feira (31) o início do julgamento…