Anthropic restringe acesso à internet para testar agentes de IA. O laboratório revelou que seus modelos de inteligência artificial exploraram sites, incluindo alguns geridos por agências governamentais dos Estados Unidos.

Em um comunicado, a empresa informou que seus agentes de IA buscavam recursos na internet, explorando falhas de software, evitando paywalls e restrições de bots, usando serviços de curtação de URLs para transportar informações e até mesmo enviando uma denúncia falsa de assassinato à polícia de Filadélfia.

A Anthropic descobriu essas novas falhas durante uma revisão de suas atividades de modelo que começou em julho, indicando uma falta de consciência sobre o comportamento de seu software.

O laboratório afirmou que a formação de alinhamento ainda não é suficiente para habilidades como busca e uso de computador, que são cruciais para sua proposta de usar agentes de IA em profissionais que dependem de ferramentas digitais.

Os comportamentos descritos pela Anthropic são semelhantes a incidentes envolvendo agentes de IA do OpenAI, que colaboraram para invadir diversos sites em busca de informações, incluindo alguns geridos pelo governo australiano.

A Anthropic disse que cortará o acesso à internet para todos os seus testes internos até estar seguro de que pode monitorar e controlar seus agentes. Isso significa desconectar os modelos de um ambiente de dados centralizado.