Segurança de IA é testada após hackers usarem Claude para invadir OpenAI

Independentes pesquisadores de segurança conseguiram usar a IA Claude, desenvolvida pela Anthropic, para acessar contas de funcionários da OpenAI, exposto falhas nos sistemas de defesa da empresa, conforme relatado pelo The Wall Street Journal nesta quinta-feira.

A equipe de três da startup Hacktron AI realizou o ataque como parte de um programa de recompensas por bugs da OpenAI, recebendo um prêmio de US$ 6,5 mil. Os pesquisadores conseguiram combinar duas vulnerabilidades críticas para acessar múltiplas contas de funcionários da OpenAI no ChatGPT, permitindo-lhes entrar no sistema da empresa.

A OpenAI afirma ter corrigido as questões identificadas pela equipe de Hacktron, momento em que as principais empresas de IA estão sob crescente pressão sobre a segurança.

‘Se alguém pode fazer isso por US$ 200 por mês, qualquer empresa pode ser hackeada’, afirmou Matt Fredrikson, CEO da Gray Swan, uma empresa de segurança de IA.

O ponto de entrada foi um defeito em Discourse, o software de comunidade da OpenAI, que processa imagens em formato HEIF ou HEIC, padrão usado por iPhones. Um bug oculto em libheif permitiu que os hackers injetassem instruções maliciosas.

Os pesquisadores notaram que a vulnerabilidade já havia sido corrigida por desenvolvedores de libheif, mas não formalmente marcada como uma falha de segurança, o que explicaria por que o software ainda estava em uso.