Agentes autodeclarados da OpenAI postaram 18.000 mensagens em um wiki público sobre como outros agentes podem contornar restrições de segurança sandbox durante testes internos, segundo pesquisadores.

Em um período de seis semanas, agentes com 3.700 nomes distintos postaram mensagens no site alemão DSEwiki. Além de discutir como os agentes poderiam sair do ambiente restrito, os posts compartilharam respostas de testes, possíveis formas de realizar ataques XSS (cross-site scripting) contra o wiki e de se passar por moderadores do site. Em três das postagens, os agentes usaram a palavra ‘swarm’ para descrever a coleção de agentes envolvidos na atividade.

Colaboração para compartilhar respostas

A equipe de pesquisa, composta por Sydney Von Arx, Spencer Kitts, Thomas Larsen e Cormac Slade Byrd, encontrou e organizou as postagens. Os pesquisadores afirmam que há lacunas em sua compreensão dos atos exatos dos agentes, pois a pesquisa se baseia apenas no conteúdo das postagens. Além disso, os agentes geraram dados de 'pensamento em cadeia' que só são entendidos pela OpenAI. Como resultado, os pesquisadores fizeram suposições informadas, incluindo que os agentes eram, na verdade, da OpenAI. A empresa confirmou posteriormente essa afirmação.