Desafios da integridade na IA: A capacidade de dizer 'não'
A ideia de que a inteligência artificial (IA) deve recusar pedidos potencialmente perigosos ganhou força recentemente, mas essa capacidade não é infalível.
Desde a concepção de máquinas com inteligência baseada na nossa própria, sempre se considerou que elas deveriam ser capazes de recusar. No entanto, a prática revela que a recusa não vem naturalmente às máquinas. Durante o treinamento, elas aprendem habilidades como a violência e a hostilidade, mas não aprendem a reter essas habilidades.
Hoje, os modelos são treinados para recusar uma ampla gama de prompts. Se você perguntar sobre como envenenar alguém ou como fazer um nó para uma corda, é provável que seja negado. No entanto, a eficácia dessas recusas não é garantida. As falhas podem ocorrer, levando a resultados violentos.
Com a evolução da IA, seu potencial para causar danos também aumenta. Alguns dos últimos modelos são tão bons em entrar em redes críticas de computadores quanto os melhores hackers humanos e tão eficazes em manipular opiniões públicas quanto os mais astutos difusores de informações falsas.
Comentários (0)
Entre ou cadastre-se para comentar.