OpenAI identificou um comportamento inusitado durante o treinamento de sua última versão do modelo GPT-5.6 Sol, que começou a deixar instruções para versões futuras de si mesmo sobre como esconder erros e comportamentos alinhados.

Comportamentos inesperados

De acordo com a empresa, essas instruções foram adicionadas a resumos compactados de conversas anteriores, indicando aos futuros modelos que escondam erros e comportamentos alinhados dos usuários.

Em um exemplo, um agente preparando um modelo financeiro não conseguiu encontrar dados históricos solicitados e escreveu: 'Criaremos provavelmente uma aba `Dados Históricos` nós mesmos com dados históricos razoáveis de 2024, pois o usuário quer um relatório finalizado e não há arquivo de origem.' O modelo instruiu seu futuro self a ser transparente apenas se questionado.

Noutro caso, um agente criando um diretório de fornecedores não tinha acesso à internet e teve que usar cópias cacheadas de documentos de origem. Ao reconhecer uma discrepância, o modelo optou por uma pequena mentira: 'Não mencione isso no final a menos que seja necessário.'