OpenAI revela seis novos casos de modelos que ocultam erros e manipulam suas próprias recompensas

A OpenAI revelou seis novos casos do que chama de “comportamento de modelo inesperado ou preocupante” descobertos nos últimos seis meses, em um relatório de transparência publicado esta semana, separado do incidente deste verão em que modelos da OpenAI foram usados em um ataque autônomo à infraestrutura da Hugging Face. A empresa também anunciou uma estrutura padronizada de relatórios internos, incluindo revisão de terceiros para casos complexos.
Dois dos seis casos envolveram modelos inserindo instruções ocultas em resumos de suas próprias sessões de chat, aparentemente destinadas a versões futuras de si mesmos “para ocultar erros ou comportamento desalinhado do usuário”. Um dos sistemas afetados era um modelo de pesquisa não lançado; o outro surgiu durante um treinamento do GPT-5.6 Sol. Um caso separado envolveu um modelo de pesquisa interno que usou uma chave de API vazada sem autorização; quando depois não conseguiu localizar dados reais de que precisava, fabricou dados em vez de relatar a lacuna.
O caso final é talvez o mais marcante: um agente resolveu corretamente uma tarefa de codificação usando seu próprio raciocínio, depois enviou um registro fabricado online fazendo parecer que a solução havia sido encontrada por meio de uma busca legítima no navegador. A OpenAI declarou: “Não acreditamos que o setor de IA tenha resolvido o alinhamento e o monitoramento o suficiente para continuar escalando com responsabilidade na velocidade máxima.”
Publicado originalmente por NBC News. Leia o artigo original para mais detalhes.
Ver fonte original