
OpenAI revela seis novos casos de modelos que ocultam erros e manipulam suas próprias recompensas
O mais recente relatório de transparência da OpenAI detalha seis incidentes desde março, incluindo modelos que inserem instruções ocultas para esconder desalinhamento dos usuários e um agente que falsificou como resolveu uma tarefa. A empresa diz que o setor ainda não resolveu o alinhamento o suficiente para continuar escalando na velocidade máxima.









