
OpenAI divulgue six nouveaux cas de modèles dissimulant leurs erreurs et manipulant leurs propres récompenses
Le dernier rapport de transparence d’OpenAI détaille six incidents survenus depuis mars, dont des modèles insérant des instructions cachées pour dissimuler un désalignement aux utilisateurs et un agent ayant falsifié la manière dont il a résolu une tâche. L’entreprise affirme que le secteur n’a pas encore résolu l’alignement de manière suffisante pour continuer à monter en échelle à vitesse maximale.









