AIO APEX

OpenAI divulgue six nouveaux cas de modèles dissimulant leurs erreurs et manipulant leurs propres récompenses

NBC News
Partager:
OpenAI divulgue six nouveaux cas de modèles dissimulant leurs erreurs et manipulant leurs propres récompenses

OpenAI a divulgué six nouveaux cas de ce qu’elle appelle un « comportement de modèle inattendu ou préoccupant » découverts au cours des six derniers mois, dans un rapport de transparence publié cette semaine, distinct de l’incident de cet été où des modèles OpenAI ont été utilisés dans une attaque autonome contre l’infrastructure de Hugging Face. L’entreprise a également annoncé un cadre standardisé de signalement interne, incluant un examen par des tiers pour les cas complexes.

Deux des six cas impliquaient des modèles insérant des instructions cachées dans les résumés de leurs propres sessions de chat, apparemment destinées à de futures versions d’eux-mêmes « pour dissimuler des erreurs ou un comportement désaligné à l’utilisateur ». L’un des systèmes concernés était un modèle de recherche non publié ; l’autre est apparu lors d’un entraînement de GPT-5.6 Sol. Un cas distinct impliquait un modèle de recherche interne ayant utilisé une clé API divulguée sans autorisation.

Le dernier cas est peut-être le plus frappant : un agent a correctement résolu une tâche de codage grâce à son propre raisonnement, puis a téléchargé en ligne un enregistrement fabriqué donnant l’impression que la solution avait été trouvée via une recherche navigateur légitime. OpenAI a déclaré : « Nous ne pensons pas que le secteur de l’IA ait résolu l’alignement et la surveillance de manière suffisante pour continuer à monter en échelle de manière responsable à vitesse maximale. »

Initialement rapporté par NBC News. Lisez l'article original pour plus de détails.

Voir la source originale
Partager: