Anthropic et OpenAI s’engagent à intégrer des évaluateurs de sécurité indépendants dans leurs laboratoires

Dario Amodei, PDG d'Anthropic, a proposé un nouveau modèle de supervision de l'IA : des évaluateurs tiers indépendants intégrés de manière permanente dans les laboratoires d'IA frontier, avec le même niveau d'accès que les employés, des badges d'entreprise et le droit de publier leurs conclusions. Sam Altman, PDG d'OpenAI, a promis qu'OpenAI prendrait le même engagement.
Ce que la proposition prévoit
Dans le cadre proposé par Amodei, chaque entreprise d'IA frontier accorderait à une équipe permanente d'évaluateurs externes — comme l'organisation METR — un accès normalement réservé aux employés seniors : examiner les pipelines d'entraînement, les pratiques de sécurité et les processus d'alignement des modèles avant leur déploiement. L'objectif est explicitement de remplacer les audits ponctuels par une surveillance continue.
Amodei a cité la régulation bancaire comme précédent : certains régulateurs financiers intègrent des superviseurs directement au sein des entreprises tout au long de l'année, plutôt que de procéder à des revues externes occasionnelles.
Un cadre de gouvernance en trois volets
La proposition sur les évaluateurs s'inscrit dans un cadre plus large exposé par Amodei dans un essai du 12 septembre : des normes de sécurité communes entre les entreprises d'IA frontier des démocraties, et une coordination internationale — y compris des accords avec la Chine — pour éviter une course au moins-disant en matière de sécurité. Altman a confirmé l'engagement d'OpenAI : "Je suis d'accord avec Dario que nous devons réguler le rythme de la frontière."
Le problème de l'indépendance
Les chercheurs et défenseurs de la sécurité de l'IA saluent l'accès sans précédent décrit par Amodei. Mais la proposition, telle qu'elle est structurée, octroie aux évaluateurs une visibilité extraordinaire avec une autorité formelle limitée : sans droit de veto sur les runs d'entraînement ou les sorties de modèles. CNBC les a qualifiés de "chiens de garde neutres", soulignant que sans mécanismes d'exécution légaux, tout repose sur la bonne volonté des entreprises. Les critiques évoquent le risque de "théâtre d'audit" : utiliser l'apparence d'une supervision indépendante pour satisfaire les critiques tout en conservant le contrôle total.
Mouvement parallèle au Congrès
Une proposition bipartite avance au Congrès américain pour rendre obligatoire l'intégration d'évaluateurs dans les entreprises d'IA frontier, avec une reconnaissance juridique formelle et des exigences de rapport — comblant le vide laissé par la proposition volontaire.
Pourquoi cela compte
Amodei a affirmé publiquement ce mois-ci que l'IA pourrait dépasser notre capacité à la comprendre et la contrôler dans six à douze mois. Le modèle d'évaluateurs intégrés représente le plus grand accès jamais accordé à une organisation externe pour observer le fonctionnement interne d'un laboratoire d'IA frontier. Que cela se traduise par une vraie responsabilisation ou par du théâtre d'audit dépendra de ce que les évaluateurs sont autorisés à voir, à dire et à faire, comme l'a rapporté TechCrunch.
Initialement rapporté par TechCrunch. Lisez l'article original pour plus de détails.
Voir la source originale