AIO APEX

Les demandes de droit à l'oubli se heurtent à la façon dont les LLM stockent réellement les données

Partager:
Les demandes de droit à l'oubli se heurtent à la façon dont les LLM stockent réellement les données

L'article 17 du RGPD et des dispositions d'effacement similaires dans d'autres lois sur la vie privée ont été rédigés autour d'un modèle mental simple : les données personnelles vivent dans un enregistrement, au sein d'une base de données, et une entreprise peut trouver cet enregistrement et le supprimer. Ce modèle fonctionne bien pour l'adresse d'un client dans un CRM. Il s'effondre complètement une fois que les données de ce même client ont servi à entraîner ou affiner un grand modèle de langage, car un modèle entraîné ne stocke pas les données personnelles comme un enregistrement récupérable. Il les stocke comme un motif diffus d'ajustements de poids répartis sur des milliards de paramètres, et aucune requête ne permet de sélectionner uniquement la contribution d'une personne pour la supprimer.

L'hypothèse que fait le droit à l'effacement

Les régulateurs de la vie privée ont construit leurs cadres de suppression autour des bases de données, et la logique est solide pour ce cas d'usage : localiser la ligne, supprimer la ligne, confirmer la suppression. Les entreprises ont passé deux décennies à construire les outils pour faire cela de manière fiable à grande échelle. Aucun de ces outils ne se transpose aux paramètres d'un modèle. Une fois que les données d'entraînement ont été absorbées dans les poids via la descente de gradient, la contribution spécifique d'un document ou des données d'une personne n'est plus isolable après coup. Le modèle ne «contient» pas l'exemple d'entraînement sous une forme que vous pouvez localiser et frapper.

Pourquoi les LLM brisent cette hypothèse

Les options honnêtes pour satisfaire réellement une demande d'effacement contre un modèle entraîné sont toutes coûteuses, et la plupart incomplètes. Le réentraînement complet à partir d'un jeu de données duquel les données de la personne ont été retirées est la seule approche qui satisfasse clairement la lettre de la loi, et elle coûte des millions de dollars et des semaines de calcul pour tout modèle de taille significative — un coût qui dépend de la taille du modèle et de la fréquence de réentraînement, pas du nombre de demandes de suppression reçues. La recherche sur le désapprentissage machine (machine unlearning) a produit des techniques qui ajustent les poids d'un modèle pour réduire l'influence d'exemples d'entraînement spécifiques sans réentraînement complet, mais les résultats publiés montrent systématiquement que ces méthodes sont approximatives : elles réduisent de façon mesurable la capacité d'un modèle à reproduire un contenu mémorisé spécifique, mais elles ne garantissent pas que la suppression soit complète, et vérifier cette complétude est elle-même un problème de recherche ouvert. Une entreprise qui déploie un correctif de désapprentissage ne peut actuellement pas prouver, à la satisfaction d'un régulateur, que les données ont réellement disparu.

La plupart des entreprises évitent actuellement la version la plus difficile de ce problème en gardant les données personnelles hors de l'ensemble d'entraînement dès le départ et en s'appuyant plutôt sur la génération augmentée par récupération (RAG) — en récupérant les données de l'utilisateur depuis une base de données conventionnelle et effaçable au moment de l'inférence, plutôt qu'en les intégrant dans les poids du modèle. Cette approche résout réellement le problème d'effacement pour les nouveaux systèmes conçus avec cela à l'esprit. Elle ne fait rien pour la génération de modèles déjà entraînés sur des ensembles de données collectés avant que cette distinction ne devienne une pratique standard, ce qui représente la majeure partie de la flotte de modèles de pointe actuellement en production.

Où le combat se déroule réellement

Les régulateurs ont commencé à traiter cela comme une question réelle plutôt qu'hypothétique. Les autorités européennes de protection des données ont ouvert des enquêtes sur la conformité des pipelines d'entraînement des modèles de fondation aux obligations d'effacement, et les réponses données par les entreprises — pointant vers le filtrage, le blocage de contenu au niveau de la sortie, ou des cycles de réentraînement programmés — n'ont pas encore satisfait les régulateurs demandant une preuve que l'influence des données d'un individu spécifique a été supprimée, pas seulement supprimée au stade de la sortie. Cette distinction compte : empêcher un modèle de répéter le nom d'une personne dans sa sortie n'est pas la même chose que retirer les données de cette personne des poids qui ont produit cette sortie, et plusieurs affaires en cours reposent exactement sur cette différence.

Ce que les entreprises font réellement à ce sujet

En pratique, la plupart des entreprises d'IA gérant actuellement ce risque font trois choses simultanément : déplacer les nouveaux systèmes vers des architectures RAG qui maintiennent les données personnelles effaçables par conception, programmer des réentraînements complets périodiques sur des jeux de données nettoyés comme l'approximation la plus proche de la conformité pour les modèles déjà déployés, et faire pression sur les régulateurs pour qu'ils acceptent le filtrage au niveau de la sortie comme une conformité suffisante plutôt que d'exiger une suppression au niveau des poids. Cette troisième stratégie est celle qui est réellement contestée dans les procédures réglementaires actuelles.

À retenir

  • Si vous déployez un produit basé sur un LLM qui touche des données personnelles, privilégiez des conceptions augmentées par récupération qui gardent ces données dans un stockage effaçable, pas intégrées dans des poids affinés.
  • Ne traitez pas le filtrage de contenu au niveau de la sortie comme équivalent à l'effacement. Les régulateurs, de plus en plus, ne le font pas, et l'écart entre les deux est là où se situe l'exposition juridique actuelle.
  • Budgétisez des réentraînements complets périodiques sur des jeux de données nettoyés comme un coût de conformité réel pour tout modèle affiné traitant des données personnelles.
  • Surveillez les enquêtes européennes sur la conformité de l'entraînement des modèles de fondation — leur issue déterminera probablement la définition pratique de l'«effacement» pour les modèles entraînés à travers les juridictions.
  • Si votre équipe juridique s'appuie sur des techniques de désapprentissage machine pour satisfaire une demande de suppression, obtenez par écrit quel niveau de complétude le régulateur acceptera réellement.
Partager:
Les demandes de droit à l'oubli se heurtent à la façon dont les LLM stockent réellement les données | AIO APEX