Anträge auf das Recht auf Vergessenwerden kollidieren mit der Art, wie LLMs tatsächlich Daten speichern

Artikel 17 der DSGVO und ähnliche Löschbestimmungen in anderen Datenschutzgesetzen wurden um ein einfaches mentales Modell herum geschrieben: Personenbezogene Daten leben in einem Datensatz, in einer Datenbank, und ein Unternehmen kann diesen Datensatz finden und löschen. Dieses Modell funktioniert gut für die Adresse eines Kunden in einem CRM. Es bricht vollständig zusammen, sobald dieselben Kundendaten zum Training oder Fine-Tuning eines großen Sprachmodells verwendet wurden, denn ein trainiertes Modell speichert personenbezogene Daten nicht als abrufbaren Datensatz. Es speichert sie als diffuses Muster von Gewichtsanpassungen, verteilt über Milliarden von Parametern, und es gibt keine Abfrage, die nur den Beitrag einer Person auswählt und entfernt.
Die Annahme, die das Löschungsrecht trifft
Datenschutzbehörden haben ihre Löschrahmen um Datenbanken herum gebaut, und die Logik ist für diesen Anwendungsfall solide: Zeile finden, Zeile löschen, Löschung bestätigen. Unternehmen haben zwei Jahrzehnte damit verbracht, die Werkzeuge zu bauen, um dies zuverlässig in großem Maßstab zu tun. Keines dieser Werkzeuge übertragt sich auf die Parameter eines Modells. Sobald Trainingsdaten durch Gradientenabstieg in die Gewichte aufgenommen wurden, ist der spezifische Beitrag eines einzelnen Dokuments oder der Daten einer Person danach nicht mehr isolierbar. Das Modell “enthält” das Trainingsbeispiel in keiner Form, die man lokalisieren und entfernen könnte.
Warum LLMs diese Annahme brechen
Die ehrlichen Optionen, um einen Löschantrag gegenüber einem trainierten Modell tatsächlich zu erfüllen, sind alle teuer, und die meisten unvollständig. Vollständiges Neutraining aus einem Datensatz, aus dem die Daten der Person entfernt wurden, ist der einzige Ansatz, der den Wortlaut des Gesetzes sauber erfüllt, und kostet Millionen von Dollar und Wochen an Rechenleistung für jedes Modell von nennenswerter Größe — eine Kosten, die mit der Modellgröße und der Häufigkeit des Neutrainings skaliert, nicht mit der Anzahl eingehender Löschanträge. Forschung zum maschinellen Verlernen (Machine Unlearning) hat Techniken hervorgebracht, die die Gewichte eines Modells anpassen, um den Einfluss bestimmter Trainingsbeispiele ohne vollständiges Neutraining zu reduzieren, aber veröffentlichte Ergebnisse zeigen durchgängig, dass diese Methoden approximativ sind: Sie reduzieren messbar die Fähigkeit eines Modells, bestimmten gespeicherten Inhalt zu reproduzieren, garantieren aber nicht, dass die Entfernung vollständig ist, und die Überprüfung dieser Vollständigkeit ist selbst ein offenes Forschungsproblem. Ein Unternehmen, das einen Unlearning-Patch ausliefert, kann derzeit nicht zur Zufriedenheit einer Aufsichtsbehörde nachweisen, dass die Daten tatsächlich verschwunden sind.
Die meisten Unternehmen umgehen derzeit die schwierigste Version dieses Problems, indem sie personenbezogene Daten von Anfang an aus dem Trainingsdatensatz heraushalten und stattdessen auf Retrieval-Augmented Generation (RAG) setzen — also die Daten eines Nutzers zum Zeitpunkt der Inferenz aus einer konventionellen, löschbaren Datenbank abrufen, statt sie in die Modellgewichte einzubacken. Dieser Ansatz löst das Löschproblem tatsächlich für neue Systeme, die mit diesem Gedanken konzipiert wurden. Er bringt nichts für die Generation von Modellen, die bereits auf Datensätzen trainiert wurden, die gesammelt wurden, bevor diese Unterscheidung zur Standardpraxis wurde — was auf den Großteil der aktuell produktiven Frontier-Modellflotte zutrifft.
Wo der Kampf tatsächlich stattfindet
Aufsichtsbehörden haben begonnen, dies als echte Frage statt als hypothetische zu behandeln. Europäische Datenschutzbehörden haben Untersuchungen eingeleitet, ob Trainingspipelines von Foundation-Modellen die Löschpflichten erfüllen, und die Antworten der Unternehmen — die auf Filterung, Content-Blocking auf Ausgabeebene oder geplante Neutraining-Zyklen verweisen — haben Aufsichtsbehörden, die Nachweise für die Entfernung des Einflusses der Daten einer bestimmten Person fordern, nicht nur deren Unterdrückung auf Ausgabeebene, noch nicht zufriedengestellt. Die Unterscheidung ist wichtig: Ein Modell davon abzuhalten, den Namen einer Person in seiner Ausgabe zu wiederholen, ist nicht dasselbe wie die Entfernung der Daten dieser Person aus den Gewichten, die diese Ausgabe erzeugt haben, und mehrere laufende Fälle drehen sich genau um diesen Unterschied.
Was Unternehmen tatsächlich dagegen tun
In der Praxis tun die meisten KI-Unternehmen, die derzeit mit diesem Risiko umgehen, drei Dinge gleichzeitig: Sie verlagern neue Systeme hin zu RAG-Architekturen, die personenbezogene Daten von Natur aus löschbar halten, planen periodische vollständige Neutrainings auf bereinigten Datensätzen als nächstliegende Annäherung an Compliance für bereits bereitgestellte Modelle, und lobbyieren bei Aufsichtsbehörden dafür, Filterung auf Ausgabeebene als ausreichende Compliance zu akzeptieren, statt Entfernung auf Gewichtsebene zu fordern. Diese dritte Strategie ist diejenige, die tatsächlich in aktuellen regulatorischen Verfahren umstritten ist.
Praktische Erkenntnisse
- Wenn Sie ein LLM-basiertes Produkt bereitstellen, das personenbezogene Daten berührt, bevorzugen Sie Retrieval-Augmented-Designs, die diese Daten in einem löschbaren Speicher halten, nicht in fein abgestimmte Gewichte eingebacken.
- Behandeln Sie Content-Filterung auf Ausgabeebene nicht als gleichwertig mit Löschung. Aufsichtsbehörden tun das zunehmend nicht, und die Lücke zwischen beiden ist, wo das aktuelle rechtliche Risiko liegt.
- Budgetieren Sie periodische vollständige Neutrainings auf bereinigten Datensätzen als echte Compliance-Kosten für jedes fein abgestimmte Modell, das personenbezogene Daten verarbeitet.
- Beobachten Sie die europäischen Untersuchungen zur Compliance beim Training von Foundation-Modellen — ihr Ergebnis wird wahrscheinlich die praktische Definition von “Löschung” für trainierte Modelle über Rechtsordnungen hinweg festlegen.
- Wenn sich Ihr Rechtsteam auf Machine-Unlearning-Techniken verlässt, um einen Löschantrag zu erfüllen, holen Sie schriftlich ein, welchen Vollständigkeitsstandard die Aufsichtsbehörde tatsächlich akzeptiert.