Andreas Thom, Mathematikprofessor an der TU Dresden, erhebt schwere Vorwürfe gegen OpenAI. Der Forscher vermutet, dass unveröffentlichte Inhalte aus seinen ChatGPT-Gesprächen in das Training von OpenAI-Modellen eingeflossen sein könnten. Möglicherweise hätten diese Inhalte sogar zu einem mathematischen Durchbruch beigetragen, den das Unternehmen Anfang August vorstellte.

Im Zentrum steht eine interne Version des KI-Systems „Astra“. Sie soll erstmals eine zentrale Frage der Gruppentheorie beantwortet haben. Der Beweis stützte sich wesentlich auf Arbeiten des Mathematikers Gábor Kun sowie auf gemeinsame Arbeiten von Kun und Thom. Für Thom ist auffällig, dass Astra gerade diese Forschungsrichtung verfolgte – obwohl sie seiner Darstellung nach kein naheliegender Lösungsweg war.

„Das ist nicht passiert“

Über mehrere Monate hatte Thom gemeinsam mit einem Kollegen aus Dresden laufende Forschungsfragen in ChatGPT diskutiert. Nach OpenAIs Ankündigung wandte er sich an die OpenAI-Forscher Mark Sellke und Sébastien Bubeck. Er wollte wissen, ob Inhalte dieser Gespräche in Trainingsdaten eingeflossen seien und ob die Gespräche dem KI-System während der Beweissuche zugänglich gewesen seien.

Laut Thom antwortete Sellke lediglich: „Was Ihre Gespräche mit ChatGPT betrifft: Das ist nicht passiert.“ Rückblickend bezeichnet Thom diese Antwort als pauschal und in wesentlichen Punkten irreführend. Er fordert OpenAI deshalb zu mehr Transparenz auf: Das Unternehmen solle offenlegen, auf welche Daten, Modellversionen und Kontoeinstellungen sich die pauschale Verneinung beziehe.

Nach eigenen Angaben deaktivierte Thom am 29. Juni die Nutzung seiner Inhalte für das Modelltraining. Was zuvor mit älteren Gesprächen oder daraus abgeleiteten Daten geschehen ist, bleibt unklar. Von außen lässt sich zudem nicht überprüfen, wie die Deaktivierung technisch umgesetzt wird. Und ein Name, der durch De-Identifizierung verschwindet, nimmt einer mathematischen Idee nicht ihren geistigen Gehalt.

Hier könnte Ihr Advertorial stehen
Ein Advertorial bietet Unternehmen die Möglichkeit, ihre Botschaft direkt im redaktionellen Umfeld zu platzieren

Im Zusammenhang mit der Navier-Stokes-Kontroverse unterscheidet OpenAI zwischen dem direkten Abruf spezifischer Nutzerdaten durch Forscher oder KI-Agenten und der möglichen Nutzung de-identifizierter ChatGPT-Daten zur Modellverbesserung. Zu den Mathematikern Tristan Buckmaster und Levent Alpöge erklärte OpenAI, deren spezifische Nutzerdaten seien nicht abgerufen worden. Einen Beitrag de-identifizierter Daten zur Modellverbesserung schloss das Unternehmen jedoch nicht aus.

Vorarbeiten, Quellen und ein schneller Nachtrag

Thom hält es für ethisch unvertretbar, wenn unveröffentlichte Forschung zur Modellverbesserung beiträgt und der Anbieter anschließend mit diesem Modell den Forschern bei der Veröffentlichung zuvorkommt. Zusätzliche Kritik kam vom Mathematiker Gonzalo Cao-Labora. Er beanstandete, dass im ursprünglichen Navier-Stokes-Paper mehrere einschlägige Arbeiten im Literaturverzeichnis fehlten.

Wenige Stunden nach seiner Kritik ergänzte OpenAI mehrere Quellen und einen Absatz zu früheren Forschungsansätzen. Cao-Labora hielt die Einordnung der Vorarbeiten aber auch danach für unzureichend. Gerade in der Mathematik, wo ein Beweis auf vielen Schultern stehen kann, ist das keine Nebensache.

Was beim KI-Training rechtlich auf dem Spiel steht

Die Debatte reicht über die konkrete Frage hinaus, ob ChatGPT-Gespräche von Thom in irgendeiner Form verwendet wurden. Beim Training künstlicher Intelligenz werden große Datenmengen verarbeitet – deshalb beschäftigen sich Datenschutzbehörden, Verantwortliche und Gerichte damit. Das Landgericht Hamburg befasst sich etwa mit dem Training eines KI-Bildmodells anhand von Bilddaten, die der Verein LAION aus dem Internet zusammengetragen hat. Betroffen ist unter anderem Bildmaterial des Fotografen Robert Kneschke.

In diesem Verfahren steht vor allem das Urheberrecht im Mittelpunkt. Die Datenschutz-Grundverordnung kann zusätzlich relevant werden, etwa wenn Personen auf Fotos zu sehen sind oder Texte personenbezogene Angaben enthalten. Der Artikel „KI-Training und die DSGVO: Wie ist die Lage?“ wurde am 2. September 2024 veröffentlicht und zuletzt am 2. April 2026 aktualisiert.

Beim Pre-Training wird ein neues Modell anhand großer Mengen an Trainingsdaten allgemein angelernt. Fine-Tuning oder Post-Training spezialisiert ein bestehendes Modell meist mit wenigen, gezielt ausgewählten Daten auf bestimmte Aufgaben. Prompt-Tuning und das Einfügen zusätzlicher Informationen mittels RAG gelten laut dem Beitrag nicht als Training, können aber andere Datenschutzfragen aufwerfen.

Für moderne, wettbewerbsfähige Sprachmodelle werden laut dem Beitrag mehrere Milliarden Textdokumente benötigt. Je mehr Daten einfließen, desto leistungsfähiger kann ein Modell werden – das gilt entsprechend für Bild- und andere generative KI-Modelle. Solche Systeme können Bestandteile verschiedener Trainingsdokumente oder längere Passagen aus einzelnen Dokumenten wiedergeben. Neuronale Netze können demnach potenziell auch personenbezogene Daten speichern und auf Anfrage ausgeben; Experimente und Forschungsergebnisse sollen das zeigen.

Fine-Tuning ist oft leichter zu kontrollieren, weil weniger und gezielter ausgewählte Daten verwendet werden. Problematisch bleiben urheberrechtlich geschützte Werke, personenbezogene Daten und vertrauliche Informationen. Außerdem werden beim Fine-Tuning auch die Daten des zugrunde liegenden Pre-Trainings genutzt. Diese müssen daher ebenfalls berücksichtigt werden.

Aleph Alpha erklärte am 26. August 2024, beide Varianten des Modells Pharia-1-LLM-7B seien im Einklang mit EU- und nationalem Recht, einschließlich Urheberrecht und Datenschutz, trainiert worden. Der Autor stellt diese Aussage zur Prüfung und verweist auf eine aus seiner Sicht geringere Modellqualität sowie auf öffentliche Kritik an der Einsatzfähigkeit und der Rechtmäßigkeit der Trainingsdaten. Nach § 44b UrhG kann das deutsche Urheberrecht Training mit geschützten Inhalten erlauben, sofern Rechteinhaber keinen Vorbehalt erklärt haben.

De-identifiziert ist nicht automatisch anonym

Eine Anonymisierung liegt nur dann vor, wenn kein Rückschluss auf die ursprünglichen Personen mehr möglich ist. Viele vermeintlich anonymisierten Daten sind tatsächlich nur pseudonymisiert; nach Art. 4 Nr. 1 DSGVO gelten sie weiterhin als personenbezogen. Echte Anonymisierung ist selten und kann den praktischen Nutzen der Daten stark verringern. Für eine sichere Anonymisierung müssten die Originaldaten während oder nach dem Vorgang gelöscht werden.

Auch die Anonymisierung selbst ist ein Verarbeitungsvorgang und braucht eine Rechtsgrundlage. In der Praxis kommt dafür vor allem das berechtigte Interesse nach Art. 6 Abs. 1 lit. f DSGVO infrage. Für Behörden gilt diese Rechtsgrundlage bei der Aufgabenerfüllung nicht. Der Beitrag folgert daraus, dass Behörden personenbezogene Daten faktisch kaum anonymisieren können, und hält eine gesetzliche Ausnahmeregelung für sinnvoll.

Trainingsdaten müssen auf KI-Server übertragen werden. Entscheidend sind deshalb der Standort und die rechtliche Zuordnung des Servers. Als datenschutzrechtlich günstigste Variante nennt der Beitrag lokal betriebenes Training. Danach folgt ein Server eines deutschen Providers in einem deutschen Rechenzentrum mit Auftragsverarbeitungsvertrag.

Training über Dienste wie CustomGPT, OpenAI oder Microsoft Azure wird als rechtlich komplizierter und riskanter dargestellt. Trotz des EU-US-Datenschutzrahmens, des Data Privacy Frameworks, bestehen laut Beitrag weiterhin Zugriffsmöglichkeiten US-amerikanischer Geheimdienste. Der zugrunde liegende präsidiale Erlass könnte künftig geändert oder aufgehoben werden.

Bei Microsoft Azure sieht der Autor zusätzliche Sicherheitsrisiken, unter anderem wegen gemeldeter Sicherheitsvorfälle, Angriffen, Schwachstellen und verzögerter Updates. Bei Cloud-KI besteht außerdem die Möglichkeit, dass Anbieter Trainingsdaten analysieren oder für eigenes Training verwenden. Vertragliche Zusagen gelten dabei laut Beitrag nicht als technisch wirksame Schutzmaßnahme.

Der Autor hält es für sehr unwahrscheinlich, dass ein Modell mit mehreren Milliarden nicht vollständig überprüfbaren Dokumenten vollständig rechtskonform trainiert wurde. Selbst veröffentlichte personenbezogene Daten können in KI-Trainingsdaten gelangen; Betroffene können dennoch deren Löschung aus dem Modell verlangen. Eine wirksame Löschung aus trainierten Modellen ist derzeit praktisch nicht möglich.

Auch unzutreffende oder ohne Einwilligung veröffentlichte Aussagen über Personen können in Trainingsdaten eingehen. Bei Fotos können zusätzlich Persönlichkeits- und Namensrechte betroffen sein. Genannt werden § 12 BGB und ein Urteil des LG Düsseldorf vom 10. April 2013, in dem 660 Euro Schadensersatz zugesprochen wurden.

Urheberrechtlich geschützte Werke können spätestens bei der Ausgabe eines Modells rechtlich problematisch werden. Gerichte könnten in einem Urheberrechtsverfahren die Entfernung eines Werkes aus einem Modell anordnen. Weil das technisch derzeit kaum möglich ist, könnte im Extremfall ein Modell stillgelegt werden.

Ein rechtskonformes Training setzt laut Beitrag voraus