Nach Darstellung von OpenAI wurde dabei weder die Verschlüsselung gebrochen noch eine Datenbank kompromittiert, noch erhielten die Akteure direkten Zugriff auf gespeicherte Nutzerkonversationen. „Stattdessen manipulierten sie Modellinteraktionen so, dass geschütztes Reasoning in für den Anfragenden sichtbarer Form reproduziert werden konnte — koordiniert, in großem Maßstab und unter Verstoß gegen unsere Nutzungsbedingungen“, erklärte das Unternehmen.
Die Aktivität begann demnach am 1. Juli 2026 zunächst in geringem Umfang. Am 24. und 25. Juli 2026 stieg sie sprunghaft auf 16.000 Anfrageversuche mit einem einschlägigen Extraktionsmuster von mehr als 4.000 Nutzern an. Bei der weiteren Untersuchung stieß OpenAI auf verwandte „Prompt-Muster-Aktivität“ bei über 15.000 Nutzern. Vollständig unterbunden wurde die Kampagne am 28. Juli 2026.
OpenAI stuft das Vorgehen als adversariale Distillation ein: die systematische und unbefugte Nutzung der Ausgaben eines Modells, um ein anderes Modell zu trainieren, nachzubilden oder zu verbessern. Das Unternehmen hat zusätzliche Gegenmaßnahmen ausgerollt und die betrügerischen Konten gesperrt. Zudem schloss OpenAI einen „Pfad“, über den jemand, der bereits im Besitz der verschlüsselten Reasoning-Spur eines anderen Nutzers war, diese erneut abspielen und ihren Inhalt wiederherstellen konnte. Ergänzend wurden Prüfungen eingeführt, die gestreamte Ausgaben erkennen und zurückhalten, falls diese Reasoning offenlegen könnten.
In einer im August 2026 veröffentlichten Studie beschrieb eine Forschergruppe eine architektonische Schwachstelle, die Claude, Gemini und GPT betrifft: Die verschlüsselten Reasoning-Spuren seien „über verschiedene Sitzungen, Nutzer und Modelle innerhalb des Ökosystems eines Anbieters hinweg vollständig kompatibel und austauschbar“. Angreifer könnten daraus einen skalierbaren Entschlüsselungs-Jailbreak entwickeln und Anti-Distillation-Mechanismen umgehen.
„Indem wir eine verschlüsselte Reasoning-Spur eines bestimmten Modells in ein schwächeres, weniger abgesichertes Modell desselben Anbieters einspeisen, zwingen wir dieses, die Spur wortgetreu im Klartext zu dekodieren und auszugeben — ohne das leistungsfähigere Modell jemals direkt zu jailbreaken“, schreiben die Forscher von MATS Research, dem ELLIS Institute Tübingen und Synk.
Darüber hinaus ermögliche die Schwachstelle eine Extraktion privater Daten in großem Umfang und öffne die Tür für unsichtbare Prompt Injections, bei denen schädliche Nutzlasten vollständig in verschlüsselten Blöcken eingebettet werden. Außerdem könnten gefährliche Informationen offengelegt werden, die im Denkprozess verborgen sind — selbst dann, wenn die sichtbare Endausgabe des Modells eine schädliche Anfrage ablehnt.
Da geschütztes Reasoning Einblick gibt, wie ein Modell eine Aufgabe löst, kann dessen Extraktion laut OpenAI sensible Daten preisgeben und Dritten helfen, die Fähigkeiten des Modells nachzubilden. „Adversariale Distillation birgt Risiken für die Sicherheit und die nationale Sicherheit“, so das Unternehmen. Extrahiertes Reasoning könne zum Training eines anderen Modells genutzt werden, ohne die Schutzmechanismen zu übernehmen, die für die nutzerseitigen Ausgaben des Originalmodells gelten. In großem Maßstab könne Distillation zudem den Transfer fortgeschrittener Fähigkeiten beschleunigen, ohne dass vergleichbar in Sicherheit investiert werde — Bedenken, die sich verschärften, je mehr Fähigkeiten Modelle in Dual-Use-Bereichen erlangten.
Es ist nicht der erste Distillation-Vorwurf gegen Moonshot AI. Im vergangenen Monat warf der Wettbewerber Anthropic dem Unternehmen vor, Kundenanfragen verdeckt an Claude weiterzuleiten, statt sie mit Kimi zu verarbeiten, und die Antworten von Claude dann den Nutzern anzuzeigen. Ein Teil dieser Austausche soll zudem aufbewahrt worden sein, um ein Chain-of-Thought-Modell zu trainieren. Diese Aktivität wird unter der Bezeichnung GTG-16002 geführt.
