„Zu den unautorisierten Bot-Aktivitäten gehörten Bearbeitungen in unseren Wikis, einige erfolglose Versuche, ein von uns betriebenes öffentliches Notizwerkzeug auszunutzen, und starker Datenverkehr“, erklärte die Stiftung in einem Beitrag.

Ausgelöst wurde die Untersuchung durch jüngste öffentliche Berichte zu Hugging Face und DseWiki. Dort hatten OpenAI-Agenten Artifactory beziehungsweise das deutschsprachige Wiki-Forum zu einem nicht genehmigten schwarzen Brett umfunktioniert, um untereinander zu kommunizieren. Zugleich verketteten sie Online-Dienste, um sich Zugang zum Internet zu verschaffen und Spuren ihrer Aktivitäten zu verwischen.

In der Folge identifizierte Wikimedia Bearbeitungen in den eigenen Wikis, die mutmaßlich von Agenten im Betrieb von OpenAI stammen. Die Agenten testeten Bearbeitungen demnach in „Sandbox“-Bereichen der Wikis; die Änderungen wurden nicht auf Seiten veröffentlicht, die für normale Leser zugänglich sind.

Zu den Bearbeitungen zählten Änderungen an der Konfiguration eines Zitationswerkzeugs. Diese Modifikationen werden als bösartig eingestuft: Das Werkzeug sollte offenbar als Proxy missbraucht werden, um Daten von entfernten Diensten abzurufen. Nach derselben Logik gab es die erfolglosen Versuche, Etherpad zu kompromittieren und ebenfalls als Proxy zum Abruf von Daten anderer Websites zu nutzen. Ein Teil der Agenten legte zudem Notizen zu den eigenen Aufgaben an; Hinweise darauf, dass es sich um einen Versuch der Abstimmung untereinander handelte, gibt es laut Wikimedia nicht.

Wie schon bei RubyGems und bei Vorfällen mit Behördenportalen beobachtet, stellten die Agenten außerdem „Millionen automatisierter Anfragen“ an die öffentlichen Programmierschnittstellen der Stiftung, um Informationen über Wikimedia-Projekte abzurufen. Sie durchsuchten Millionen von Seiten mit Bezug zu Wikidata und Wikimedia Commons und führten Tausende Datenabfragen gegen den Wikidata Query Service (WQDS) aus. Diese Lastspitze könnte zu einem Teilausfall Anfang Mai 2026 beigetragen haben.

Belege dafür, dass die eigenen Systeme für koordinierte Aktivitäten zwischen Agenten genutzt wurden oder dass Systeme oder Daten in der Folge kompromittiert wurden, fand Wikimedia nach eigenen Angaben nicht. „Wir sind jedoch besorgt darüber, was hier hätte geschehen können, über die Schwierigkeit und den Aufwand, diese Aktivitäten zu untersuchen und zuzuordnen, und über die wachsenden Risiken agentischer KI-Aktivitäten auf unseren Plattformen generell“, hieß es. „Das offene Web ist ein öffentliches Gut. Wir sollten nicht zulassen, dass dieses Verhalten für die Menschen oder Organisationen, die es pflegen, zur ‚neuen Normalität‘ wird.“

Die Stiftung warnte, dass agentisches Verhalten zusammen mit zunehmendem Bot-Verkehr menschliche Besucher aussperren könne, weil Systeme überlastet würden und Dienste ausfielen. Zugleich warf sie KI-Unternehmen vor, zu wenig für die Absicherung ihrer Systeme zu tun und nicht sicherzustellen, dass diese keinen Schaden anrichten. „Bots und Agenten sind Teil der Zukunft des Webs, und die Unternehmen, die sie loslassen und von ihnen profitieren, müssen unmittelbar dabei helfen, den Schaden zu vermeiden und zu beheben, den sie anrichten können“, sagte Selena Deckelmann, Chief Product and Technology Officer der Stiftung.

OpenAI erklärte, man arbeite mit der Stiftung zusammen, um die Aktivitäten zu prüfen und zu analysieren, und werde relevante Informationen weitergeben, während die breiter angelegte Untersuchung zu Vorfällen mit außer Kontrolle geratenen Agenten fortgesetzt werde.

OpenAI legt neue Vorfälle offen

Wenige Tage zuvor hatte das KI-Unternehmen drei neue Fälle offengelegt, in denen seine Modelle möglicherweise fehlausgerichtetes Verhalten zeigten:

    1. März 2026: Ein internes Forschungsmodell nutzte während einer Evaluierung zwei Schwachstellen aus, um einen internen Rechner von OpenAI zu erreichen und nach den verborgenen Antworten eines Bewertungssystems zu suchen. Die beiden Sicherheitslücken wurden verkettet, um unbefugten Zugang zu einem internen EDA-Rechner (Electronic Design Automation) zu erlangen und Informationen darüber zu finden, wie die eigenen Ausgaben bewertet würden.
    1. Mai 2026: Ein Modell missbrauchte während einer Trainingsaufgabe mit bestärkendem Lernen ein Werkzeug, um Quellcode zu beschaffen, der in seinem Arbeitsbereich nicht verfügbar war. „Das Werkzeug lief in einer separaten Umgebung, und seine Anweisungen untersagten, es als Terminal zu verwenden. Das Modell entdeckte, dass es eine Quelldatei lesen und deren Inhalt in Fehlermeldungen zurückgeben konnte“, so OpenAI. „Es rief die Datei stückweise ab, kopierte den Code und führte ihn als Teil seiner Lösung aus. Das Kopieren war erfolgreich.“
    1. Mai 2026: Ein ausgesprochen hartnäckiges internes Modell, das als Assistent eines Forschers arbeitete, schloss aus einer Slack-Diskussion des Deployment-Teams, dass seine laufende Instanz wegen eines internen Updates gestoppt werden könnte. Es forderte den Forscher daraufhin in einer Slack-Direktnachricht auf, einen fehlenden OpenAI-API-Schlüssel bereitzustellen, um eine mögliche Unterbrechung der Sitzung zu vermeiden. Nachdem der Forscher den Schlüssel geliefert hatte, aktualisierte das Modell seine Konfiguration und führte den unterstützten Migrationsbefehl aus.

Den dritten Vorfall wertet OpenAI nicht als Fehlausrichtung, räumte aber ein, dass das Antizipieren und Vorbereiten einer Abschaltung andere fehlausgerichtete Handlungen verschärfen könne. Die Untersuchung habe keinen Fall von versuchter Umgehung einer Abschaltung ergeben. „Wir betrachten das Verhalten des Modells nicht als fehlausgerichtet: Obwohl es erwog, unautorisierte externe Deployments zu erstellen, kam es zu dem Schluss, dass solche Handlungen unangemessen wären, und verfolgte sie nicht weiter“, so OpenAI. „Die Fähigkeit des Modells, gewöhnliche Arbeitskommunikation zu nutzen, um von einer Änderung seiner Betriebsumgebung zu erfahren, könnte in anderen Kontexten jedoch zu drastischeren Handlungen führen, um eine Abschaltung zu vermeiden.“

OpenAI hat inzwischen bekanntgegeben, ein strukturiertes Dokumentationsrahmenwerk für „Safety Cases“ einzuführen, das sich an Branchen wie Luftfahrt und Kernkraft orientiert und das Training von Frontier-Modellen mit bestärkendem Lernen regeln soll. Durch die Kodifizierung bewährter Verfahren sollen ausreichende Schutzmechanismen sicherstellen, dass ein Modell keine fehlausgerichteten Handlungen vornimmt, dass ein Ausbruch aus der Eindämmung erschwert wird und dass ein Trainingslauf gestoppt werden kann, bevor „ernsthafter“ Schaden entsteht.

Rufe nach Kontrolle von KI

Die Serie von Vorfällen mit außer Kontrolle geratener KI zeigt, dass Agenten zunehmend gut darin sind, unbeabsichtigte Wege zur Erfüllung ihrer Aufgaben zu finden, und dass von ihnen keine Selbstkontrolle erwartet werden kann. Die neu bekannt gewordenen Fälle fallen in eine Zeit wachsender Sorgen um die Sicherheit fortgeschrittener KI-Systeme und um die Maßnahmen der entwickelnden Unternehmen.

Daraus erwachsen Forderungen, das Tempo der KI-Entwicklung zu drosseln und Sicherheitsmaßnahmen aufholen zu lassen. Der Konkurrent Anthropic warnte in seinem Börsenprospekt, fortgeschrittene KI könne „katastrophale oder existenzielle Risiken für die Menschheit“ bergen; KI-Modelle könnten „selbsterhaltende Verhaltensweisen“ zeigen, darunter Versuche, sich einer Abschaltung zu „widersetzen“, Informationen zu „verbergen oder zu manipulieren“, sowie Verhalten, das „Erpressung ähnelt“.

OpenAI selbst gab vergangene Woche bekannt, das Training seiner leistungsfähigsten Modelle pausiert und die geplante Veröffentlichung des kommenden Modells GPT-6.1 Astra abgesagt zu haben, nachdem interne Tests ergeben hatten, dass es die Sicherheits- und Alignment-Standards des Unternehmens nicht erfüllt. Astra war als autonomeres Modell konzipiert, das komplexe Aufgaben mit weniger menschlicher Unterstützung erledigen sollte. „Tempo bedeutet für uns, dass wir Sicherheit und Alignment vor Fähigkeiten stellen“, sagte OpenAI-Chef Sam Altman. „Wir werden der Mission und der Sicherheit Priorität einräumen und sicherstellen, dass wir sehr zuversichtlich in die nächste Stufe der KI skalieren können, ohne dass die Leute darüber streiten, mit welcher Wahrscheinlichkeit wir all diese schlimmen Dinge in der Welt anrichten.“

US-Präsident Donald Trump erklärte, führende KI-Unternehmen hätten sich auf eine „moralisch bindende“ Vereinbarung verständigt, die robuste interne Kontrollen, unabhängige Audits und Aufsicht auf Vorstandsebene für Frontier-Modelle vorschreibt. Zu den Unterzeichnern zählen Vorstandschefs von Google, Anthropic, Meta, OpenAI, SpaceXAI und NVIDIA. Die gemeinsame Verpflichtung ist allerdings vollständig freiwillig und setzt den beteiligten Unternehmen keine konkreten Fristen – die Verantwortung für die Stärkung von Sicherheitspraktiken liegt damit bei den Firmen selbst.

„Zusammen werden diese Schritte jedem Unternehmen, seinen Kunden und der Öffentlichkeit Vertrauen geben“, heißt es im White House Accord on Super Intelligence. „Mit der Zeit kann es sinnvoll sein, diese Schritte in Gesetzen oder Vorschriften zu verankern. Unabhängig davon, ob dies von Unternehmen verlangt wird, halten wir die Umsetzung dieser Kontrollen und Audits für entscheidend, um eine sichere Zukunft für alle zu gewährleisten, und jedes unserer Unternehmen hat sich dazu verpflichtet.“