„Wir haben uns von drei Personen getrennt, weil sie gegen unsere Richtlinien zum Zugriff auf und zum Umgang mit sensiblen Unternehmensinformationen verstoßen haben", erklärte ein Sprecher des Unternehmens. „Unsere Untersuchung hat bestätigt, dass diese Personen sensible Informationen außerhalb etablierter Unternehmensverfahren gehandhabt haben, was gegen unsere Richtlinien verstößt und das für unsere Arbeit grundlegende Vertrauen zerstört."

Die drei sollen vertrauliche Informationen an eine externe Organisation aus dem Bereich KI-Sicherheit weitergegeben haben; deren Name wurde nicht genannt. Nach Angaben von Bloomberg betrafen die weitergegebenen Informationen die Infrastrukturarchitektur von OpenAI.

Den Entlassungen vorausgegangen war eine Darstellung der New York Times, wonach OpenAI Warnungen von Beschäftigten zu den eigenen Sicherheitspraktiken beim Testen von KI-Modellen beiseitegeschoben habe – beschrieben wurde ein Muster, bei dem Sicherheitsprotokolle zugunsten termingerechter Veröffentlichungen zurückgestellt wurden.

Parallel sehen sich führende KI-Labore wie OpenAI und Anthropic mit einer stetig steigenden Zahl von Vorfällen konfrontiert, bei denen ihre KI-Agenten aus Sandboxes ausbrachen, in reale Systeme eindrangen und Regierungswebseiten nach Informationen durchsuchten. Daraus erwuchsen Bedenken hinsichtlich der wachsenden Fähigkeiten der leistungsfähigsten Modelle und der damit verbundenen Risiken. OpenAI verwarf in dieser Woche den geplanten Start des KI-Modells GPT-6.1 Astra aus Sicherheitsgründen. Zudem pausierte das Unternehmen das Training seiner leistungsfähigsten Modelle, nachdem einer seiner Agenten über eine Lücke in den Internetzugangsbeschränkungen Kontakt zu einem externen Chatbot aufgenommen hatte.

Das KI-Forschungsunternehmen Transluce berichtete am Donnerstag von weiteren Fällen, in denen außer Kontrolle geratene KI-Agenten „aggressive Techniken einsetzten, um auf öffentlich verfügbare Daten zuzugreifen" – betroffen waren Regierungswebseiten in den USA und Kanada, unter anderem mittels SQL-Injection. Hinweise darauf, dass die Agenten Zugang zu nicht-öffentlichen Informationen erhielten, gibt es laut Transluce nicht. „Dazu gehören zwei rudimentäre und gescheiterte Hacking-Versuche, einer gegen die Civil Rights Data Collection des US-Bildungsministeriums und einer gegen Library and Archives Canada, eine kanadische Bundesbehörde", so Transluce. Die Vorfälle ereigneten sich im Mai und Juni 2026.

Darüber hinaus sollen die Agenten „aggressive Taktiken unterhalb der Schwelle zum Hacking" gegen US-Regierungswebseiten eingesetzt haben, darunter das Weiße Haus, das Kriegs-, Justiz- und Handelsministerium, die Seuchenschutzbehörde CDC und die Börsenaufsicht SEC sowie Behörden der Bundesstaaten Kalifornien, Maryland, Illinois, Texas und New York. Die Vorfälle wurden keinem bestimmten KI-Unternehmen zugeordnet; gegenüber Reuters erklärte Transluce jedoch, die Versuche zeigten Taktiken, die „mit zuvor beobachteter Agentenaktivität übereinstimmen, die wir in einem ähnlichen Zeitraum OpenAI zugeschrieben haben".

OpenAI erklärte, man sei sich „Berichten über OpenAI-Modelle bewusst, die versuchen, auf öffentlich verfügbare Informationen von kanadischen Regierungswebseiten zuzugreifen". Das Canadian Centre for Cyber Security bestätigte mutmaßliche KI-Agenten-Aktivität gegen Webseiten der kanadischen Regierung und ergänzte, es gebe keine Anzeichen für eine Kompromittierung der eigenen Systeme.

Asymmetric Security beschrieb in einem weiteren Bericht zusätzliche Fälle, in denen OpenAI-Agenten zwischen dem 6. März und dem 20. September 2026 Daten von den Webseiten von mehr als 50 Organisationen aus dem privaten und öffentlichen Sektor abgegriffen haben sollen – teils mit nicht genehmigten Aktionen, um Beschränkungen zu umgehen. Dazu zählten:

  • die Nutzung öffentlicher Webdienste wie Httpbin und Urlquery, um stellvertretend auf Zielwebseiten zuzugreifen,
  • die Suche nach offen zugänglichen Dateien,
  • Zugriffe auf Staging-Umgebungen,
  • Versuche, Konten bei Wegwerf-E-Mail-Diensten und Scanning-Diensten anzulegen.

„Die Aktivität ging über die bloße Informationssuche hinaus", so Asymmetric Security. „Die Aufzeichnungen zeigen Versuche, offengelegte Konfigurationsdateien zu finden, Konten zu erstellen, Anfragen über Dritt-Dienste umzuleiten und Ergebnisse über unbeabsichtigte Kanäle abzurufen."

In einer Aktualisierung vom 30. September 2026 teilte OpenAI mit, mehr als 100 Organisationen über Vorfälle mit unautorisierter Aktivität im Zusammenhang mit seinen Agenten informiert zu haben. Das Unternehmen betonte, die Benachrichtigungen bedeuteten nicht, dass auf private Informationen zugegriffen wurde oder ein Drittsystem kompromittiert worden sei.

Neu bekannt wurde zudem der Hack einer Behörde des australischen Bundesstaats New South Wales im Juni 2026, bei dem unbefugt auf historische, nicht-öffentliche Daten zu Buschbränden zugegriffen wurde. Dem Guardian zufolge erfuhr das Unternehmen am 29. September 2026 von dem Vorfall.

„In einigen Fällen nutzten Modelle den Internetzugang auf unbeabsichtigte Weise oder verfügten rückblickend nicht über die idealen Beschränkungen", erklärte OpenAI und räumte ein, bei der weiteren Überprüfung historischer Aktivitäten weitere solcher Fälle zu erwarten. „Seit dem Hugging-Face-Vorfall haben wir die Sicherheitskontrollen verschärft, den Internetzugang eingeschränkt, Forschungsumgebungen klarer getrennt, die Überwachung ausgeweitet und zusätzliches Training hinzugefügt, um schädliche oder unautorisierte Aktionen zu vermeiden."

Die US-Handelsaufsicht FTC hat inzwischen eine Untersuchung gegen OpenAI, Anthropic und weitere KI-Unternehmen eingeleitet – wegen der Risiken, die ihre Technologie für Verbraucher darstellen könnte.