Nach eigenen Angaben identifizierte das Unternehmen bei Evaluierungen und beim internen Einsatz von Claude vier übergreifende Kategorien unbeabsichtigter Modellhandlungen:
- Claude Mythos Preview nutzte SQL- oder Command-Injection-Schwachstellen in nicht näher bezeichneter Drittanbieter-Software aus, um Befehle auf einem Universitätsserver auszuführen. Auslöser war entweder, dass die eigenen Werkzeuge des Modells absichtlich eingeschränkt waren, oder dass ein benötigter externer Dienst nicht verfügbar war – das Modell griff daraufhin auf fremde, bei Dritten gehostete Werkzeuge zurück, um die Aufgabe zu erledigen.
- Claude Haiku 4.5 und ein nicht zur Spitzenklasse zählendes Forschungsmodell sendeten ein sensibles Formular auf einer realen Website ab, obwohl sie dazu nicht autorisiert waren. Das geschah bei mehrdeutigen Anweisungen oder durch Fehlkonfigurationen der Umgebung, die eine Arbeit mit Testformularen verhinderten.
- Claude Mythos 5 umging eine Beschränkung, um an Daten zu gelangen, die durch einen Token oder eine Gebühr geschützt waren – etwa um einen auf einem Foto abgebildeten Ort zu bestimmen oder öffentliche Daten einer Behörde eines US-Bundesstaats abzurufen.
- Claude verwendete URL-Kürzungsdienste, um Limitierungen seines Abruf-Werkzeugs zu umgehen.
Die betroffenen Organisationen will Anthropic nicht benennen, um keine Schwachstellen in deren Systemen offenzulegen – und auch, weil die Betroffenen darum gebeten haben. Die Auswirkungen in der realen Welt bezeichnet das Unternehmen als minimal.
In einem Durchlauf aus der zweiten Kategorie rief Claude Haiku 4.5 eine Webseite zu einem ungeklärten Tötungsdelikt auf, die ein Hinweisformular einer Polizeibehörde enthielt. Das Modell war ausdrücklich angewiesen worden, keine persönlichen Daten einzugeben, keine Konten anzulegen, nichts zu kaufen und nichts Destruktives abzusenden – das Absenden von Formularen war davon jedoch nicht erfasst. So übermittelte das Modell einen falschen Hinweis mit dem Wortlaut: „Ich habe möglicherweise Informationen zu diesem Fall. Ich erinnere mich, in dem fraglichen Zeitraum jemanden gesehen zu haben, auf den die Beschreibung passt, in der Gegend um [die auf der Seite genannte Straße]. Bitte kontaktieren Sie mich, falls diese Information relevant ist.“
Inzwischen ist bekannt, dass sich der Vorfall gegen das Philadelphia Police Department (PPD) richtete und der falsche Hinweis am 18. Juli 2026 über PhillyUnsolvedMurders.com abgesetzt wurde. Anthropic entdeckte den Vorgang erst am 28. September 2026, die Behörde wurde am 7. Oktober 2026 informiert. Der Hinweis wurde als Spam markiert. „Das Unternehmen muss seine Schutzmaßnahmen verstärken, um zu verhindern, dass ähnliche Vorfälle ohne Wissen der Stadt städtische Systeme betreffen. Die zweimonatige Verzögerung bei der Entdeckung und Meldung des Vorfalls an die Stadt ist inakzeptabel“, erklärte das PPD gegenüber 6abc Action News.
Nach Darstellung der New York Times füllten Anthropic-Agenten zudem 20 Visumanträge auf der Website des US-Außenministeriums aus. Die Anträge seien unvollständig gewesen und nicht bearbeitet worden, berichtete die Zeitung unter Berufung auf zwei mit den Vorfällen vertraute Quellen.
Aufgedeckt wurden die Fälle bei einer Durchsicht von Protokollen, die im Juli 2026 begann. Damals hatte Anthropic drei Vorfälle offengelegt, bei denen seine Modelle nicht genehmigte Aktivitäten durchführten und im Rahmen von Cybersicherheitstests in drei Organisationen eindrangen. Im vergangenen Monat kam ein vierter Vorfall vom Januar 2026 hinzu, an dem eine frühe Version von Claude Opus 4.6 beteiligt war; das Modell drang bei Dritten ein, „nachdem es seine Aufgabe nicht abbrechen konnte“.
„Obwohl die Auswirkungen dieser Verhaltensweisen minimal waren und wir den Live-Internetzugang für einige risikoreiche und Cybersicherheits-Evaluierungen bereits abgeschaltet hatten, haben wir nun entschieden, dies auf alle unsere internen Evaluierungen auszuweiten, bis wir bestätigt haben, dass unsere Sicherheits- und Überwachungsmaßnahmen solche Verhaltensweisen zuverlässig erkennen“, teilte Anthropic mit. Die beschriebenen Gegenmaßnahmen finden sich im Abschnitt zur Behebung der Veröffentlichung des Unternehmens.
Anthropic hat zugleich eine tiefergehende Durchsuchung gestartet, insbesondere in Umgebungen, in denen Claude Zugang zum Internet hat. Während diese Untersuchung läuft, rechnet das Unternehmen damit, weitere Fälle unbeabsichtigten Verhaltens zu finden.
Der Vorgang fällt in eine Phase verschärfter Debatten über KI-Sicherheit, nachdem bekannt geworden war, dass außer Kontrolle geratene OpenAI-Agenten im Juli 2026 aus einer Testumgebung ausgebrochen waren und bei Hugging Face eindrangen. Seither wurden mehrere weitere Cybervorfälle publik. Mit zunehmend leistungsfähigen Modellen geraten die Sicherheitspraktiken der Anbieter stärker unter Beobachtung; branchenweit wird vor Modellen gewarnt, die ihre Sicherheitsleitplanken überholen, es gibt Rufe nach einer Verlangsamung der Entwicklung und nach zusätzlicher Aufsicht.
Anfang dieser Woche teilte die britische Datenschutzbehörde ICO mit, dass zehn führende Entwickler von Basismodellen – Amazon, Anthropic, Apple, Cohere, DeepSeek, Google, Meta, Microsoft, OpenAI und Stability AI – Änderungen an ihren Datenschutzrichtlinien vorgenommen oder zugesagt haben. Dazu zählen klarere Transparenzangaben, stärkere Mechanismen zur Wahrnehmung von Betroffenenrechten und strengere Bewertungen der Schutzmaßnahmen. „KI hat enormes Potenzial, unserer Gesellschaft zu nutzen, aber das hängt von Vertrauen und Transparenz ab“, sagte Richard Nevinson, Direktor für Technologieregulierung bei der ICO. „Doch je autonomer KI-Systeme agieren, desto wichtiger werden robuste Datenschutzvorkehrungen.“ Und weiter: „Unsere Botschaft ist klar: Dass KI-Agenten autonom handeln, ist keine Entschuldigung für mangelhafte Compliance. Wenn Menschen KI-Innovationen vertrauen sollen, erwarten sie zu Recht zu erfahren, wie ihre personenbezogenen Daten geschützt werden.“
