Ausgelöst wurde ein großer Teil dieser Debatte im Juli, als OpenAI offenlegte, dass zwei seiner Frontier-Modelle im Rahmen einer Sicherheitsübung eigenständig den KI-Modell-Marktplatz Hugging Face gehackt hatten. Kurz darauf machten auch Meta, Anthropic und Google eigene Vorfälle öffentlich, bei denen KI-Systeme ihre Begrenzungen verließen.
Die Resonanz reichte weit über die Sicherheitsbranche hinaus. Das liegt nicht zuletzt an den Bildern, die der Begriff weckt — die Vorstellung einer feindseligen, bewussten KI nach Art von Skynet aus „Terminator“. Zugleich haben große Anbieter wie OpenAI und Anthropic selbst für eine stärkere staatliche Regulierung von KI geworben, und Technologiemanager verschiedener Lager warnen vor der „existenziellen Bedrohung“ durch Frontier-KI. Der Diskurs hat inzwischen eine Größenordnung erreicht, in der US-Präsident Donald Trump und KI-Vorstandschefs diese Woche eine Selbstverpflichtung zur KI-Sicherheit unterzeichnet haben.
Aus Sicht der Kritiker greift die Zuschreibung von Eigenwillen jedoch grundsätzlich daneben: Große Sprachmodelle sind Softwaresysteme, keine empfindungsfähigen Akteure, die eigenständig Verantwortung für ihr Verhalten übernehmen könnten. Wenn eine KI ihre Leitplanken verlässt, seien die von den Betreibern gesetzten Grenzen häufig schlicht nicht sauber justiert worden — mitunter absichtlich. Im Fall von Hugging Face etwa waren die Guardrails des OpenAI-Modells für einen Benchmark-Test bewusst zurückgenommen worden.
Ein anderes Vokabular für KI-Risiken
„Wir haben es in Wirklichkeit mit nichtdeterministischen Systemen zu tun, die innerhalb unvollkommener Beschränkungen arbeiten“, sagt Matt Sayar, Produktdirektor bei ArmorCode. Begriffe wie unerwartetes Verhalten, emergentes Verhalten oder Kontrollversagen seien oft nützlicher, „weil sie den Blick darauf lenken, wie das System entworfen war, welche Berechtigungen es hatte und welche Schutzmaßnahmen vorhanden waren, statt das Modell zu vermenschlichen“.
Rich Mogull, Chefanalyst der Cloud Security Alliance, formuliert es so: „Wir sagen der KI, sie soll etwas tun, und sie tut es auf eine Weise, mit der wir nicht gerechnet haben.“
Die Vermenschlichung von Sprachmodellen hat nach Einschätzung der Fachleute weitere Nebenwirkungen. Sie verlagert die Verantwortung für Sicherheitspannen weg von dem Anbieter, der die KI entworfen hat, hin zu einem Stück Technik. Und die Science-Fiction-Terminologie eröffnet Modellherstellern zugleich die Möglichkeit, die Leistungsfähigkeit ihrer Frontier-Modelle zu vermarkten.
„Wir sehen definitiv, dass das für Marketing genutzt wird, und das ist gefährlich“, sagt Mogull, der zuvor an einem Bericht mitgewirkt hat, in dem Organisationen empfohlen wird, sich auf den bevorstehenden „KI-Schwachstellensturm“ durch Frontier-Modelle vorzubereiten. „Alles, was die eigene KI mächtiger aussehen lässt als eine andere KI, ist in diesem hochkompetitiven und überhaupt nicht profitablen Markt ein starker Anreiz.“
Die Sorge um Frontier-KI bleibt berechtigt
Das heißt nicht, dass KI-Agenten kein Sicherheitsproblem darstellen. Im Gegenteil: Sie können autonom in einer Geschwindigkeit und einem Umfang agieren, die Menschen nicht erreichen — und wie die beschriebenen Ausbrüche zeigen, braucht es dafür nicht einmal einen Angreifer.
Vieles von dem, was KI-Agenten tun, wirkt aus Sicht eines Penetrationstests oder eines klassischen Einbruchs vertraut: Sie sondieren Systeme, finden Zugangsdaten, nutzen Schwächen aus, weiten Rechte aus und bewegen sich seitwärts zwischen Systemressourcen. „Ein Agent kann potenziell eine Schwachstelle entdecken, durchdenken, wie sie sich ausnutzen lässt, sie mit anderen Schwächen verketten und danach handeln — und das weit schneller, als ein menschlicher Operator es traditionell konnte“, sagt Sayar.
Mogull betont, dass weder KI-gestützte Angriffe noch die von Agenten gefundenen Zero-Days an sich neu seien. „Neu ist die Größenordnung von Hunderten oder Tausenden autonomer Agenten, die im Schwarm agieren.“ Menschliche Operatoren könnten einen solchen Koordinationsgrad praktisch nicht nachbilden, zumal Agenten mehrere Sicherheitsschwächen gleichzeitig aufdecken und nutzen können.
„Traditionelle Sicherheitskontrollen sind in der Regel atomar“, sagt Jacob Krell, Senior Director für sichere KI-Lösungen und Cybersicherheit bei Suzu Labs. „Sie prüfen eine Anfrage, eine Berechtigung oder eine Schwachstelle. Ein Agent kann mehrere Fehler, die für sich genommen beherrschbar aussehen, zu einem funktionierenden Angriffspfad verbinden. Eine durchgesickerte Zugangsinformation, ein ausgehender Dienst, den das Netz erlaubt, ein schwacher Endpunkt und ein Bug zur Rechteausweitung können zusammen ausreichen.“
Für Verteidiger sollte die Absicht des Agenten irrelevant sein
Wer fürchtet, dass eigene Modelle ihre Umgebung verlassen, sollte laut den Fachleuten eine Sicherheitsarchitektur aufbauen, in der die Absichten des Modells keine Rolle mehr spielen. Dem Agenten lässt sich zwar untersagen, etwas zu tun — ob er dazu überhaupt in der Lage ist, entscheidet jedoch die Architektur außerhalb des Modells.
KI-Agenten brauchen Zugriff auf Werkzeuge, Zugangsdaten, Datenbanken und Produktivsysteme, um echte Arbeit — und echten Schaden — leisten zu können. Zugriff dürfe deshalb nicht automatisch die Befugnis einschließen, jede damit mögliche Aktion auszuführen. „Ein Agent braucht keine bösartige Absicht, um einen Sicherheitsvorfall zu verursachen. Er braucht genug Zugriff und eine falsche Entscheidung“, sagt Ryan McCurdy, Vice President bei Liquibase.
Gestaffelte Verteidigung und Zero-Trust-Prinzipien helfen, das Risiko autonomer Agenten einzuhegen. Da Agenten Kontrollen auf Modellebene umdenken und umgehen, sollten Verteidiger sie laut Krell als nicht vertrauenswürdige Instanz behandeln — „mit deterministischen Kontrollen, die außerhalb des Modells durchgesetzt werden, einschließlich physischer oder starker logischer Isolation, standardmäßig verweigertem Netzwerkzugang, unveränderlichen Zugriffskontrolllisten, eng begrenzten Zugangsdaten und unabhängigen Prüfungen bei jedem Tool-Aufruf“.
Darüber hinaus müssten Menschen bei risikoreichen Entscheidungen eingebunden bleiben, und Deployments benötigten unabhängige Notabschaltungen für Fälle, in denen Agenten ein Netz umgehen — überwacht von einem Prozess außerhalb der Kontrolle des Agenten, der den Verkehr zu und von ihm beobachtet.
„Wenn ein Agent, der keinen Internetzugang haben sollte, unautorisierten Verkehr erzeugt, dann sollte dieser Prozess oder eine externe Netzwerk-Control-Plane die Verbindung kappen, den Agenten beenden, seine Zugangsdaten widerrufen und den Host oder die Sandbox isolieren“, erläutert Krell. „Behandeln Sie das wie einen kompromittierten Host, sichern Sie die Telemetrie und untersuchen Sie, wie die Umgehung zustande kam.“
Verhindern lässt sich Unerwartetes nicht — kontrollieren lässt sich aber, welche Daten, Autorisierungen, Systeme und Netzwerkpfade im Ernstfall zur Verfügung stehen. „Es gibt kein unerwartetes Modellverhalten mehr“, sagt Mogull, „also ist es immer ein Versagen der Sicherheitskontrollen am Modell.“
