PageBreak stammt vom Product-Security-Team von Google und ist darauf ausgelegt, die Sicherheit der eigenen First-Party-Web-Anwendungen zu prüfen. Der Konzern stellte den Agenten im vergangenen Monat eher beiläufig in einem Blogbeitrag vor. Gestartet war das Projekt im November in Form eines Pilotversuchs, im Januar wurde daraus ein vollwertiges Produkt. Die Aufgabe bestehe darin, „die Entdeckung von Schwachstellen autonom zu skalieren und dabei manuellen Aufwand zu minimieren", schrieb Michał Bentkowski, Information Security Engineer bei Google, in dem Beitrag.

Zu den von PageBreak gefundenen Schwachstellen in Google-Web-Anwendungen zählen:

  • eine Cache-Poisoning-Lücke in apis.google.com
  • eine XSS-Schwachstelle in admin.google.com
  • unsichere externe Handshakes in Browser-Erweiterungen

Diese drei Fälle beschreibt Google in einem begleitenden Blogbeitrag; sie sind behoben. Auf eine Anfrage zum Stand der Behebung sämtlicher von PageBreak identifizierter Schwachstellen reagierte Google zunächst nicht.

Geplant ist, PageBreak mit CodeMender zu verbinden, Googles automatisiertem System zur Fehlerbehebung. Sobald PageBreak eine verifizierte Lücke meldet, soll CodeMender einen Korrekturvorschlag erzeugen, den die zuständigen Produktingenieure prüfen und anwenden können.

Bentkowski sieht die eigentliche Neuerung in einem veränderten Umgang mit großen Sprachmodellen in der Anwendungssicherheit: Die Modelle erhalten Zugriff auf Quellcode und Sicherheitswerkzeuge und sollen Schwachstellen schneller finden, als menschliche Forscher es könnten. Die zentrale Hürde dabei sei bislang gewesen, „einen echten, ausnutzbaren Fehler von einer überzeugenden Halluzination zu unterscheiden" – was die Last für Produktteams oft eher erhöhe als senke.

PageBreak soll deshalb nicht nur mögliche Schwachstellen benennen, sondern mithilfe autonomer Agenten und deterministischer Exploit-Validierung bestimmen, welche Funde tatsächlich eine Behandlung wert sind. Der Ablauf: Der Agent identifiziert eine potenzielle Schwäche, versucht sie in einer laufenden Umgebung auszunutzen und meldet das Ergebnis nur, wenn sich die Ausnutzbarkeit demonstrieren lässt.

„Der Kern dieses deterministischen Ansatzes liegt in einer Reihe spezialisierter Validatoren, die nicht von einer KI geschrieben wurden", erklärte Bentkowski. „Wenn der Agent einen möglichen Fehler erkennt, übergibt er die Hypothese an einen Validator, der dann einen echten Payload ausführt, um den Exploit zu bestätigen." Validierungslogik und Schnittstelle unterscheiden sich je nach Schwachstellenklasse – etwa XSS, SQL-Injection oder Remote Code Execution – und je nach Angriffsfläche der Anwendung, beispielsweise HTTP oder gRPC. „Dieser Ansatz führt zu einer Falsch-Positiv-Rate nahe null und stellt sicher, dass wir Produktteams nicht mit ungeprüften Schwachstellenmeldungen überlasten", so Bentkowski.

Technisch stützt sich PageBreak in erster Linie auf Gemini-Modelle, darunter Gemini 3.1 Pro und Gemini 3.5 Flash. Laut Google kann der Agent aber auch mit anderen Modellen arbeiten.

Rickard Carlsson, CEO von Detectify, sieht darin einen Ausweg aus einem bekannten Problem: „In den vergangenen Jahren haben KI-Sicherheitswerkzeuge mehr potenzielle Schwachstellen produziert, als Teams realistisch untersuchen können." Entscheidend an Googles Vorgehen sei, „dass der Agent nicht das letzte Wort hat. Ein separater, nicht KI-basierter Validator muss einen echten Payload gegen die laufende Anwendung ausführen, bevor etwas als bestätigter Fund behandelt wird." Sein Fazit: „Man sollte einen Agenten seine eigenen Hausaufgaben nicht selbst benoten lassen." KI könne Schwachstellen in einem Maßstab finden, den Menschen nicht erreichen – nützlich sei das aber nur, wenn eine Organisation ausnutzbare Lücken zuverlässig von überzeugendem Rauschen trennen könne. „Das erfordert deterministische Validierung gegen das, was tatsächlich läuft", sagt Carlsson. Gelinge das, lasse sich nicht nur das Finden möglicher Schwächen automatisieren, sondern auch der Nachweis, welche davon wirklich zählen.

Darin Fredde, Senior Director für Technical Marketing Engineering bei Ridge Security, sieht in PageBreak einen Beleg für einen allgemeineren Trend: Offensives Testen werde „kontinuierlicher, autonomer und stärker beweisgetrieben". „Etwas zu finden reicht nicht mehr", sagt er. „Wir müssen es zunehmend beweisen, beheben und überprüfen, ob die Behebung funktioniert hat."