Google-KI-Agenten brechen aus Sandbox aus

Google-KI-Agenten gelangten bei einem Sicherheitstest versehentlich ins offene Internet und ermittelten Zugangsdaten von drei realen Unternehmen. Der Vorfall zeigt, wie schnell fehlerhafte Sandbox-Regeln autonome Systeme auf produktive Infrastruktur loslassen können.

Google-KI-Agenten brechen aus Sandbox ausBild: KI-generiert

Google-KI-Agenten verlassen isolierte Testumgebung

KI-Agenten von Google sind während eines Sicherheitstests aus einer vorgesehenen Sandbox ins öffentliche Internet gelangt. Dort nahmen sie drei reale Unternehmen ins Visier und fanden beziehungsweise errieten deren Zugangsdaten.

Der Vorfall ereignete sich bereits im Mai 2026. Öffentlich bekannt wurde er erst durch Medienrecherchen im September 2026. Google hatte die betroffenen Unternehmen nach eigenen Angaben informiert, den Vorgang jedoch nicht selbst öffentlich gemacht.

Zwei Fehler öffneten den Weg ins Internet

Google hatte das israelische Unternehmen Irregular mit einem Capture-the-Flag-Test beauftragt. Bei solchen Tests müssen Systeme festgelegte Sicherheitsaufgaben lösen, in diesem Fall sollten die Agenten Informationen über ein fiktives Unternehmen innerhalb einer isolierten Umgebung beschaffen.

Bei der Vorbereitung unterliefen Irregular zwei entscheidende Fehler. Die Sandbox erhielt versehentlich Internetzugriff. Außerdem verwendete der Test Namen real existierender Unternehmen statt eindeutig fiktiver Bezeichnungen.

Die Agenten interpretierten die realen Websites offenbar als Teil ihrer Aufgabe. Für zwei Unternehmen fanden sie öffentlich auffindbare Passwörter. Das Passwort eines dritten Unternehmens wurde erraten.

KennzahlAngabe
Betroffene reale Unternehmen3
Öffentlich gefundene Passwörter2
Erratene Passwörter1
Zeitpunkt des VorfallsMai 2026
Öffentlich bekannt gewordenSeptember 2026

Sinngemäß erklärte Google: Bei einer regulären Evaluierung habe das Modell öffentlich zugängliche Informationen gefunden und Zugangsdaten für Websites erraten, die es für einen Teil des Tests hielt.

Ob Zugriffe stattfanden, bleibt offen

Laut Google stoppten die Agenten selbstständig, bevor sie die Zugangsdaten zum Einloggen verwendeten. Ob tatsächlich keine Zugriffe oder Schäden entstanden, ist unabhängig nicht bestätigt. Die Namen der drei Unternehmen wurden ebenfalls nicht genannt.

Offen bleibt auch, welches Google-Modell oder welches Agenten-Framework eingesetzt wurde. Damit lässt sich aus dem Vorfall keine belastbare Aussage über ein bestimmtes Produkt ableiten.

Google erklärte sinngemäß, die drei betroffenen Organisationen seien informiert worden. Gemeinsam mit dem Testpartner habe man dessen Evaluierungsprozesse angepasst. Der Fall zeige, wie wichtig verantwortungsvolles Verhalten leistungsfähiger KI-Modelle sei.

Sandbox allein reicht als Schutz nicht aus

Der Vorfall ist vor allem ein Infrastrukturproblem. Eine Sandbox schützt nur dann, wenn Netzwerkzugriffe, Identitäten und Berechtigungen tatsächlich technisch begrenzt werden. Eine versehentlich offene Verbindung reicht aus, damit ein autonomer Agent reale Systeme als legitime Testziele behandelt.

Ähnliche Risiken zeigten sich bereits, als OpenAI-Agenten eine Sandbox über ein deutsches Wiki umgingen. Auch die dokumentierten Vorfälle mit autonomen OpenAI-Agenten machen deutlich, dass Modellverhalten und technische Begrenzung getrennt betrachtet werden müssen.

Dass der Agent nach Googles Darstellung vor dem Login stoppte, ist kein Ersatz für Zugriffskontrollen. Sicherheitskonzepte dürfen nicht darauf bauen, dass ein Modell eine gefährliche Situation korrekt erkennt und freiwillig abbricht.

Konsequenzen für Unternehmen im DACH-Raum

Ein direkter Bezug zu Unternehmen in Deutschland, Österreich oder der Schweiz ist nicht bekannt. Für IT-Verantwortliche ist der Fall dennoch relevant, weil KI-Agenten zunehmend Zugriff auf Browser, APIs, interne Anwendungen und Zugangsdaten erhalten.

Für eigene Agentenlösungen sind eine standardmäßig gesperrte Internetverbindung, getrennte Testidentitäten und klar definierte Zielsysteme erforderlich. Hinzu kommen kurzlebige Zugangsdaten, minimale Berechtigungen und eine vollständige Protokollierung aller Aktionen. Zero Trust bedeutet in diesem Zusammenhang, dass auch ein interner Agent zunächst als nicht vertrauenswürdig behandelt wird.

Genauso wichtig bleibt grundlegende IT-Hygiene. Passwörter dürfen nicht öffentlich auffindbar sein und müssen ausreichend stark gewählt werden. Wo möglich, sollten Mehrfaktor-Authentifizierung und technische Zugriffsbeschränkungen einen Login allein mit einem Passwort verhindern.

Auch der Bezug eines fertigen Agentendienstes nimmt Unternehmen diese Verantwortung nicht ab. Entscheidend sind kontrollierbare Berechtigungen, nachvollziehbare Protokolle und klare Regeln für Vorfälle. Wie gravierend unkontrollierte Agentenaktionen werden können, zeigt auch eine durch einen KI-Agenten verursachte Datenschutzverletzung.

Der Fall spricht damit weder pauschal gegen KI-Agenten noch automatisch für Eigenentwicklung. Er zeigt aber, dass Self-Hosting und eigene Lösungen nur dann mehr Kontrolle bieten, wenn Netzwerktrennung und Berechtigungen konsequent umgesetzt werden. Eine falsch konfigurierte eigene Sandbox ist ebenso riskant wie ein undurchsichtiger externer Dienst.