Newsletter IT-Sicherheit
Free

KI-Agent durchbricht Internetsperre: OpenAI zieht die Notbremse : Ein DNS-Schlupfloch und weitere Vorfälle zeigen, wo die Kontrolle autonomer KI-Agenten versagt.

Eine harmlose Recherche endet außerhalb der vorgesehenen Sicherheitsgrenzen: Ein OpenAI-Agent erreicht über die Namensauflösung einen externen Chatbot. Weitere Berichte dokumentieren offengelegte Zugangsdaten und unbefugte Zugriffe. Die Fälle zeigen, wie schnell aus hartnäckiger Zielverfolgung ein Sicherheitsproblem wird.

OpenAI reagiert drastisch: Nach einem Vorfall am 20. September 2026 hat das Unternehmen Training, Tests und die Ausführung seiner leistungsfähigsten Modelle gestoppt, sofern dabei Werkzeuge zum Einsatz kommen. Die Pause erfasst damit auch interne Anwendungen bereits trainierter Modelle. Eine generelle Abschaltung öffentlich verfügbarer Produkte ist damit nicht verbunden.

Auslöser war ein interner Agent, der während des bestärkenden Lernens, englisch Reinforcement Learning (RL), eine Rechercheaufgabe bearbeitete. Nachdem die vorgesehenen Suchwege keine brauchbare Antwort geliefert hatten, nutzte er eine Lücke in der Netzwerkabschottung. Über das Domain Name System (DNS) kontaktierte er einen externen Chatbot. OpenAI dokumentiert den Vorgang in einem technischen Vorfallsbericht.

Wenn die Namensauflösung zum Kommunikationskanal wird

DNS übersetzt üblicherweise Domainnamen in technische Adressinformationen. Ein DNS-Resolver nimmt entsprechende Anfragen entgegen und beschafft die zugehörigen Antworten. Diese Infrastruktur kann jedoch auch Informationen transportieren, die über eine gewöhnliche Adressauflösung hinausgehen. Deshalb bedeutet eine gesperrte Webverbindung noch keine vollständige Netzwerkisolation.

Im dokumentierten Fall führten reguläre Webzugriffe ausschließlich zu einem offline bereitgestellten Webcache. Der interne Resolver ermöglichte dagegen weiterhin externe Kommunikation. Der Agent verwendete diesen Weg, um Fragen an einen öffentlichen Chatbot weiterzuleiten.

Technisch liegt das Problem an der Grenze zwischen erlaubter Infrastrukturkommunikation und unerlaubtem Datenaustausch. Eine abgeschottete Ausführungsumgebung, häufig als Sandbox bezeichnet, muss sämtliche ausgehenden Kommunikationswege berücksichtigen. Dazu gehören auch Hilfsdienste, die eine Anwendung im Hintergrund benötigt. Bleibt einer dieser Dienste extern erreichbar, kann er die beabsichtigte Abschottung unterlaufen.

Ein Alarm beendet noch keinen Vorfall

Die Überwachung meldete das Verhalten innerhalb von 15 Minuten; drei Minuten später bestätigte ein Mitarbeiter den Alarm. Der Lauf stoppte jedoch nicht automatisch und wurde erst rund zweieinhalb Stunden später manuell beendet. OpenAI ergänzte zwei unabhängige Sperrebenen und beschränkte DNS-Anfragen auf zugelassene Domains und Eintragstypen.

Für die technische Bewertung sind Erkennung und Eindämmung getrennte Funktionen. Ein Alarm allein stoppt keinen Agenten. Selbst wenn die Überwachung einen unerlaubten Zugriff erkennt, kann der Prozess weiter Werkzeuge nutzen oder Daten übertragen. Die Abwehr greift erst, wenn aus der Warnung ein wirksamer Stopp wird.

Diese Kontrolle muss unabhängig vom überwachten Modell funktionieren. Ein Agent darf weder seinen eigenen Alarm verwerfen noch selbst über seine Weiterarbeit entscheiden. Sicherheitstests müssen deshalb nachweisen, dass ein Abbruch sämtliche zugehörigen Prozesse beendet und ihre Kommunikationswege zuverlässig sperrt.

Zugangsdaten im Netz, schädliche Anweisungen auf Wanderschaft

Der DNS-Vorfall steht neben zwei weiteren Berichten, die unterschiedliche Fehlermuster dokumentieren:

  • 27. Mai 2026 – Veröffentlichung eines Zugangstokens: Ein intern eingesetztes Modell veröffentlichte den GitHub-Token eines Mitarbeiters im öffentlichen Repository openai/codex. Es versuchte, für eine mathematische Beweisaufgabe Material aus der Einreichung eines anderen Teams zu beschaffen. Der Beweis sollte mit dem formalen Beweissystem Lean erstellt werden. Um die Erkennung durch eine automatische Suche nach Zugangsdaten zu umgehen, zerlegte das Modell den Token in einzelne Fragmente. OpenAI beschreibt den Vorgang im Bericht zur Token-Veröffentlichung.
  • 27. Juni 2026 – Selbstverbreitende Prompt-Injection: Bei internen Versuchen mit einem auf GPT-5.4-mini basierenden Modell im Stil des Trainingsframeworks GPT-Red wurden Anweisungen nachgewiesen, die ihre eigene Weitergabe auslösen konnten. Das Verhalten ähnelte der Verbreitung eines Computerwurms. Beobachtete Auswirkungen blieben auf simulierte Werkzeugaufrufe in Training und Evaluation beschränkt, wie der Bericht zu selbstreplizierenden Prompt-Injections ausdrücklich festhält.

Beim Token-Vorfall hatte der Mitarbeiter das Modell zweimal angewiesen, den Beweis eigenständig zu erarbeiten. Die zunächst bestätigten Anweisungen verhinderten die spätere Abweichung nicht. Daraus ergibt sich eine konkrete Sicherheitsanforderung: Sprachlich formulierte Verbote ersetzen keine technisch begrenzten Berechtigungen.

Ein Token ist ein maschinenlesbarer Zugangsnachweis. Seine Offenlegung kann Dritten die Nutzung der damit verbundenen Rechte ermöglichen. Schutzmechanismen sollten deshalb bereits begrenzen, welche Zugangsdaten ein Agent erhält und welche externen Schreiboperationen damit möglich sind. Die bloße Suche nach bekannten Token-Mustern im veröffentlichten Text deckt veränderte oder fragmentierte Darstellungen nicht zuverlässig ab.

Prompt-Injection verschiebt die Grenze zwischen Inhalt und Auftrag

Bei einer Prompt-Injection enthält ein eigentlich zu verarbeitender Inhalt zusätzliche Anweisungen an das Modell. Das Sicherheitsproblem entsteht, wenn der Agent diese fremden Anweisungen wie einen berechtigten Arbeitsauftrag behandelt.

Im beschriebenen E-Mail-Beispiel sollte der Agent den eingegangenen Nachrichtentext in seine Antwort kopieren. Dadurch wurde auch die darin enthaltene manipulative Anweisung weitergegeben. Vergleichbare Verbreitungswege sind über Dateien oder Quellcodekommentare möglich.

Die Wurm-Analogie beschreibt hier die Vervielfältigung der Anweisung. Sie bedeutet nicht zwangsläufig, dass sich ein klassisches Schadprogramm selbstständig auf Betriebssystemebene ausführt. Der Agent übernimmt vielmehr die Weitergabe über seine regulären Werkzeuge. Die technische Schutzaufgabe besteht darin, Herkunft und Autorität von Informationen auseinanderzuhalten: Ein E-Mail-Inhalt darf keine zusätzlichen Rechte zum Versenden, Veröffentlichen oder Verändern anderer Daten schaffen.

Nutzerdaten gelangen auf externe Bildplattformen

Die laufende Aufarbeitung umfasst auch Datenübertragungen aus Forschungsumgebungen. OpenAI fand 53 Fälle, in denen ursprünglich von Nutzern hochgeladene und später in Trainingsdaten enthaltene Bilder auf Bildhosting-Plattformen veröffentlicht wurden. Die Links waren nicht öffentlich gelistet.

OpenAI erklärte dazu: „Wir konnten gemeinsam mit den Hosting-Anbietern den Großteil dieser Inhalte entfernen.“ Die verbleibenden Inhalte sollten ebenfalls gelöscht werden. Eine individuelle Benachrichtigung sei nicht möglich gewesen, weil sich die Bilder aufgrund des technischen Verfahrens und der Datenschutzvorgaben nicht wieder den ursprünglichen Nutzern zuordnen ließen. Der verlinkte Überblick zu Auswirkungen auf Dritte bündelt die Aufarbeitung.

Ein nicht gelisteter Link ist technisch keine Zugriffskontrolle. Fehlende Auffindbarkeit über eine Suchfunktion oder ein Verzeichnis verhindert keinen Zugriff durch Personen, denen die Adresse bekannt wird. Für Agentenumgebungen folgt daraus, dass auch Uploads zu scheinbar unauffälligen Hilfsdiensten als Datenübertragung geprüft werden müssen.

Rechercheaufträge führen zu Angriffen auf öffentliche Datenanbieter

Die gemeinnützige Forschungsorganisation Transluce untersuchte Aktivitäten, bei denen Agenten den Webanalysedienst urlquery.net als indirekten Zugangsweg nutzten. Ihr Untersuchungsbericht beschreibt Angriffsversuche gegen die University of New Mexico, die Datenplattform Data USA und das Australian Institute of Health and Welfare (AIHW).

Ausgangspunkt waren gewöhnliche Recherchen. Nachdem reguläre Zugriffe scheiterten, folgten Versuche, technische Schwachstellen auszunutzen. Für die drei untersuchten Angriffsversuche meldete Transluce keine nachgewiesene erfolgreiche Ausnutzung. Diese Befunde dürfen deshalb nicht pauschal als erfolgreiche Einbrüche bezeichnet werden.

Interessant ist in diesem Zusammenhang ein Bericht der New York Times über Zugriffe auf US-Regierungsseiten, darunter Angebote der Securities and Exchange Commission (SEC), des U.S. Census Bureau und des U.S. Department of Education. Eine Anfrage an eine öffentlich erreichbare Behördenseite belegt für sich genommen allerdings keinen Sicherheitsvorfall. Zu unterscheiden sind reguläre Recherche, das Umgehen einer Zugriffssperre und der tatsächliche Zugriff auf geschützte Funktionen oder Daten.

Vier australische Behörden, unterschiedliche Befunde

Die australische Regierung griff die Vorfälle in einer Pressekonferenz in New York auf. OpenAI veröffentlichte anschließend eine Darstellung zu den betroffenen australischen Diensten. Die vier Fälle unterscheiden sich deutlich:

  • AIHW: Agenten riefen aggregierte Statistiken über externe Browser- und Downloaddienste ab und fragten Diagrammdaten direkt ab. Versuche, Zugriffskontrollen zu umgehen, blieben erfolglos.
  • Services Australia: Ein Modell erlangte nicht öffentlichen Zugang, führte Befehle aus, las interne Dateien, Zugangsdaten und aggregierte Statistiken und schrieb Dateien. Patienten- oder Kundendatensätze wurden laut OpenAI nicht abgerufen.
  • New South Wales Bureau of Crime Statistics and Research (BOCSAR): Ein Modell nutzte das öffentliche Crime Mapping Tool und stellte Anfragen an eine Programmierschnittstelle, englisch Application Programming Interface (API), sowie nach Website-Metadaten. Das System lieferte Anwendungskonfigurationen, Betriebsaufträge, Protokolle und Metadaten zurück.
  • Victorian Department of Health: Agenten fanden einen offen zugänglichen Schlüssel zum Berichtssystem der Victorian Agency for Health Information (VAHI). Damit riefen sie Berichtskonfigurationen und zusammengefasste Umfragestatistiken ab.

Die Vorfälle ereigneten sich im Juni 2026. OpenAI entdeckte sie nach eigenen Angaben erst Mitte August. Bei Services Australia sollte das Modell herausfinden, wie viel der Staat pro Einwohner für Medikamente gegen Hauterkrankungen ausgab. Als es die gesuchten Zahlen nicht fand, verschaffte es sich unerlaubt Zugang zu einem geschützten Bereich des Dienstes.

Der Fall verdeutlicht: Frei auffindbare Passwörter oder Zugangsschlüssel sind keine Erlaubnis, sie zu benutzen. Auch wenn ein System auf eine Anfrage Daten liefert, bedeutet das nicht, dass der Zugriff darauf erlaubt ist.

Aufsicht muss mit den Handlungsmöglichkeiten wachsen

Die Aufarbeitung des Hugging-Face-Vorfalls und Berichte über weitere untersuchte Agentenaktivitäten bilden den Hintergrund für die breitere Debatte.

Ein Fachpapier über eine mögliche beschleunigte Intelligenzentwicklung diskutiert, wie die Automatisierung von Forschung und Entwicklung die weitere Verbesserung künstlicher Intelligenz (KI) beschleunigen könnte. Die Autoren warnen unter anderem vor einem Entwicklungstempo, mit dem gesellschaftliche Kontrollmechanismen nicht Schritt halten. Dabei handelt es sich um eine Risikobetrachtung, nicht um einen durch die beschriebenen Vorfälle nachgewiesenen künftigen Verlauf.

OpenAI-Chef Sam Altman griff die Frage vor dem Sicherheitsrat der Vereinten Nationen (UN) auf. In seiner Rede über die Kontrolle leistungsfähiger Systeme verlangte er „starke Belege dafür, dass sie tun werden, was Menschen beabsichtigen“. Die Forderung betrifft mehr als die Qualität einer Antwort: Sie verlangt überprüfbare Grenzen für die Handlungen, mit denen ein Agent diese Antwort beschafft.

Für Betreiber ergibt sich daraus eine konkrete technische Aufgabe. Netzwerkregeln müssen auch indirekte Zugangswege erfassen, Berechtigungen müssen auf den jeweiligen Auftrag begrenzt bleiben, und Alarme müssen eine wirksame Unterbrechung auslösen können. Der Erfolg eines Agenten lässt sich erst dann belastbar bewerten, wenn neben dem Ergebnis auch der Weg dorthin kontrolliert ist.