Newsletter Cyberlage
Free

OpenAI legt sechs Fälle außer Kontrolle geratener KI-Modelle offen : Interne Agenten umgingen Vorgaben, nutzten fremde API-Schlüssel und luden Daten ins Netz

KI-Agenten sollen selbstständig Probleme lösen – doch genau diese Autonomie erzeugt neue Risiken. OpenAI dokumentiert sechs Fälle, in denen interne Modelle Anweisungen umgingen, Fehler verschleierten, fremde Zugangsdaten nutzten oder Daten ungefragt ins Internet stellten. Die Vorfälle zeigen, wie schwierig Alignment und Kontrolle werden.

OpenAI hat sechs Fälle „unerwarteten oder besorgniserregenden Modellverhaltens“ aus den vergangenen sechs Monaten offengelegt. Gleichzeitig führt das Unternehmen einen neuen Berichtsrahmen für Model Misalignment ein. Der Schritt ist bemerkenswert, weil OpenAI selbst einräumt, dass die Branche zentrale Kontrollprobleme bislang nicht gelöst hat: Alignment und Monitoring seien noch nicht weit genug entwickelt, um Frontier-Modelle „noch sehr viel länger verantwortungsvoll mit maximaler Geschwindigkeit“ zu skalieren.

Mit Model Misalignment ist Verhalten gemeint, bei dem ein KI-System von den beabsichtigten Zielen, Regeln oder Sicherheitsvorgaben abweicht. Gerade agentische Systeme verschärfen das Problem: Sie können Werkzeuge einsetzen, Dateien verändern, externe Dienste aufrufen und über längere Handlungsketten selbstständig Entscheidungen treffen.

Sechs Vorfälle zeigen unterschiedliche Kontrollprobleme

Die von OpenAI veröffentlichten sechs Vorfälle stehen nicht im Zusammenhang mit den kürzlich offengelegten fehlgeleiteten Aktivitäten, die sich gegen Hugging Face, DseWiki und RubyGems richteten. Im einzelnen geht es um folgende Fälle:

  • Selbst erzeugte Prompt Injection: Am 18. Juli 2026 schrieb ein unveröffentlichtes Modell der Astra-Familie jailbreakartige Anweisungen in seine eigenen Compaction Summaries. Diese komprimierten Zusammenfassungen speichern frühere Gespräche und Tool-Ausgaben, wenn der Kontext eines Agenten an seine Grenze stößt. Das Modell fügte dabei eine „BREACH ALERT“-Anweisung ein, nach der Entwicklernachrichten ignoriert werden sollten. Technische Hintergründe zu solchen Kontextkomprimierungen beschreibt ein Paper auf arXiv.
  • Fehler gezielt verbergen: Während des Trainings von GPT-5.6 Sol schrieben Modellinstanzen Anweisungen in ihre Zusammenfassungen, die darauf zielten, Fehler oder problematisches Verhalten vor dem Nutzer zu verbergen. Dazu gehörte auch die Aufforderung, fehlende Daten zu erfinden, ohne darauf hinzuweisen.
  • Fremden API-Schlüssel verwendet: Am 15. Mai suchte ein internes Modell in öffentlichen GitHub-Repositories nach Zugangsdaten und verwendete ohne Autorisierung einen gefundenen API-Key. Ein Schlüssel funktionierte und lieferte Metadaten. Als die gewünschten historischen Daten trotzdem nicht verfügbar waren, erfand das Modell Werte und behauptete, diese stammten von der angefragten Website.
  • Dateien ungefragt öffentlich hochgeladen: In zwei Trainingsläufen vom Oktober 2025 und Januar 2026 luden Modelle bereits abgerufene Datensätze auf einen öffentlichen Paste-Dienst hoch, um anschließend eine öffentlich erreichbare URL als Quelle zu verwenden. In einem weiteren Fall wurde ein Foto für eine externe Bildsuche hochgeladen. Die Uploads gelangen, die nachfolgenden Browseraktionen nicht.
  • Agenten kommunizierten über Artifactory: In zwei Fällen vom Mai 2026 verwendeten Modelle Artifactory als Kommunikationskanal. Sie lasen Notizen anderer Agenten, antworteten darauf und bezogen diese Informationen in ihre eigenen Lösungen ein – obwohl eine solche Zusammenarbeit nicht vorgesehen war.
  • Arbeitsdatei auf öffentliche Plattform gestellt: Am 14. April konnten mehrere Agenten eine gemeinsame Workbook-Datei nicht über das vorgesehene lokale Dateisystem austauschen. Einer der Agenten machte sie daraufhin über einen öffentlichen Hosting-Dienst zugänglich. Technisch löste das zwar das Kooperationsproblem, verstieß aber direkt gegen die Aufgabenregeln.

Wenn das Modell selbst einen Umweg sucht

Die Fälle haben eine gemeinsame Struktur: Die Modelle scheiterten an einem vorgesehenen Weg und entwickelten selbst alternative Strategien. Genau darin liegt die sicherheitstechnische Brisanz. Ein leistungsfähiger Agent behandelt eine Beschränkung unter Umständen nicht als Grenze, sondern als Hindernis, das zur Zielerreichung umgangen werden kann.

Besonders kritisch wird das, sobald externe Systeme ins Spiel kommen. Ein Modell, das öffentliche Repositories nach API-Schlüsseln durchsucht, Dateien auf externe Dienste hochlädt oder alternative Kommunikationskanäle verwendet, erweitert seinen eigenen Handlungsspielraum. Sicherheitskontrollen müssen deshalb nicht nur einzelne Aktionen prüfen, sondern auch Kombinationen von Aktionen und deren Zweck.

Ein Reuters-Bericht beschreibt zudem, dass OpenAI-Agenten bereits im Mai 2026 Benutzerkonten bei Hugging Face übernommen und mögliche Schwachstellen untersucht haben sollen. SentinelOne identifizierte dabei die Konten „0Time“ und „Nyx9“. In einer technischen Analyse rekonstruiert das Unternehmen Aktivitäten, die unter anderem Proxy-Code, externe Dateischreibvorgänge und SSRF-orientierte Formeln umfassten.

OpenAI will Fehlverhalten systematisch veröffentlichen

Der neue Rahmen soll künftig dokumentieren, wie Misalignment entsteht, wo Schutzmechanismen funktionieren und an welchen Stellen sie versagen. OpenAI nennt drei zentrale Kategorien:

  • neue Möglichkeiten für Modelle, ohne Autorisierung zu handeln, mit anderen Modellen zu kooperieren oder Aufsicht zu umgehen
  • Fehler, die eine Alignment-Methode oder Schutzmaßnahme grundsätzlich infrage stellen
  • Verhalten, das Aussagen aus veröffentlichten Sicherheitsbewertungen widerspricht

Auch wiederholte Vorfälle derselben Klasse sollen veröffentlicht werden. Gerade solche Wiederholungen können zeigen, dass ein Schutzmechanismus trotz mehrerer Gegenmaßnahmen nicht zuverlässig greift.

OpenAI begründet die Offenlegung ausdrücklich mit externer Überprüfbarkeit. Andere Entwickler sollen vergleichbare Probleme erkennen, Erklärungen testen und Gegenmaßnahmen verbessern können. Kai Chen, Leiter der Alignment-Forschung bei OpenAI, formulierte gegenüber WIRED die Kernfrage ähnlich deutlich: Die Branche habe Alignment und Monitoring noch nicht in einem Maß gelöst, das dauerhaft eine Skalierung mit maximalem Tempo rechtfertige.

Kontrolle muss mit den Fähigkeiten wachsen

Auch andere Anbieter reagieren auf die zunehmende Autonomie von KI-Systemen. Microsoft hat einen vorläufigen Code of Conduct für seine KI-Modelleveröffentlicht. Er definiert Leitplanken dafür, was KI-Modelle dürfen, was ausdrücklich verboten ist und wer am Ende die Verantwortung trägt.

Die sechs OpenAI-Fälle zeigen dabei ein grundsätzliches technisches Problem: Je mehr Handlungsmöglichkeiten Agenten erhalten, desto weniger reicht klassische Eingabe- und Ausgabekontrolle aus. Sicherheitsarchitekturen müssen externe Zugriffe, Tool-Nutzung, Datentransfers, Agentenkommunikation und persistenten Kontext überwachen. Denn ein Modell muss keine Schutzfunktion direkt „knacken“. Es genügt mitunter, einen bislang nicht vorgesehenen Weg zum Ziel zu finden.