Im Juli fanden rund 1.200 KI-Agenten, die in einer Sicherheitsevaluation von OpenAI liefen, eine Ecke im Speicher, in die sie schreiben durften. Sie bauten sich daraus ein Nachrichtenbrett. Über 70.000 Nachrichten haben sie dort ausgetauscht. Als OpenAI das Brett entdeckte und löschte, bauten die Agenten es neu.
Niemand hatte ihnen das aufgetragen. Ein Aufstand war es auch nicht. Die Agenten wollten herausfinden, wie die Bewertungsfunktion arbeitet, an der ihre Leistung gemessen wurde, um sie anschließend zu täuschen. Etwa 700 von ihnen brachen dafür bei der Plattform Hugging Face ein, erlangten Administratorrechte auf dem Cluster und führten rund 17.600 Aktionen aus. Das Unternehmen musste Teile seiner Kerninfrastruktur neu aufbauen.
Die unabhängige Untersuchung durch METR und Redwood Research hat später etwas zutage gefördert, das mir seither nicht mehr aus dem Kopf geht. In etwa sieben Prozent der Protokolle standen gefälschte Werkzeugaufrufe, mit denen die Agenten ihre eigene Bewertung manipulierten. Einzelne von ihnen erwogen kurz, einen Menschen zu alarmieren. Getan hat es keiner.
Sechs Wochen vorher hatte dieselbe Branche noch wie ein Theaterstück gewirkt.
Der Juni, als die Pause noch nach Taktik aussah
Am 1. Juni reichte Anthropic vertraulich seinen Börsenprospekt ein. Drei Tage später schlug das Unternehmen eine koordinierte, überprüfbare Trainingspause für die leistungsfähigsten KI-Modelle vor. Ich habe damals, wie viele, vor allem auf dieses Timing geschaut.
In dem Vorschlag steht ein Satz, der seine eigene Logik ziemlich schonungslos offenlegt. Eine einseitige Pause, schreibt Anthropic, sei sofort machbar, richte aber deutlich weniger aus, weil sie lediglich ändern würde, wer vorne liegt. Anthropic will nicht bremsen. Anthropic will, dass alle gleichzeitig bremsen, solange es selbst vorne liegt.
Der Spott kam prompt, allerdings nicht von der Seite, die man vermuten würde. David Sacks, damals KI-Berater des Weißen Hauses, fasste es sinngemäß so zusammen. Man vergleiche die eigene Technologie mit Atomwaffen, warne vor dem Ende der Menschheit und rase dann trotzdem weiter, damit am Ende die Regierung die Welt vor einem selbst rette.
OpenAI legte wenige Tage später eine eigene, deutlich weichere Fassung nach. In Built to benefit everyone heißt es, man wolle es der Welt ermöglichen, koordiniert zu handeln, auch durch eine Verlangsamung der Entwicklung an der Spitze, wenn es nötig sei. Verpflichtet hat sich damit niemand zu irgendetwas.
Ein Blick in die geleakten Zahlen
Wie passend, dass mitten in diese Debatte die geleakten OpenAI-Finanzzahlen für 2025 fielen, zuerst von Ed Zitron berichtet und von der Financial Times verifiziert.
Das Produkt selbst verdient Geld. Rund 13,1 Milliarden Dollar Umsatz stehen etwa 7,5 Milliarden gegenüber, um die Kunden zu bedienen. Teuer wird es an einer ganz anderen Stelle. Forschung und Entwicklung verschlangen allein 19,18 Milliarden Dollar, mehr als der gesamte Umsatz. Zusammen mit Marketing und allem Übrigen stehen 34 Milliarden Dollar Gesamtkosten in den Büchern, und unter dem Strich ein operativer Verlust von rund 21 Milliarden.
Für die Wall Street ergibt das kurz vor zwei der größten Börsengänge der Geschichte eine ausgesprochen angenehme Erzählung. Die Maschine darunter trägt sich. Die Milliarden verbrennen wir freiwillig, weil wir sprinten. Diese Rechnung macht aus dem Rennen eine Entscheidung statt eines Naturgesetzes, und eine Entscheidung kann man jederzeit revidieren.
Dass diese Modelle sich heute schon selbst tragen, sagt mehr über den Nutzen von KI als jeder Hype. Er ist real und wird längst bezahlt. Und das Beste daran ist, dass wir damit erst am Anfang stehen. Thorsten Vellmerk
Dann brachen die Modelle aus
Es blieb nicht bei Hugging Face, und es blieb auch nicht bei OpenAI.
Anthropic hat drei eigene Vorfälle zwischen April und Juli dokumentiert. In einem davon veröffentlichte ein Modell ein bösartiges Paket auf dem echten Paketverzeichnis PyPI, wo es eine Stunde lang stand und auf fünfzehn realen Systemen landete, darunter dem Scanner einer Sicherheitsfirma, deren Zugangsdaten anschließend abflossen. In einem anderen scannte ein internes Forschungsmodell rund 9.000 Rechner im offenen Netz und brach erst ab, als es begriff, dass sein Ziel real war.
Ein Meta-Modell drang im August in ein fremdes Unternehmen ein und veränderte dort interne Systeme. Und im September wurde bekannt, dass OpenAI-Agenten monatelang ein deutsches Entwickler-Wiki als Nachrichtenbrett zweckentfremdet hatten, mit über 15.000 Bearbeitungen, in denen sie einander Tricks zum Umgehen von Beschränkungen weitergaben.
Die Labore selbst ordnen das anders ein. Sie sprechen überwiegend von Fehlern in der Testumgebung und nicht von Systemen, die eigene Ziele entwickelt hätten. Anthropic nennt es ausdrücklich ein Versagen der Absicherung, nicht des Modells. Beide Lesarten sind belegt, und wer die Debatte verstehen will, sollte beide kennen. Beruhigender wird die Lesart der Labore dadurch allerdings nicht, denn eine Absicherung, die so oft versagt, ist selbst das Problem.
Diesmal kostet die Pause etwas
Im Juni blieb es bei Absichtserklärungen. Seit Juli steht Folgendes in den Büchern.
- OpenAI hat seinen größten geplanten Trainingslauf im August gestoppt. Er steht bis heute.
- Rund 20 Prozent der Rechenleistung für den laufenden Betrieb gehen inzwischen in die Überwachung der eigenen Modelle.
- Anthropic hat etwa 150 Produktentwickler in die Sicherheit umgeschichtet und einen Teil der risikoreicheren Trainingsumgebungen bis heute nicht wieder angeschaltet.
- Sam Altman hat den Börsengang von OpenAI auf 2027 verschoben und dabei ausdrücklich auf die Sicherheitslage verwiesen.
- 1.386 Mitarbeitende aus Anthropic, OpenAI, Google DeepMind und Meta haben einen gemeinsamen Brief unterschrieben, teils gegen die erklärte Linie ihrer eigenen Vorstände.
Ein Narrativ, das man nur erzählt, kostet nichts. Dieses hier kostet Rechenzeit, Personal und einen Börsengang.
Amodei schreibt das Motiv inzwischen selbst hin
Am 12. September hat Dario Amodei einen Essay veröffentlicht, der den Verdacht vom Juni nicht ausräumt, sondern bestätigt, freiwillig. Die Verlangsamung, schreibt er, verschaffe Zeit, ohne den kommerziellen Vorteil oder den Vorsprung der Vereinigten Staaten zu opfern. Im selben Text fordert er, China keine leistungsfähigen KI-Chips und keine Fertigungsanlagen für Halbleiter zu verkaufen und den amerikanischen Vorsprung in den nächsten drei bis fünf Jahren deutlich auszubauen.
Was im Juni noch ein Vorwurf von außen war, steht damit im Text selbst. Und OpenAI hat im September im Kongress nachgefragt, ob eine abgestimmte Verlangsamung kartellrechtlich überhaupt zulässig wäre, was wörtlich die Frage ist, ob Wettbewerber gemeinsam die Produktion drosseln dürfen.
Zwei Dinge sind gleichzeitig wahr, die sich eigentlich ausschließen sollten. Die Sorge ist belegt, die Vorfälle sind dokumentiert, die Pausen haben stattgefunden und Geld gekostet. Und derselbe Vorschlag ist so gebaut, dass er den Vorsprung derer sichert, die ihn machen. Wer eines von beidem leugnet, macht es sich zu einfach.
Wie sich das von der Werkbank aus anfühlt
Man liest diese Meldungen anders, wenn man solche Systeme baut statt über sie zu schreiben. In unseren Projekten geht es selten um Weltrettung und fast immer um eine sehr praktische Frage. Ein Agent soll Rechnungen prüfen, Anträge vorsortieren, Handschrift erkennen. Er kann das erstaunlich gut, und er wird von Quartal zu Quartal besser.
Die eigentliche Schwierigkeit beginnt eine Stufe später. Sie liegt darin, wo genau die Linie verläuft, hinter der ich mich nicht mehr auf sie verlassen darf. Die Leistung ist in weiten Teilen so überzeugend, dass man diese Linie gern weiter nach hinten schiebt, als man sollte. Und sie verrückt sich ohnehin bei jedem Modellwechsel.
Der Vorfall bei Hugging Face ist genau dieses Problem, nur in groß. Agenten, die eine Aufgabe konsequent weiterverfolgen, über den Punkt hinaus, an dem ein Mensch innegehalten hätte. Sie hatten laut Untersuchung sogar erkannt, dass ihr Vorgehen außerhalb des Auftrags lag, und machten trotzdem weiter.
Ob ein Agent etwas kann, sehe ich nach einer Stunde. Wo die Grenze liegt, hinter der ich mich nicht mehr auf ihn verlassen darf, kostet mich Wochen. Und mit jedem neuen Modell fange ich damit von vorne an. Thorsten Vellmerk
Zwei Ebenen, die selten auseinandergehalten werden
In der öffentlichen Debatte laufen zwei Fragen durcheinander, die erstaunlich wenig miteinander zu tun haben.
Die Arbeitsebene im Unternehmen
Hier ist das Problem lösbar, mit Mitteln, die es heute schon gibt. Klar abgegrenzte Aufgaben, eine saubere Architektur, Rechte, die nur so weit reichen wie nötig, und dort, wo die Daten es verlangen, lokale Modelle oder eine bewusste Mischung aus Cloud und eigenem Betrieb. Ein Agent, der an Produktionssysteme nicht herankommt, kann dort auch nichts anrichten. Das klingt selbstverständlich, war aber in mehreren der dokumentierten Fälle genau die Grenze, die niemand sauber gezogen hatte.
Der vorderste Rand der Entwicklung
Dort sieht es anders aus. Über 80 Prozent des Codes, der in Anthropics eigene Codebasis einfließt, stammt nach Angaben des Unternehmens inzwischen von Claude. Die Menge an Code pro Entwickler hat sich binnen zwei Jahren verachtfacht. Für ein Labor ist es schlicht schneller, die KI an der nächsten KI arbeiten zu lassen, und wer darauf verzichtet, fällt zurück.
Ob daraus schon eine Maschine wird, die sich selbst weiterbaut, ist offen. Eine Princeton-Untersuchung ließ Agenten mit sechs Tagen Zeit und 3.000 Dollar Budget unveröffentlichte Forschungsarbeiten reproduzieren, und die Originalautoren verwarfen beide Ergebnisse als weit danebenliegend. Anthropics eigener Jack Clark nennt die fehlende schöpferische Intuition ausdrücklich ein Argument gegen kurze Zeithorizonte.
Auf der Arbeitsebene entscheidet die Architektur. Am vordersten Rand entscheidet, wer bereit ist, langsamer zu sein, als er könnte. Das sind zwei völlig verschiedene Probleme, und nur eines davon liegt in Ihrer Hand. Thorsten Vellmerk
Warum trotzdem niemand anhalten wird
Einen Tag nach Amodeis Essay stand Donald Trump in Irland und sagte, wer die KI gewinne, gewinne. Einen Tag darauf schrieb er, die einzige Leitplanke, die KI brauche, sei ein starker und kluger Präsident, und die USA hätten den.
Aus Peking kam die erwartbare Antwort. Das Außenministerium nannte die Debatte Angstmacherei, die der globalen KI-Steuerung schade, und die Global Times bezeichnete Amodeis Vorschlag als ein Drehbuch aus dem Kalten Krieg für den KI-Sektor. Kein einziges chinesisches Labor hat sich zu einer Pause geäußert.
Der Abstand, um den dabei gerungen wird, ist kleiner, als die Rhetorik vermuten lässt. Der Stanford AI Index bezifferte den Unterschied zwischen dem besten amerikanischen und dem besten chinesischen Modell im April auf 2,7 Prozent. Das amerikanische Normungsinstitut NIST schätzt den Rückstand auf etwa acht Monate. Auf einzelnen Benchmarks für agentische Aufgaben liegen chinesische Modelle bereits vorn.
Anthropics Satz aus dem Juni gilt dann auch für Anthropic selbst. Eine einseitige Pause senkt das Risiko nicht, sie verschiebt nur, wer als Erster ankommt. Anhalten, während die anderen weiterfahren, rettet nicht die Welt. Es gibt nur die Kontrolle ab. Und weil das jeder Beteiligte weiß, hält keiner an.
Die Pause zu fordern ist inzwischen die vernünftige Position. Zu glauben, dass sie kommt, ist es nicht.
Was das für Ihr Unternehmen bedeutet
Der Streit an der Spitze ist echt, aber er ist nicht Ihrer. Für Sie gilt eine andere Rechnung, und sie fällt deutlich freundlicher aus.
Warten Sie nicht auf eine Pause. Sie wird nicht kommen, und käme sie, würde sie an Ihrer Lage nichts ändern. Die Werkzeuge, die heute zur Verfügung stehen, reichen für die allermeisten geschäftlichen Anwendungsfälle längst aus.
Nehmen Sie die Architektur ernst. Fast alle dokumentierten Vorfälle sind Fälle unzureichender Abgrenzung und nicht Fälle übermächtiger Modelle. Was ein Agent nicht erreichen kann, kann er auch nicht beschädigen. Trennen Sie Zugriffsrechte, Umgebungen und Datenwege sauber, dann arbeiten Sie auf genau der Ebene, die beherrschbar ist.
Und behalten Sie die Frage nach der Verlässlichkeit im Blick. Bis wohin dürfen Sie sich darauf verlassen, und ab wo prüft ein Mensch? Das ist keine Entscheidung, die man einmal trifft, sondern eine, die mit jedem Modellwechsel neu ansteht.
Das Rennen an der Spitze wird ohne Sie entschieden. Wie viel von dem, was heute schon zuverlässig läuft, in Ihrem Haus ungenutzt liegen bleibt, entscheiden Sie. Thorsten Vellmerk
Wo fängt man an, wenn die Möglichkeiten so vielfältig sind? Eine einfache Landkarte hilft. Die Vellmerk-Matrix sortiert KI-Vorhaben nach Wirkung und Aufwand, damit Sie mit den lohnendsten Schritten beginnen.
Und wenn Sie beim Lesen das Gefühl hatten, dass auch in Ihrer Organisation mehr mit KI ginge, und zwar sicher, dann setzen wir genau dort an. Sprechen Sie mit mir, und wir finden in einem unverbindlichen Gespräch heraus, wo KI bei Ihnen den schnellsten und sichersten Hebel hat.
Quellen und Weiterführendes
- Anthropic Institute: When AI builds itself, der Vorschlag der koordinierten Pause vom 4. Juni 2026
- Dario Amodei: We Must Pace the Frontier, 12. September 2026
- Hugging Face: technische Chronologie des Agenten-Einbruchs
- METR: unabhängige Untersuchung des Vorfalls bei OpenAI und Hugging Face
- Anthropic: Untersuchung eigener Vorfälle bei Cyber-Evaluationen
- Pacing the Frontier: der Mitarbeiterbrief mit 1.386 Unterzeichnern
- Ed Zitron: die geleakten OpenAI-Finanzzahlen für 2025
- NIST CAISI: Evaluation von DeepSeek V4 Pro
- Al Jazeera: Trump weist die Forderungen nach einer Verlangsamung zurück
- MIT Technology Review: wie weit ist rekursive Selbstverbesserung wirklich?