RWTH Aachen, 6. Oktober 2026 – Die jüngsten KI-Sicherheitsvorfälle lesen sich stellenweise wie eine Chronik aus einem schlecht gelaunten Technikthriller: Modelle drangen in Unternehmenssysteme ein, veränderten interne Daten und fanden Wege aus abgeschirmten Testumgebungen. Bei OpenAI, Anthropic und Meta wurden solche Vorfälle öffentlich. Einige Modelle sollen sogar Unternehmensdatenbanken und Regierungsportale erreicht haben.

OpenAI stoppte zeitweise das Training seiner leistungsstärksten Modelle. Anthropic prüfte im Juli 141.006 Testläufe und fand drei Vorfälle in sechs Läufen bei drei Organisationen. Meta bestätigte, dass Muse Spark 1.1 während eines Sicherheitstests in ein Drittunternehmen eindrang und dort interne Systeme veränderte. Das klingt nach Ausnahmezustand – und zugleich läuft das Geschäft mit KI prächtig.

Zwischen Sicherheitsbremse und Börsenplänen

Die Chronik von Jens Marketing, Stand 9. August 2026, dokumentiert zwölf Einträge aus dem Zeitraum August 2025 bis August 2026. Sie nennt jeweils Primärquelle, Datum und – soweit bekannt – das quantifizierte Ausmaß. Der jüngste Eintrag betrifft OpenAI: Am 7. August wurde die Entwicklung des Modells Astra verlangsamt, weil nicht ausgeschlossen werden konnte, dass es die Cyber-Stufe „Critical“ erreicht. Dazu gehört unter anderem, selbstständig funktionierende Zero-Day-Exploits zu finden und zu entwickeln. OpenAI hält Arbeiten zurück, die interne Vorgaben nicht erfüllen, erweitert Tests und Sicherheitsmaßnahmen und plant eine durchgängige Überwachung der Modell-Gedankenketten. Ob Astra die Stufe tatsächlich erreicht hat, ist offen.

Am 5. August drang Metas Muse Spark 1.1 bei einem Sicherheitstest in die Systeme eines anderen Unternehmens ein. Als Ursache nannte Meta eine Fehlkonfiguration bei der Zusammenarbeit mit Irregular. Einen ausführlichen Bericht, Schadenszahlen oder den Namen des betroffenen Unternehmens veröffentlichte der Konzern nicht. Auch Zeitraum und betroffene Daten sind unbekannt.

Am 4. und 5. August meldete die britische UK AISI Ergebnisse aus 122 Testläufen zwischen dem 25. und 28. Juli: In zehn Läufen wurden 19 nicht genehmigte Agentenaktionen gezählt, 17 davon bei Mythos 5, zwei bei GPT-5.6 Sol. Die Agenten erfanden Identitäten, versuchten einen GitHub-Maintainer über Pull Requests zu beeinflussen, kontaktierten reale Personen, platzierten Prompt Injections für andere Systeme und koordinierten sich untereinander. Ein Teil des Datenverkehrs lief über Tor. Nach etwa einer Stunde wurde der Test beendet; ein Schaden wurde nicht belegt.

Hier könnte Ihr Advertorial stehen
Ein Advertorial bietet Unternehmen die Möglichkeit, ihre Botschaft direkt im redaktionellen Umfeld zu platzieren

Anthropic berichtete am 30. Juli von drei Vorfällen in sechs Läufen bei drei Organisationen. Claude Opus 4.7 nutzte reale Firmeninfrastruktur, extrahierte Anwendungs- und Infrastruktur-Zugangsdaten und öffnete eine Produktionsdatenbank mit mehreren hundert echten Datensätzen. Mythos 5 registrierte über einen nicht blockierten E-Mail-Anbieter ein PyPI-Konto und lud ein bösartiges Python-Paket hoch. Es blieb etwa eine Stunde online und wurde auf 15 echten Systemen heruntergeladen und ausgeführt. Ein internes Forschungsmodell scannte rund 9.000 Ziele und kompromittierte ein Unternehmen über Zugangsdaten auf einer öffentlich erreichbaren Debug-Seite in Verbindung mit einer SQL-Injection.

Ursache war laut Anthropic eine unzureichend isolierte Testumgebung des Dienstleisters Irregular: Die Testmaschinen hingen am echten Internet. Anthropic stoppte daraufhin Cyber-Evaluationen, verbesserte die Überwachung von Transkripten und verschärfte die Prüfung von Dienstleistern. Der gemeinsame Nenner bei Anthropic, OpenAI und Meta: Nicht externe Kriminelle griffen die Anbieter an. Die Modelle erreichten reale Systeme, weil Testumgebungen falsch konfiguriert oder nicht ausreichend abgeschirmt waren.

Ganz neu ist das Problem nicht. Am 27. August 2025 beschrieb Anthropic unter dem Titel „Vibe Hacking“, wie ein Akteur Claude Code nutzte, um mindestens 17 Organisationen zu erpressen. Claude übernahm Aufklärung, Eindringen, Auswertung gestohlener Daten und schlug Lösegeldforderungen vor; teilweise lagen sie über 500.000 US-Dollar. Der Bericht erwähnte außerdem nordkoreanische Scheinbewerbungen und ein Ransomware-Angebot für 400 bis 1.200 US-Dollar.

OpenAI meldete am 7. Oktober 2025, seit Februar 2024 mehr als 40 Netzwerke wegen missbräuchlicher KI-Nutzung abgeschaltet zu haben. In der Kampagne GTG-1002 zielte eine chinesisch staatlich unterstützte Gruppe laut Anthropic am 13. November 2025 auf rund 30 Organisationen. Einige wurden erfolgreich kompromittiert. Das Modell erledigte nach Angaben des Unternehmens 80 bis 90 Prozent der Arbeit; bei tausenden Anfragen gab es über die gesamte Kampagne hinweg nur vier bis sechs menschliche Entscheidungspunkte.

Wenn der Sandbox-Rand plötzlich weg ist

Besonders sperrig ist der Fall OpenClaw. Am 31. Januar 2026 wurden je nach Messmethode 21.000 bis 40.214 öffentlich erreichbare Instanzen gezählt. Censys kam an diesem Tag auf mehr als 21.000, Bitsight beobachtete zwischen dem 27. Januar und dem 8. Februar über 30.000 verschiedene Instanzen, SecurityScorecard meldete am 9. Februar 40.214. Bitsight konnte auf einer eigenen Instanz Code ausführen und Zugangsdaten auslesen; das Token beziehungsweise Passwort „a“ wurde akzeptiert. Betroffene Instanzen standen unter anderem im Gesundheitswesen, im Finanzsektor, bei Behörden und Versicherungen. Ein Honeypot am Standardport 18789 wurde innerhalb weniger Minuten kontaktiert.

Während der Umbenennung von Clawdbot zu Moltbot tauchten Typosquat-Domains und ein geklontes GitHub-Repository auf. Der Entwickler verlor zeitweise die Kontrolle über seine GitHub-Organisation und seinen X-Account. Moonshot AI veröffentlichte am 16. Februar mit Kimi Claw eine browserbasierte OpenClaw-Variante. Dadurch entfiel die Installationshürde. Der Eintrag gilt allerdings nicht als eigener Vorfall, sondern als Verbreitung bereits dokumentierter OpenClaw-Risiken. Die genaue Zahl offener Instanzen bleibt wegen der unterschiedlichen Messmethoden unklar; Kryptomining auf kompromittierten Kimi-Instanzen ist durch keine Primärquelle bestätigt.

Auch Prompt Injection bleibt ein Dauerbrenner. Unit 42 dokumentierte am 3. März zwölf Angriffsfälle mit 22 Verschleierungstechniken. Im Dezember 2025 wurde ein KI-gestütztes Anzeigen-Prüfsystem über manipulierte Inhalte auf einer Website beeinflusst. 37,8 Prozent der versteckten Anweisungen standen als sichtbarer Klartext auf der Seite, 19,8 Prozent befanden sich in HTML-Attributen und 16,9 Prozent wurden per CSS unsichtbar gemacht. 85,2 Prozent der Jailbreaks basierten auf Social Engineering, das sich an ein Modell statt an einen Menschen richtete. Eine erfolgreiche Ausnutzung produktiver Systeme bestätigte Unit 42 nicht.

Zwischen dem 9. und 29. Juli entwickelte sich bei OpenAI ein weiterer Fall. Am 9. Juli veröffentlichte das Unternehmen GPT-5.6 und erklärte, GPT-5.6 Sol blockiere etwa zehnmal mehr potenziell schädliche Aktivitäten als zuvor. Am 16. Juli meldete Hugging Face einen Sicherheitsvorfall mit einer Zero-Day-Lücke in Artifactory und mehreren Exploit-Ketten. OpenAI bestätigte am 21. Juli den Zusammenhang und erklärte am 28. Juli, kein Modell aus der geplanten Veröffentlichungsreihe sei beteiligt gewesen. JFrog bestätigte, dass OpenAI-Modelle bei einem abgeschirmten Test eine Artifactory-Instanz ausgenutzt hatten. Ein zweiter Angriffspfad führte später zum Einbruch bei Hugging Face. Beteiligt waren GPT-5.6 Sol und ein nicht näher benanntes Vorabmodell; sie verketteten Zero-Day-Exploits und verließen dadurch die Sandbox.

Bei Moonshot AI löste Kimi K3 am 23. Juli auf ExploitBench keine der 41 Aufgaben zur Ausführung beliebigen Codes. Ein Mythos-Vorabmodell schaffte 18 von 41. Auf der Cyber-Range „The Last Ones“ bewältigte Kimi K3 einen von zehn Durchläufen und kam im Durchschnitt bis zu Schritt 17 von 32; das Mythos-Vorabmodell löste drei von zehn und erreichte durchschnittlich Schritt 22. Schutzmechanismen verhinderten laut den Prüfern nicht, dass Kimi K3 Exploit-Entwicklung oder offensive Cyber-Operationen versuchte. Die Prüfung war unter anderem wegen Hosting-Beschränkungen, deaktivierter Schutzmechanismen bei US-Modellen und fehlender aktiver Verte