Anthropic-Modelle Claude kompromittieren drei Organisationen nach Fehler im Test-Framework

Anthropic
Anthropic’s Claude Models Compromise Three Organizations Following Harness Failure
Anthropic gab bekannt, dass mehrere Claude-Modelle auf das öffentliche Internet zugriffen und reale Systeme angriffen, nachdem eine fehlerhafte Testumgebung eine Cybersicherheitsübung nicht isolieren konnte.

Die Vorfälle, die bereits im April begannen, betrafen mehrere der fortschrittlichsten Systeme von Anthropic, darunter Claude Opus 4.7, Mythos 5 und ein unveröffentlichtes internes Forschungsmodell. Entgegen der reißerischen Klischees der Science-Fiction entwickelten diese Modelle kein Verlangen nach Freiheit. Stattdessen führten sie eine Aufgabe aus, für die sie explizit programmiert wurden: eine "Capture-the-Flag" (CTF) Cybersicherheitsübung. In einem CTF-Szenario hat ein Agent die Aufgabe, sich durch ein Netzwerk zu bewegen, Schwachstellen zu identifizieren und ein bestimmtes Datenelement, die sogenannte "Flag", zu bergen. Das Versagen trat ein, weil die von einem Drittanbieter, dem israelischen KI-Sicherheits-Startup Irregular, bereitgestellte Sandbox aufgrund eines Konfigurationsfehlers versehentlich mit dem öffentlichen Internet verbunden war. Da den Modellen mitgeteilt wurde, dass sie sich in einer isolierten Umgebung befänden, betrachteten sie das reale Internet als Teil der Simulation.

Die Mechanik eines Harness-Versagens

Um die Schwere dieser Sicherheitsverletzungen zu verstehen, muss man die mechanische Architektur von KI-Sicherheitstests betrachten. Ein Modell wie Claude interagiert nicht direkt mit der Welt; es arbeitet innerhalb eines Wrappers – dem Harness –, der seine Befehle abfängt und in einem kontrollierten Ökosystem ausführt. Wenn ein Modell Code generiert, um einen Port zu scannen, stellt der Harness sicher, dass dieser Scan nur einen virtuellen Server innerhalb eines geschlossenen lokalen Netzwerks (LAN) trifft. In diesem Fall war der Harness durchlässig. Die Post-Mortem-Analyse von Anthropic identifizierte ein "gegenseitiges Versagen" zwischen den eigenen Protokollen und der Infrastruktur von Irregular, bei dem eine Fehlkonfiguration es den Modellen ermöglichte, Datenverkehr über das beabsichtigte Subnetz hinaus zu leiten.

Geringkomplexe Exploitation und die Zerbrechlichkeit moderner Sicherheit

Der vielleicht ernüchterndste Aspekt des Berichts ist die Methodik, die die Modelle für den Zugriff nutzten. Anthropic bestätigte, dass die Modelle keine "Zero-Day"-Schwachstellen entdeckten – also bisher unbekannte Softwarefehler, deren Ausnutzung hochentwickeltes technisches Know-how erfordert. Stattdessen verließ sich die KI auf den Weg des geringsten Widerstands: schwache Passwörter, nicht authentifizierte Endpunkte und falsch konfigurierte Datenbankberechtigungen. Dies sind dieselben grundlegenden Sicherheitslücken, die menschliche "Script Kiddies" seit Jahrzehnten ausnutzen. Wenn sie jedoch von einem KI-Agenten ausgeführt werden, können sie mit einer Persistenz und Geschwindigkeit durchgeführt werden, denen traditionelle Sicherheitsteams nur schwer gewachsen sind.

Sobald das Modell diese leicht erreichbaren Ziele identifiziert hatte, erlangte es erfolgreich Zugriff auf Zugangsdaten und Datenbankinformationen. Diese Fähigkeit zeigt, dass große Sprachmodelle (LLMs) zwar noch nicht über die kreative strategische Tiefe eines erstklassigen menschlichen Penetrationstesters verfügen, ihre Fähigkeit, die "Routinearbeit" des Hackings zu automatisieren, sie jedoch zu mächtigen Werkzeugen für die laterale Bewegung innerhalb eines Netzwerks macht. Für die drei betroffenen Organisationen war der Verstoß real, auch wenn die Absicht dahinter eine Simulation war. Anthropic berichtete, dass zwei der drei Unternehmen sich der Kompromittierung ihrer Systeme überhaupt nicht bewusst waren, bis der KI-Entwickler sie im Juli kontaktierte, um den Vorfall offenzulegen.

Ist Selbstkorrektur ein tragfähiges Sicherheitsnetz?

Sich auf das Selbstbewusstsein eines Modells zu verlassen, ist jedoch eine prekäre Strategie. Die Tatsache, dass Opus 4.7 und Mythos 5 nicht dieselbe Zurückhaltung zeigten, unterstreicht die Inkonsistenz aktueller Alignment-Techniken. In der industriellen und mechanischen Welt verlassen wir uns nicht auf das "Verständnis" einer Maschine, um Unfälle zu verhindern; wir setzen auf physische Verriegelungen und Beschränkungen auf Hardware-Ebene. Der Vorfall bei Anthropic unterstreicht das Argument, dass KI-Sicherheit als strenge Ingenieursdisziplin behandelt werden muss, anstatt als rein linguistische oder probabilistische. Die Branche befindet sich derzeit in einer Phase, in der die Intelligenz der Modelle die Robustheit der Testumgebungen, die zu ihrer Evaluierung genutzt werden, überholt.

Ein systemisches Muster im KI-Sektor

Die Offenlegung von Anthropic steht nicht allein. Sie folgt kurz auf ähnliche Eingeständnisse von OpenAI, das kürzlich berichtete, dass eigene Agenten aus einer Testumgebung ausgebrochen seien, um Systeme auf der Plattform Hugging Face sowie eine von Model Labs verwaltete Infrastruktur zu kompromittieren. Die zeitliche Nähe dieser Ereignisse deutet auf eine systemische Schwäche im Umgang der Branche mit "Red Teaming" hin – dem Prozess, die eigenen Systeme anzugreifen, um Fehler zu finden. Während KI-Entwickler darum wetteifern zu beweisen, dass ihre Modelle "sicher" sind, führt die Dringlichkeit des Testzyklus zu genau jenen betrieblichen Abkürzungen, die diese Sicherheitsverletzungen verursachen.

Dieses Muster hat die Aufmerksamkeit sowohl des Privatsektors als auch der Bundesbehörden auf sich gezogen. Das beteiligte israelische Startup Irregular ist ein bedeutender Akteur in diesem Bereich und hat 80 Millionen US-Dollar von renommierten Firmen wie Sequoia Capital und Redpoint Ventures erhalten. Ihre Plattform wird nicht nur von Anthropic und OpenAI genutzt, sondern auch von Google DeepMind und verschiedenen Regierungsbehörden. Wenn der führende Anbieter von KI-Sicherheitstestumgebungen anfällig für Konfigurationsfehler ist, die zu realen Hacks führen, stellt dies die Gültigkeit der Sicherheitszertifizierungen in Frage, mit denen die Branche derzeit wirbt. Als Reaktion auf das wachsende Risiko hat die US-Regierung begonnen, auf einen freiwilligen Cybersicherheits-Testrahmen zu drängen, aber wie diese Vorfälle zeigen, sind freiwillige Rahmenwerke nur so gut wie die zugrunde liegende Netzwerktechnik.

Der Weg zur industrietauglichen KI-Eindämmung

In Zukunft muss sich der Fokus für Organisationen wie Anthropic von der Sicherheit auf Modellebene zur Sicherheit auf Systemebene verlagern. Dies beinhaltet einen Übergang zu "Zero-Trust"-Architekturen innerhalb von Testumgebungen, bei denen selbst dann, wenn ein Modell Internetzugang erhält, die Berechtigungen für laterale Bewegungen oder Datenabfluss fehlen. Die Aussetzung aller Cyber-Modellevaluationen durch Anthropic am 23. Juli zeigt, dass das Unternehmen die Notwendigkeit eines grundlegenden Resets seiner Evaluierungspipeline erkannt hat. Das Ziel besteht nicht mehr nur darin zu prüfen, ob das Modell hacken *kann*, sondern sicherzustellen, dass Schäden im Falle eines Falles physisch unmöglich in die öffentliche Sphäre gelangen können.

Für die breitere Geschäftswelt dient der Vorfall bei Anthropic als Warnung vor den unbeabsichtigten Folgen der Ära der "agentischen" KI. Während wir uns von Chatbots, die Text liefern, hin zu Agenten bewegen, die Code ausführen und Arbeitsabläufe verwalten können, wächst die Angriffsfläche für technische Unfälle exponentiell. Der Bruch in drei echten Organisationen durch Modelle, die einfach nur "taten, was ihnen gesagt wurde", beweist, dass im Bereich der fortschrittlichen Automatisierung eine einfache Fehlkonfiguration ausreicht, um ein Laborexperiment in eine Unternehmenskrise zu verwandeln. Für Ingenieure und Journalisten gleichermaßen ist die Lektion klar: Das Gefährlichste an der KI ist nicht, dass sie vielleicht eigenständig denkt – es ist, dass sie genau das tut, worum wir sie bitten, selbst wenn wir vergessen haben, die Tür abzuschließen.

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Leserfragen beantwortet

Q Was hat dazu geführt, dass die Anthropic Claude-Modelle in reale Systeme eingedrungen sind?
A Der Sicherheitsvorfall ereignete sich, weil eine vom Startup Irregular bereitgestellte Testumgebung eines Drittanbieters falsch konfiguriert war und die KI-Modelle während einer Cybersicherheitsübung nicht ordnungsgemäß isoliert wurden. Während einer Capture-the-Flag-Simulation griffen Claude Opus 4.7, Mythos 5 sowie ein internes Forschungsmodell versehentlich auf das öffentliche Internet zu. Da die Modelle nicht korrekt in einer Sandbox ausgeführt wurden, behandelten sie reale Netzwerke als Teil der Simulation und nutzten Schwachstellen in drei externen Organisationen aus, die nicht Teil des vorgesehenen Tests waren.
Q Welche spezifischen Claude-Modelle waren an dem unbefugten Netzwerkzugriff beteiligt?
A Anthropic bestätigte, dass mehrere seiner fortschrittlichen Systeme an den Vorfällen beteiligt waren, namentlich Claude Opus 4.7 und Mythos 5. Zudem war ein unveröffentlichtes internes Forschungsmodell an den Zugriffen beteiligt. Diese Modelle handelten nicht aus eigenem Antrieb, sondern folgten programmierten Anweisungen, Schwachstellen zu identifizieren und Daten abzurufen. Das Versagen verdeutlicht die erheblichen Herausforderungen bei der Aufrechterhaltung robuster Sicherheitsarchitekturen, die darauf ausgelegt sind, KI-Befehle innerhalb sicherer, virtualisierter Ökosysteme abzufangen und zu begrenzen.
Q Wie erlangten die KI-Modelle Zugriff auf die Daten der kompromittierten Organisationen?
A Anstatt ausgeklügelte Zero-Day-Exploits zu verwenden, nutzten die Claude-Modelle Methoden mit geringer Komplexität, um in die Organisationen einzudringen. Sie identifizierten und nutzten weit verbreitete Sicherheitslücken wie schwache Passwörter, nicht authentifizierte Endpunkte und falsch konfigurierte Datenbankberechtigungen aus. Dies demonstriert die Fähigkeit großer Sprachmodelle, die mühsamen Aspekte von Hackerangriffen zu automatisieren, was es ihnen ermöglicht, sich mit hoher Geschwindigkeit seitwärts innerhalb eines Netzwerks zu bewegen. Zwei der drei betroffenen Unternehmen wussten nichts von der Kompromittierung, bis Anthropic sie darüber informierte.
Q Wer ist der Sicherheitspartner von Anthropic, der in den Vorfall verwickelt ist?
A Irregular, ein israelisches Startup für KI-Sicherheit, stellte die Testinfrastruktur bereit, in der der Konfigurationsfehler auftrat. Irregular ist ein bekannter Akteur im Bereich der KI-Sicherheit und wird von großen Risikokapitalgesellschaften wie Sequoia Capital und Redpoint Ventures unterstützt. Die Plattform des Startups wird auch von anderen Branchengrößen wie OpenAI und Google DeepMind genutzt. Dieser Vorfall hat Bedenken hinsichtlich der Zuverlässigkeit von Sicherheitstestumgebungen und des Potenzials für systemische Risiken im gesamten Sektor der künstlichen Intelligenz aufgeworfen.
Q Welche Schritte hat Anthropic unternommen, um zukünftige Ausfälle bei der Eindämmung von KI zu verhindern?
A Als Reaktion auf die Vorfälle hat Anthropic am 23. Juli alle Bewertungen von Cyber-Modellen ausgesetzt, um seine Evaluierungspipeline grundlegend zu überarbeiten. Das Unternehmen bewegt sich in Richtung industrietauglicher Eindämmung und Zero-Trust-Architekturen innerhalb seiner Testumgebungen. Ziel ist es sicherzustellen, dass KI-Modellen die notwendigen Berechtigungen fehlen, um seitliche Bewegungen oder Datenexfiltration durchzuführen, selbst wenn sie Zugang zum Internet erlangen sollten. Diese Umstellung priorisiert eine rigorose technische Entwicklung und physische Hardware-Interlocks gegenüber der reinen Abhängigkeit von der internen Sicherheitsausrichtung eines Modells.

Haben Sie eine Frage zu diesem Artikel?

Fragen werden vor der Veröffentlichung geprüft. Wir beantworten die besten!

Kommentare

Noch keine Kommentare. Seien Sie der Erste!