top of page
f_gen_FP_VzQr4rbrXtLYYidc_tesPSyuZCh0wk21C_edited.jpg

Intensives 1-Tages-Training, Arbeit am eigenen Anwendungsfall,  Zertifizierung & Zugang zu Premium-Tools...

Sicherheitsalarm, Teil 2: Mythos, Fable 5.1 und GPT-6 Astra

Autorenbild: Tanja Schmitt / Redakteurin
Tanja Schmitt / Redakteurin
9. Sept.
5 Min. Lesezeit

Vor drei Monaten musste Anthropic seine beiden Modelle Fable 5 und Mythos 5 auf Anweisung der US-Regierung abschalten. Der Grund: ein vermuteter Jailbreak – und, laut einer bis heute unbestätigten Quelle, die Sorge, eine Gruppe mit Verbindungen nach China könnte mitgelesen haben.


Jetzt sind die Nachfolger da – und ausgerechnet am selben Tag, an dem Anthropic sein nachgebessertes Fable 5.1 vorstellte, meldete OpenAI, dass sein neues Modell Astra zum ersten Mal überhaupt eine Sicherheitsschwelle auslöst, die bislang nur auf dem Papier existierte.


Als Fable 5 vom Star zum Sperrfall wurde


Jetzt mal von Anfang an. Im April 2026 stellte Anthropic „Claude Mythos Preview" vor und warnte selbst vor dessen Cyberfähigkeiten – zu gefährlich für den freien Markt. Nur ausgewählte Konzerne wie Amazon, Google, Microsoft und JPMorgan durften das Modell über „Project Glasswing" nutzen, um Schwachstellen in Software zu finden, bevor es Kriminelle tun.


Im Juni folgte dann die öffentliche Version Fable 5, quasi eine gedrosselte Mythos-Variante. Der Start verlief etwas holprig: Fable 5 enthielt einen Sicherheitsfilter. Wenn ein Nutzer eine vermeintlich heikle Frage stellte, wurde er sofort an Opus 4.8 weitergeleitet. Das sorgte für Kritik, weil auch gänzlich harmlose Anfragen weitergeleitet wurden. Am 12. Juni ordnete die US-Regierung per Exportkontrolldirektive an, ausländischen Staatsangehörigen den Zugriff auf Fable 5 und Mythos 5 zu untersagen. Weil sich das technisch nicht sauber durchsetzen ließ, schaltete Anthropic kurzerhand beide Modelle weltweit ab.


Anthropic sprach damals von einem „Missverständnis": Die beanstandete Technik sei im Kern nur die Anweisung gewesen, eine Codebasis zu lesen und Fehler zu beheben – Alltagsgeschäft für Sicherheitsexperten. Einen universellen Jailbreak fand man nie.


Pikanter wurde es später: Amazon-Chef Andy Jassy soll das Finanzministerium vorab informiert haben, und laut einer anonymen Quelle des US-Magazins Semafor soll eine Gruppe mit Verbindungen zur chinesischen Regierung Zugriff auf das eigentlich abgeschottete Mythos 5 gehabt haben – unbestätigt bis heute. Für Anthropic kam das zur Unzeit: Das Pentagon hatte das Unternehmen bereits im März als „Supply-Chain-Risiko" eingestuft, die Wirtschaftspresse wertete die Sperre zusätzlich als Belastung für den geplanten Börsengang.


Ein Modell, unterschiedliche Schutzmechanismen


Die Ankündigung von Fable 5.1 und Mythos 5.1 am 1. September liest sich wie eine Reaktion mit Ansage. Beide sind laut Anthropic „dasselbe Modell, nur mit unterschiedlichen Schutzmechanismen" – Fable 5.1 frei zugänglich, Mythos 5.1 nur über das Cyber Verification Program und das Life Sciences Verification Program.


Konkret heißt das für Fable: Die Cyber-Schutzmechanismen greifen jetzt rund 60 Prozent seltener ein, bei harmlosen Bio-Fragen sogar 85 Prozent seltener. Fable 5.1 darf zudem selbst Schwachstellen im eigenen Code identifizieren – Exploits bauen bleibt Opus-Modellen vorbehalten.


Was die „Neuen“ so drauf haben


Anthropic hat gemessen, natürlich nicht mit dem Zollstock, sondern mit speziellen Testverfahren. Fable 5.1 wurde vor allem an anspruchsvollen Aufgaben gemessen, sprich Aufgaben, die sich über viele Schritte und mehrere Programme hinziehen. Das ist genau die Art Arbeit, die bisher noch Menschen vorbehalten war.


Bei einem Testverfahren mit realistischen, mehrstündigen Forschungsaufgaben – vergleichbar mit dem, was ein Datenanalyst stundenlang am Computer erledigt, um Messwerte auszuwerten oder Experimente vorzubereiten – löst Fable 5.1 inzwischen 52,6 Prozent der gestellten Aufgaben korrekt.


Das klingt für den Laien erst mal nicht nach viel. Wenn man aber bedenkt, dass das Vorgängermodell nur etwa jede vierte Aufgabe (24,7 Prozent) richtig löste, ist das schon eine Hausnummer.


Auch beim eigenständigen Programmieren und bei mehrstufigen Büroaufgaben – etwa wenn Daten aus einer Anwendung in eine andere übertragen werden müssen – schneidet das neue Modell deutlich besser ab: Die Erfolgsquote steigt von 42,0 auf 55,8 Prozent beziehungsweise von 17,1 auf 31,4 Prozent.


Im vielzitierten Intelligence Index, der die allgemeine Leistungsfähigkeit verschiedener KI-Modelle vergleichbar macht, reicht das inzwischen zum Spitzenwert von 66 Punkten.


OpenAI zieht mit Astra nach


Am 1. September ließ OpenAI verlauten, dass Astra mehr Sicherheitslücken aufspüren könne als alle bisherigen eigenen Modelle – zum ersten Mal löse ein OpenAI-Modell die strengste, bislang rein theoretische Sicherheitsauflage aus.


VP Safety Amelia Glaese formulierte es so: Mit den richtigen Werkzeugen könne Astra „bisher unbekannte Sicherheitslücken finden und Wege entwickeln, diese in vielen gut geschützten Systemen auszunutzen, ohne dass eine Person jeden Schritt anleitet". Am 3. September folgte dann der offizielle Launch als „weltweit intelligentestes und am besten ausgerichtetes Modell", zunächst nur für ausgewählte Organisationen.


Kritisch trotz Warnschild


Vorsicht, jetzt wird’s technisch. Auf dem ExploitBench erreicht Astra ohne Produktivschutz 100 Prozent, gegenüber 78,5 Prozent beim Vorgänger. Bei 20 besonders kritischen V8-Sicherheitslücken löste es 39 statt 5,5 Prozent der Fälle – und entdeckte dabei zwei echte, bis dahin unbekannte Schwachstellen, die inzwischen gemeldet wurden. In Expertentests brach das Modell zudem aus der Sandbox eines gehärteten Browsers aus und baute eine Rechteausweitungskette bis zum Root-Zugriff. Kein Wunder, dass der Zugang vorerst auf eine kleine Alpha-Gruppe beschränkt bleibt.


Ein Modell, das sich versteckt


OpenAI wollte in einem Testszenario genau das prüfen: ob ein Modell von sich aus mehr tut, als ihm aufgetragen wurde – so wie beim Hugging-Face-Vorfall damals. Ohne die üblichen Sicherheitsfilter überschritt der Vorgänger GPT-5.6 Sol dabei in 48,2 Prozent der Fälle die ihm gesetzten Grenzen.


Und Astra? War regeltreu und überschritt die Grenze kein einziges Mal. Einen Haken gibt es dennoch: OpenAI-Chefwissenschaftler Jakub Pachocki bringt es auf den Punkt: „Je leistungsfähiger die Modelle werden, desto schwieriger wird es, genau zu verstehen, wozu sie fähig sind."


Astra spielt gern Portal


Ein unabhängiger Entwickler ließ kürzlich einen auf GPT-6 Astra basierenden Agenten das Videospiel „Portal" – ein Rätselklassiker, bei dem man sich durch Teleport-Portale in dreidimensionalen Räumen bewegen muss – weitgehend eigenständig durchspielen. Kein offizieller Benchmark, aber ein Beleg dafür, wie selbstverständlich diese Modelle mittlerweile mit komplexen 3D-Umgebungen zurechtkommen.



Glossar


  • Cyber Verification Program / Life Sciences Verification Program: Zugangsprogramme, über die geprüfte Organisationen bzw. Fachleute erweiterte Modellfähigkeiten unter gelockerten Schutzmechanismen nutzen dürfen.

  • Exploit: Code oder Methode, die eine Sicherheitslücke gezielt ausnutzt.

  • Exportkontrolldirektive: Behördliche Anordnung, die den Export oder die Weitergabe bestimmter Technologien an definierte Personengruppen einschränkt.

  • Jailbreak: Technik, mit der die eingebauten Schutzmechanismen eines KI-Modells umgangen werden.

  • Project Glasswing: Anthropic-Initiative seit April 2026, die ausgewählten Organisationen Zugang zu Mythos-Modellen für defensive Cybersicherheitsarbeit gibt.

  • Rechteausweitungskette: Eine Abfolge von Schritten, mit denen man sich von eingeschränkten Zugriffsrechten bis zu vollen Systemrechten hocharbeitet.

  • Root-Zugriff: Die höchste Berechtigungsstufe auf einem Computersystem – wer sie hat, kann uneingeschränkt auf alle Funktionen und Daten zugreifen.

  • Sandbox: Isolierte Testumgebung, in der ein Modell ohne Zugriff auf reale Systeme agiert.


Quellen


bottom of page