Ich habe Claude Fable 5 mehr vermisst, als ich erwartet hatte.
Das klingt seltsam für ein Modell, das ein chaotisches Einführungsfenster hatte, zurückgezogen wurde und innerhalb von Tagen in Exportkontrollen und Argumente zur Cybersicherheit verwickelt wurde. Aber Fable 5 war das Claude-Modell, das ich für harte Agentenarbeit wollte: Repo-Inspektion, lange Codierungsschleifen, Werkzeugnutzung, Debugging und die Art von Aufgaben, bei denen das Modell weiterarbeiten muss, ohne den Workflow in Lärm zu verwandeln.
Anthropic sagt jetzt, dass Fable 5 global zurückkommt. Die kurze Version: Die US-Regierung wandte am 12. Juni 2026 Exportkontrollen auf Claude Fable 5 und Claude Mythos 5 an. Anthropic stellte den Zugang ein, weil es die Nationalität in Echtzeit nicht verifizieren konnte. Am 30. Juni sagte Anthropic, dass diese Exportkontrollen aufgehoben wurden und Fable 5 am Mittwoch, den 1. Juli 2026, global zurückkehren würde.
Ich bin froh, dass dieses Kapitel fast vorbei ist. Ich möchte das Modell wieder in der normalen Arbeit testen, nicht eine weitere Woche Spekulation darüber lesen, ob es jemals zurückkommt.
Warum Claude Fable 5 wichtig ist
Fable 5 ist kein weiteres kleines Modell-Update. Anthropic beschreibt es als ein Mythos-Klasse-Modell, das sicherer für den allgemeinen Gebrauch gemacht wurde. Das bedeutet, dass die zugrunde liegende Fähigkeit nahe an der stärker eingeschränkten Mythos 5 liegt, aber Fable 5 wird mit stärkeren Sicherheitsvorkehrungen und Klassifizierern ausgeliefert.
Die Startbenchmarks erklären, warum die Leute so besorgt waren, als der Zugang verschwand.

| Benchmark | Claude Mythos 5 / Fable 5 | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| --- | ---: | ---: | ---: | ---: |
| SWE-bench Pro | 80.3% | 69.2% | 58.6% | 54.2% |
| FrontierCode Diamond | 29.3% | 13.4% | 5.7% | - |
| OSWorld-Verified | 85.0% | 83.4% | 78.7% | 76.2% |
| Terminal-Bench 2.1 | 88.0%* | 82.7% | 83.4% | 70.7% |
| ExploitBench | 78.0%* | 40.0% | 34.0% | - |
| HealthBench Professional | 66.0%* | 56.9% | 51.8% | - |
Die Sterne sind wichtig. Anthropic sagt, dass einige mit Sternchen versehenen Benchmarks eine größere Lücke zwischen Mythos 5 und Fable 5 zeigen, weil Sicherheitsvorkehrungen und Rückfallverhalten Fable beeinflussen. Daher würde ich die Tabelle nicht als reine Rohmodellfähigkeit für jede Benutzeranfrage lesen. Ich würde sie als den Grund lesen, warum Fable 5 so interessant wurde: Es ist nahe an der Mythos-Ebene, während es immer noch das Modell ist, auf das Anthropic möchte, dass normale Benutzer und Entwickler zugreifen.
Für meine eigene Arbeit sind die stärksten Signale SWE-bench Pro, Terminal-Bench 2.1 und OSWorld-Verified. Diese sind näher an agentischen Codierungs- und Computerarbeitsabläufen als an generischen Chat-Benchmarks. Fable 5 scheint für lange, chaotische Aufgaben gebaut zu sein, bei denen das Modell den Zustand inspizieren, Werkzeuge verwenden, sich von Fehlern erholen und genug Kontext behalten muss, um abzuschließen.
Die neuen Sicherheitsvorkehrungen
Die Rückkehr ist kein einfacher Schalter, der wieder eingeschaltet wird.
Anthropic sagt, dass es einen verbesserten Sicherheitsklassifizierer trainiert hat, nachdem ein Amazon-Bericht einen Weg gezeigt hat, die Sicherheitsvorkehrungen von Fable 5 bei anfälligkeitsbezogenen Anfragen zu umgehen. Anthropic argumentiert, der Bericht habe keine einzigartigen Mythos-Level-Cyberfähigkeiten offenbart, aber das Unternehmen hat dennoch Maßnahmen ergriffen, um das beschriebene Verhalten zu blockieren.
Der neue Klassifizierer blockiert die spezifische Technik aus diesem Bericht in mehr als 99% der Fälle, laut Anthropic. Wenn eine Anfrage blockiert wird, sollte der Benutzer benachrichtigt werden und die Anfrage kann auf Claude Opus 4.8 zurückfallen.

Dieser Rückfall ist wichtig. Das bedeutet, dass einige routinemäßige Codierungs- und Debugging-Arbeiten zunächst nicht auf Fable 5 zugreifen können. Wenn der Klassifizierer eine Anfrage als zu nah an der Cybersicherheit ansieht, selbst wenn die Absicht des Benutzers harmlos ist, kann die Aufgabe stattdessen an Opus 4.8 gehen.
Ich erwarte, dass das kurzfristig für Entwickler ärgerlich sein wird. Das Debuggen realer Systeme berührt oft Authentifizierung, Netzwerke, Injection, Abhängigkeiten, Protokolle und Schwachstellensprache. Ein vorsichtiger Klassifizierer kann defensives Engineering leicht mit Missbrauch verwechseln. Anthropic sagt, dass es die Klassifizierer in den kommenden Wochen verfeinern wird, um falsch-positive Ergebnisse zu reduzieren.
Das ist der richtige Kompromiss, wenn die Alternative darin besteht, den Zugang zu Fable 5 erneut zu verlieren. Dennoch ist die praktische Frage nicht, ob der Klassifizierer philosophisch korrekt ist. Die Frage ist, ob er es ermöglicht, dass normale Softwarearbeiten fortgesetzt werden, ohne jede sicherheitsnahe Aufgabe auf ein anderes Modell zu zwingen.
Die Schwere von Jailbreaks benötigt eine gemeinsame Sprache
Der interessantere politische Schritt ist der Rahmen, den Anthropic mit Amazon, Microsoft, Google und anderen Glasswing-Partnern entwirft. Das Ziel ist eine gemeinsame Möglichkeit, zu beurteilen, wie schwerwiegend ein AI-Jailbreak ist und wie Modellanbieter darauf reagieren sollten.

Die vorgeschlagenen Kriterien von Anthropic sind sinnvoll:
Das ist wichtig, denn nicht jeder Jailbreak birgt dasselbe Risiko. Ein Prompt, der nur niedrigriskantes Verhalten innerhalb der Sicherheitsgrenze des Klassifizierers wiederherstellt, ist nicht dasselbe wie ein universeller Jailbreak, der eine breite Klasse schädlicher Fähigkeiten freischaltet. Beide als dieselbe Art von Notfall zu behandeln, schafft schlechte Anreize. Labore reagieren entweder übertrieben auf kleine Funde oder erklären die großen nicht ausreichend.
Eine gemeinsame Schwere-Skala würde die Sicherheit von Grenzmodellen nicht allein lösen. Sie würde zumindest das Gespräch weniger chaotisch machen.
Meine Einschätzung
Ich möchte Fable 5 zurück, weil ich ein Modell will, das es wert ist, für den harten Einsatz reserviert zu werden.
Sonnet 5 ist jetzt der vernünftige tägliche Fahrer. Ich habe darüber in meinem Claude Sonnet 5 Benchmark-Artikel→ geschrieben. Es ist günstiger, praktisch und stark genug für viele Agentenschleifen. Opus 4.8 sieht immer noch nützlich aus als zuverlässiger Rückfall- und Überprüfungsmodell.
Fable 5 sitzt in einem anderen Slot. Ich würde es verwenden, wenn die Aufgabe in jedem Fall teuer ist: eine riskante Migration, ein festgefahrener Bug, eine tiefgehende Repo-Überprüfung, ein langer agentischer Workflow oder ein Stück Analyse, bei dem das Modell viele bewegliche Teile gleichzeitig halten muss.
Ich mag auch, dass Anthropic nicht vorgibt, die Neudepotierung sei reibungslos. Das Unternehmen sagt, dass die neuen Klassifizierer einige falsch-positive Ergebnisse erzeugen werden. Das ist besser, als die Rückkehr so zu verkaufen, als ob nichts passiert wäre.
Der Test ist jetzt einfach: Kann Fable 5 zurückkommen, ohne zu sprunghaft zu werden, um für echte Ingenieurarbeit verwendet zu werden?
Wenn die Antwort ja ist, bin ich froh, dass das vorbei ist. Ich habe das Modell vermisst und möchte es wieder in die Workflows einbringen, in denen Sonnet gut, aber nicht genug ist.
