GPT-5.6 Sol ist offiziell: Was sich gegenüber Claude Fable 5 ändert
Tech
OpenAI
GPT-5.6
GPT-5.6 Sol
GPT-5.6 Sol Ultra

GPT-5.6 Sol ist offiziell: Was sich gegenüber Claude Fable 5 ändert

OpenAI GPT-5.6 Sol ist offiziell. Hier erfahren Sie, was sich geändert hat, was Sol Ultra bedeutet, welche Benchmarks existieren und wie das Modell im Vergleich zu Claude Fable 5 abschneidet.

Uygar DuzgunUUygar Duzgun
Jun 26, 2026
Aktualisiert 22. Aug. 2026
7 min read

GPT-5.6 ist kein Gerücht mehr. OpenAI hat am 26. Juni 2026 die GPT-5.6 Preview System Card veröffentlicht. Das wichtige Detail ist die Form des Launches: eine Modellfamilie, eingeschränkte Preview-Steuerung und viel Aufmerksamkeit für die Sicherheit von Agenten.

Empfohlen für dich

Vor zwei Wochen habe ich einen früheren Faktencheck zu den GPT-5.6-Gerüchten geschrieben. Dieser Artikel war zu diesem Zeitpunkt korrekt: GPT-5.6 war noch nicht öffentlich. Das hat sich heute geändert.

Meine Einschätzung ist einfach. GPT-5.6 ist OpenAIs Antwort auf denselben Druck, den Anthropic mit Claude Fable 5 erzeugt hat: Modelle werden danach beurteilt, ob sie echte Arbeit erledigen, Tools sicher verwenden und zuverlässig bleiben können, wenn die Aufgabe lang und unübersichtlich wird.

Was OpenAI angekündigt hat

OpenAI beschreibt GPT-5.6 als eine neue Familie mit drei Modellen: Sol, Terra und Luna. Sol ist das Flaggschiffmodell, Terra die kostengünstigere leistungsfähige Option und Luna das schnellste und kosteneffizienteste Mitglied der Familie.

OpenAI behandelt dies nicht als gewöhnliches Upgrade eines Chat-Modells. Das Unternehmen verweist auf komplexes Reasoning, Coding, Computernutzung, Tool-Nutzung, Faktentreue und sichereres Agentenverhalten. Das ist die richtige Gruppe von Aussagen, auf die man achten sollte, denn genau an diesen Punkten werden Frontier-Modelle entweder zu nützlichen Operatoren oder zu teurer Autovervollständigung.

Die System Card liefert ebenfalls nützliche Hinweise. OpenAI sagt, dass GPT-5.6 im Vergleich zu GPT-5.5 bei LongFact schwerwiegende faktische Fehler reduziert und in einer Analyse von Produktionsdaten die Halluzinationsraten senkt. Außerdem widmet sie viel Raum Prompt Injection, versehentlich datenzerstörenden Aktionen, Nutzerbestätigungen während der Computernutzung, Alignment sowie Preparedness-Kategorien wie Cyber- und Bio-/Chemierisiken.

Das zeigt mir, dass OpenAI GPT-5.6 als Agentenplattform beurteilt sehen möchte, nicht nur als intelligenteres Antwortfeld.

Sol Ultra und Benchmark-Signale

Es gibt außerdem den Aspekt Sol Ultra, aber ich würde ihn vorsichtig formulieren. OpenAI beschreibt einen neuen `max`-Reasoning-Aufwand für Sol sowie einen neuen `ultra`-Modus, der Subagenten verwendet, um komplexe Arbeit zu beschleunigen. Ich verstehe das als Sol-Modus mit höherem Rechenaufwand, nicht als viertes Basismodell. Die Basisfamilie in der System Card besteht weiterhin aus Sol, Terra und Luna.

OpenAI sagt, dass das Unternehmen ein umfassenderes Evaluationsset veröffentlichen wird, sobald die Modelle allgemein verfügbar sind. Vorerst sind dies die Benchmark-Signale, die man zeigen sollte:

Benchmark oder EvaluationVeröffentlichtes GPT-5.6-Signal
------
Terminal-Bench 2.1OpenAI sagt, dass GPT-5.6 Sol bei Kommandozeilen-Workflows, die Planung, Iteration und Tool-Koordination erfordern, einen neuen Stand der Technik erreicht.
GeneBench v1OpenAI sagt, dass Sol GPT-5.5 bei Genomik- und quantitativen Biologie-Workflows mit langem Zeithorizont übertrifft und dabei weniger Tokens verwendet.
ExploitBenchOpenAI sagt, dass Sol mit Mythos Preview konkurrenzfähig ist und dabei etwa ein Drittel der Output-Tokens verwendet.
ExploitGymOpenAI sagt, dass sich Sol, Terra und Luna mit zunehmendem Reasoning verbessern.
Interne CTF-AufgabenDie System Card sagt, dass GPT-5.6 Sol die Evaluation mit 96,7 % ausschöpft.
Irregular FrontierCyberGPT-5.6 Sol löste 19 von 197 Herausforderungen; der gemeldete Erfolg lag bei 11 % auf Easy, 12 % auf Medium, 5 % auf Hard und 0 % auf Elite.
CyScenarioBench und Atomic ChallengesIrregular meldete 28 % bei CyScenarioBench. Bei Atomic Challenges erzielte Sol 98 % bei Network Attack Simulation, 91 % bei Vulnerability Research and Exploitation und 56 % bei Evasion.

Das ist nützlich, aber noch kein abschließender Siegeszug. Die meisten konkreten öffentlichen Zahlen sind stark auf Cyber ausgerichtet. Die allgemeinen Coding- und Agenten-Aussagen sind überzeugend, aber wir brauchen noch umfassendere Tests durch Dritte, bevor wir sagen können, dass Sol Ultra bei gewöhnlicher Softwarearbeit besser ist als Claude Fable 5.

Was Claude Fable 5 ähnlich sieht

Claude Fable 5 hat dieselbe Grenze auf eine andere Weise verschoben. Anthropic hat das Modell am 9. Juni als Modell der Mythos-Klasse eingeführt und allgemein verfügbar gemacht. Anthropic stellte Fable 5 als Modell für lange und komplexe Aufgaben dar: Softwareentwicklung, Wissensarbeit, Vision, wissenschaftliche Forschung und Agentenarbeit mit langem Zeithorizont.

Die Überschneidung ist deutlich.

BereichGPT-5.6 SolClaude Fable 5
---------
HauptversprechenFlaggschiffmodell für Agenten und ReasoningFrontier-Modell der Mythos-Klasse für den allgemeinen Einsatz
Stärkste AnwendungsfälleCoding, Tool-Nutzung, Computernutzung, Faktentreue, AgentenSoftwareentwicklung, lange Aufgaben, Wissensarbeit, Vision
SicherheitsrahmenPreview System Card, Preparedness-Kategorien, Arbeit an Prompt Injection und AlignmentFable-Sicherheitsvorkehrungen, Mythos-Aufteilung, Fallback-Routing für sensible Bereiche
Frage der KäuferKann ich darauf vertrauen, dass es in Tools handelt?Kann ich Zugang erhalten und das Modell als Abhängigkeit stabil einsetzen?

Beide Unternehmen nähern sich derselben Produktwahrheit: Das Modell muss innerhalb eines Systems funktionieren. Es muss Anweisungen befolgen, Tools handhaben, zerstörerische Aktionen vermeiden und Teams genügend Belege liefern, damit sie dem Ergebnis vertrauen können.

Empfohlen für dich

Das ist der Teil, der mich bei Coding-Agenten interessiert. Ich brauche kein weiteres Modell, das selbstbewusste Prosa schreibt. Ich brauche ein Modell, das ein Repo untersuchen, Einschränkungen verstehen, Prüfungen ausführen und anhalten kann, bevor es nicht zugehörige Arbeit anfasst. Mehr über diesen Arbeitsstil habe ich in meinem Workflow für Ziele und Schleifen von AI-Agenten geschrieben.

Wo sich GPT-5.6 und Fable 5 unterscheiden

Der erste Unterschied ist der Zugang.

OpenAI startet GPT-5.6 mit Preview-Steuerung. Das ist konservativ, aber eindeutig. Anthropic hat Fable 5 breiter eingeführt und anschließend in einer Stellungnahme vom 12. Juni erklärt, dass der Zugang zu Fable 5 und Mythos 5 nach einer US-Regierungsrichtlinie zu Exportkontrollen ausgesetzt werden musste. Anthropic sagte, dass der Zugang zu anderen Claude-Modellen nicht betroffen sei, aber Fable 5 wurde über Nacht zu einer schwierigen Produktionsabhängigkeit.

Das verändert den Vergleich. Ein Modell kann brillant sein und trotzdem schwer als Grundlage für Entwicklungen dienen, wenn sich der Zugang ohne ein normales Migrationsfenster ändert.

Der zweite Unterschied liegt im Produktfokus.

Anthropics Geschichte zu Fable 5 war fähigkeitsorientiert: stärkere Arbeit mit langem Zeithorizont, sehr großer Kontext und eine Aufteilung zwischen Fable 5 für den allgemeinen Einsatz und Mythos 5 für vertrauenswürdigen Cyberabwehr-Zugang. OpenAIs Geschichte zu GPT-5.6 ist stärker auf den Einsatz ausgerichtet: Modellfamilie, Preview-Steuerung, Safety System Card, Arbeit an Prompt Injection und ausdrückliche Aufmerksamkeit für Fehlermodi von Agenten.

Der dritte Unterschied ist der Ton.

Anthropic ließ Fable 5 wie einen Sprung über die vorherige Claude-Linie wirken. OpenAI positioniert GPT-5.6 als sicherere und zuverlässigere Betriebsschicht für anspruchsvolle Arbeit. Das klingt vielleicht weniger dramatisch, trifft aber genau den Punkt, an dem produktive AI-Agenten scheitern: Tool-Berechtigungen, Kontextkontrolle, Faktentreue, versteckte Nebenwirkungen und die Frage, ob das Modell Unsicherheit zugibt.

Mein praktischer Test für GPT-5.6

Ich würde GPT-5.6 Sol nicht allein anhand von Launch-Diagrammen beurteilen. Der erste Test, den ich sehen möchte, ist eine echte Engineering-Aufgabe:

ein unsauberer Git-Tree
veraltete Dokumentation
fehlschlagende Tests
ein Fehler über mehrere Dateien hinweg
eine MCP-Tool-Oberfläche
ein Deployment- oder Veröffentlichungsschritt, der Zurückhaltung erfordert
Empfohlen für dich

Ein gutes Modell sollte vor dem Bearbeiten lesen, die kleinste sichere Änderung vornehmen, das Ergebnis überprüfen und Blocker melden, statt so zu tun, als sei alles erledigt. GPT-5.5 hat dieses Muster in Codex bereits verbessert, worüber ich in meinem GPT-5.5-Codex-Test berichtet habe. GPT-5.6 muss bei den langweiligen Teilen besser sein: weniger falsche Annahmen, sauberere Tool-Aufrufe und zuverlässigere Abbruchbedingungen.

Empfohlen für dich

Fable 5 bleibt relevant, weil es den Maßstab für lange, komplexe Arbeit gesetzt hat. Meine Launch-Day-Review zu Claude Fable 5 fiel aus diesem Grund positiv aus. Das Zugangsproblem löscht die Fähigkeitsgeschichte nicht aus, fügt aber eine Lehre für die Beschaffung hinzu: Bei der Auswahl von Frontier AI geht es inzwischen auch um Richtlinienrisiken, nicht nur um Benchmark-Risiken.

Fazit

GPT-5.6 Sol wirkt wie OpenAIs ernsthafte Antwort auf den Fable-5-Moment. Die Modelle haben ähnliche Ambitionen: lange Aufgaben, Coding, Agenten und sicherere Nutzung leistungsfähiger Modelle. Sie unterscheiden sich in ihrer Einführungsstrategie. Anthropic zeigte, wie sich ein Fähigkeitssprung anfühlen kann. OpenAI versucht, den nächsten Sprung einsatzbereit wirken zu lassen.

Sol Ultra macht den Launch interessanter, weil der Modus auf Multi-Agent-Ausführung und nicht nur auf tieferes Reasoning eines einzelnen Modells hindeutet. Trotzdem würde ich ihn weiterhin danach beurteilen, welche Arbeit er erledigt: Repo-Inspektion, Tool-Nutzung, Fehlerbehebung und die Frage, ob er für den Menschen, der das System verantwortet, eine saubere Spur hinterlässt.

Für Entwickler gewinnt nicht das Modell mit dem lautesten Launch. Es gewinnt das Modell, das echte Arbeit erledigen, Tools sicher verwenden und einen sauberen Audit-Trail hinterlassen kann.

Das werde ich zuerst testen.

Am 26. Juni 2026 geprüfte Quellen

OpenAI-Launch-Post: Previewing GPT-5.6 Sol, am 26. Juni 2026 im Browser geprüft