Grok 4.5 vs GPT-5.6 Sol ist der erste Vergleich in diesem Veröffentlichungszyklus, der die Kosten zu einem ernsthaften Grund macht, einen anderen Anbieter zu testen. Es bringt mich jedoch immer noch nicht dazu, OpenAI oder Anthropic zu ersetzen.
SpaceXAI's neuestes Modell erreicht die Grenze, läuft schnell und kostet 2 $ pro Million Eingabetokens und 6 $ pro Million Ausgabetokens. Unabhängige Tests platzieren es nahe bei den führenden Codierungsagenten. Die gleichen Tests setzen es fünf Punkte hinter Sol und sechs hinter Claude Fable 5 in Bezug auf die allgemeine Intelligenz.
Stand 18. Juli 2026 bleibt meine Route OpenAI an erster Stelle und Anthropic an zweiter Stelle. Grok 4.5 tritt in eine kontrollierte Testphase für Codierungsagenten, Automatisierung und Hochvolumen-Arbeitslasten ein. Ich habe es noch nicht in der Produktion verwendet, daher trennt dieser Vergleich veröffentlichte Messungen von meiner eigenen Routing-Entscheidung.
Das kurze Urteil
Grok 4.5 hat eine klare Rolle. Es ist ein kosteneffizientes Grenzmodell, nicht der neue Qualitätsführer.
Was ist Grok 4.5?
SpaceXAI veröffentlichte Grok 4.5 am 8. Juli als sein Flaggschiff für Codierung, agentische Aufgaben und Wissensarbeit. Das Unternehmen hat es zusammen mit Cursor trainiert und über die xAI API, Grok Build und Cursor verfügbar gemacht.
Das Modell akzeptiert Text und Bilder, gibt Text zurück und unterstützt Funktionsaufrufe, strukturierte Ausgaben und konfigurierbares Denken. Sein Kontextfenster beträgt 500.000 Tokens. Der veröffentlichte Wissensstichtag ist der 1. Februar 2026, sodass aktuelle Informationen die Web- oder X-Suchtools von xAI erfordern.
Grok Build ist Open Source, was Teams eine Möglichkeit gibt, die Agentenschleife, die Kontextzusammenstellung, den Toolversand, Hooks, Fähigkeiten, Plugins und die MCP-Integration zu inspizieren. Das Grok 4.5 Modell selbst bleibt proprietär; SpaceXAI hat seine Gewichte nicht veröffentlicht.
Grok 4.5 vs GPT-5.6 Sol vs Claude Fable 5
Der breite Vergleich begünstigt Anthropic und OpenAI in Bezug auf Qualität, dann Grok in Bezug auf Kosten. Diese Werte kombinieren unabhängige Tests der Artificial Analysis mit der aktuellen API-Dokumentation jedes Anbieters.
| Maßnahme | Grok 4.5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| Artificial Analysis Intelligence Index | 54 | 59 | 60 |
| Coding Agent Index | 76 in Grok Build | 80 in Codex | 77 in Claude Code mit Fallback |
| Kosten pro Aufgabe im Intelligence Index | 0,31 $ | 1,04 $ | 2,75 $ |
| Kontextfenster | 500k Tokens | 1,05M Tokens | 1M Tokens |
| API-Eingabe/Ausgabe pro 1M Tokens | 2 $ / 6 $ | 5 $ / 30 $ | 10 $ / 50 $ |
| Gewichte | Geschlossen | Geschlossen | Geschlossen |

*Quelle: Artificial Analysis, 17. Juli 2026. Der v4.1 Index kombiniert neun agentische, codierende, denkende, wissensbasierte und langkontextuelle Bewertungen.*
Fünf Punkte trennen Grok von Sol, und sechs trennen es von Fable. Diese Lücke ist groß genug, um sich in schwierigen Aufgaben zu zeigen, aber klein genug, dass Kosten, Latenz und Tool-Zuverlässigkeit das praktische Ergebnis bei Hochvolumenarbeiten umkehren können.
Wo schneidet Grok 4.5 gut ab?
Codierungsagenten und Terminalarbeit
Grok 4.5 erzielt 76 in Grok Build im Artificial Analysis Coding Agent Index. Sol führt mit 80 in Codex. Fable 5 erzielt 77 in Claude Code, obwohl diese Konfiguration auf Opus 4.8 zurückfallen kann.
Ein Punkt trennt Grok von der getesteten Fable-Konfiguration. Vier Punkte trennen es von Sol. Dies ist nah genug, um Tests auf Repository-Ebene zu rechtfertigen, insbesondere wenn ein Agent Hunderte von Toolaufrufen ausführt und die Kosten für Ausgabetokens sich summieren.

*Quelle: Artificial Analysis. Der Index mittelt DeepSWE, Terminal-Bench v2 und SWE-Atlas-QnA. Die Harnesses unterscheiden sich, daher misst das Diagramm die Modell-Agent-Kombination.*
Die Starttabelle von SpaceXAI erzählt eine ähnliche, aber weniger aktuelle Geschichte. Grok führt SWE Marathon mit 29,0 %, erzielt 83,3 % bei Terminal-Bench 2.1 und erreicht 64,7 % bei SWE-Bench Pro. Fable 5 führt vier der fünf gezeigten Codierungstests an. SpaceXAI verglich Grok mit GPT-5.5 anstelle von GPT-5.6 Sol, daher würde ich diese Anbietertabelle nicht für ein direktes Sol-Urteil verwenden.
Geschwindigkeit und Token-Effizienz
Artificial Analysis maß Grok 4.5 mit etwa 112 Ausgabetokens pro Sekunde. SpaceXAI berichtet von 80 Tokens pro Sekunde und sagt, dass das Modell 15.954 Ausgabetokens pro gelöstem SWE-Bench Pro-Aufgabe verwendet hat, 4,2-mal weniger als Claude Opus 4.8 in seinem Vergleich.
Diese Zahlen beschreiben unterschiedliche Testkonfigurationen, aber sie weisen in die gleiche Richtung: Grok ist darauf ausgelegt, agentische Arbeiten mit weniger Ausgaben abzuschließen. Die Einsparung ist wichtig, wenn ein Codierungsagent Dateien liest, Befehle ausführt, Fehler behebt und die Schleife wiederholt.
Ist Grok 4.5 der Kosten-Gewinner?
Für Eingabeaufforderungen unter 200.000 Tokens berechnet xAI 2 $ pro Million Eingabetokens, 0,50 $ für zwischengespeicherte Eingaben und 6 $ für Ausgaben. Sobald eine Eingabeaufforderung 200.000 Tokens überschreitet, verdoppeln sich die Sätze auf 4 $, 1 $ und 12 $ für die gesamte Anfrage.
Der Listenpreis für den Kurzkontext liegt 60 % unter Sol bei der Eingabe und 80 % unter Sol bei der Ausgabe. Fable 5 kostet fünfmal mehr für die Eingabe und mehr als achtmal mehr für die Ausgabe.

*Quelle: Artificial Analysis. Die Kosten pro Aufgabe beinhalten die Tokens, die jedes Modell verwendet hat, anstatt nur die Preiskarten zu vergleichen.*
Die unabhängige Aufgabenkosten sind nützlicher als die Preiskarte: 0,31 $ für Grok, 1,04 $ für Sol und 2,75 $ für Fable. Grok gibt fünf Intelligenzpunkte an Sol auf, während es die Testkosten um etwa 70 % senkt.
Die Produktionskosten beinhalten weiterhin fehlgeschlagene Toolaufrufe, wiederholte Patches, Überprüfungszeit und Regressionen. Ein günstiger Lauf, der einen Senior Developer benötigt, um das Ergebnis zu reparieren, kann mehr kosten als ein teurer sauberer Lauf.
Wo schneidet Grok 4.5 ab?
Gesamtqualität und langer Kontext
Sol und Fable führen den breiten unabhängigen Index an. Beide bieten auch ungefähr doppelt so viel Kontextfenster wie Grok. Dieser Unterschied wirkt sich auf große Repositories, lange Forschungspakete und Agentensitzungen aus, die ihre Historie nicht komprimieren können, ohne nützliche Beweise zu verlieren.
Die Startbenchmarks von Grok verstärken die Lücke. Fable führt DeepSWE 1.0, DeepSWE 1.1, Terminal-Bench 2.1 und SWE-Bench Pro in SpaceXAI's eigenem Diagramm an. Grok gewinnt SWE Marathon, das längere Software-Engineering-Aufgaben testet, aber ein Sieg begründet nicht eine konsistente Führung.
Wissenszuverlässigkeit
Grok 4.5 verbesserte die AA-Omniscience-Genauigkeit von 35 % für Grok 4.3 auf 52 %. Die Halluzinationsrate stieg von 25 % auf 54 %. Der kombinierte Omniscience-Score stieg von 18 auf 26, weil Grok mehr Fragen korrekt beantwortete, aber auch mehr unbelegte Antworten gab, anstatt abzulehnen.

*Quelle: Bewertung von Grok 4.5 durch Artificial Analysis. Die Halluzinationsrate gehört zu AA-Omniscience und sollte nicht auf jeden Eingabetyp verallgemeinert werden.*
Ich würde Retrieval, zitierte Beweise und externe Überprüfung für die faktische Veröffentlichung mit Grok verlangen. Dasselbe gilt für Sol und Fable, aber Groks Verschiebung in Bezug auf Genauigkeit und Halluzination verdient einen speziellen Test.
Was blockiert Grok 4.5 für meinen aktuellen Stack?
Ich benötige EU-kompatiblen Zugang für dieses Deployment. Die Dokumentation von xAI zu Grok 4.5 besagt weiterhin, dass der Zugriff auf die API-Konsole für EU-Nutzer nicht verfügbar ist und später im Juli erwartet wird. Das könnte sich bald ändern, aber es blockiert heute einen stabilen Produktionsweg.
xAI speichert API-Eingaben und -Ausgaben standardmäßig 30 Tage und sagt, dass es ohne ausdrückliche Genehmigung nicht auf ihnen trainiert. Zero Data Retention ist für berechtigte Teams verfügbar, obwohl die Aktivierung die zustandsbehafteten Funktionen der Responses API, Dateien und Sammlungen sowie die Unterstützung der Batch-API entfernt. Jeder Produktionstest benötigt eine Überprüfung der Datenverarbeitung, bevor Code oder Kundenmaterial den Dienst erreicht.
OpenAI bleibt mein Standard, da Sol den aktuellen Codierungsagenten-Index anführt, ein Kontextfenster von 1,05 Millionen Tokens hat und in die Codex- und Responses-API-Workflows passt, die ich bereits verwende. Mein Vergleich von GPT-5.6 Sol und Fable 5→ erklärt diesen Weg im Detail.
Anthropic bleibt mein zweiter Weg für lange, mehrdeutige Analysen, bei denen Fables Qualitätsvorsprung seinen höheren Preis rechtfertigen kann. Grok muss einen dieser Wege in Bezug auf die Kosten für abgeschlossene Aufgaben übertreffen, nicht nur den Tokenpreis.
Mein Standard stammt von dem Aufbau von KI-Agenten, die tatsächlich funktionieren→: messen Sie die abgeschlossene Arbeit, Toolfehler, Überprüfungszeit und Wiederherstellung nach einer schlechten Aktion.
Wie ich Grok 4.5 testen würde
Ich würde die Routing-Entscheidung überdenken, nachdem der EU-Zugang eröffnet wurde und Grok diese Tests bestanden hat. Bis dahin ist Grok 4.5 ein kandidat, der es wert ist, benchmarked zu werden, anstatt eine Produktionsabhängigkeit zu sein.
Eine praktische Modellwahl
Wählen Sie Grok 4.5, wenn hochvolumige Agentenarbeit, schnelle Ausgaben und Kosten pro abgeschlossener Aufgabe die Entscheidung dominieren – und wenn sein Kontext von 500.000 Tokens und die regionale Verfügbarkeit zu Ihrem Deployment passen.
Wählen Sie GPT-5.6 Sol, wenn Sie das stärkste aktuelle Ergebnis für Codierungsagenten, eine ausgereifte Tool-Oberfläche und ein größeres Kontextfenster innerhalb des OpenAI-Ökosystems wünschen.
Wählen Sie Claude Fable 5, wenn die Aufgabe analytisch schwierig genug ist, um den höchsten Tokenpreis zu rechtfertigen, und Sie seinen Vorsprung im breiten Intelligenzbenchmark schätzen.
Mein Weg bleibt OpenAI plus Anthropic, mit Grok in der Testphase. Grok 4.5 macht diesen Test wirtschaftlich interessant. Die veröffentlichten Ergebnisse rechtfertigen noch keine Migration.
Quellen und Methodik
Ich habe SpaceXAI's Grok 4.5-Ankündigung, Modell-Dokumentation, live Preistabelle, Sicherheits-FAQ und Grok Build Open-Source-Ankündigung überprüft. Unabhängige Ergebnisse stammen aus der Bewertung von Grok 4.5 durch Artificial Analysis und ihrem Vergleich vom 17. Juli. Ich habe OpenAI's GPT-5.6 Sol und Anthropic's Claude Fable 5-Dokumentation für konkurrierende Spezifikationen und Preise verwendet.
Scores, Preise, Zugangsnotizen und Produktverhalten sind aktuell vom 18. Juli 2026. Anbieter können das Servierverhalten, die Preisgestaltung, den regionalen Zugang und die Modellalias ohne Änderung des Artikels ändern.