Kimi K3 vs GPT-5.6 Sol ist so knapp, dass ich meine Routing-Tests erneut durchführe. Moonshots Modell ersetzt OpenAI oder Anthropic in meinem Stack immer noch nicht.
Diese Schlussfolgerung ist weniger dramatisch als die Schlagzeilen zum Launch, aber die Zahlen unterstützen sie. Moonshot AIs neues Flaggschiff belegt den dritten Platz in einem unabhängigen Intelligenz-Index, führt eine Arena für blindes Frontend-Coding an und schlägt GPT-5.6 Sol bei einem Test für langfristige Wissensarbeit. Es bleibt jedoch hinter Claude Fable 5 und Sol bei den breitesten Maßnahmen zurück, und die herunterladbaren Gewichte sind weiterhin für einen zukünftigen Zeitpunkt angekündigt.
Stand 18. Juli 2026 betrachte ich Kimi K3 als ernsthaften Evaluierungskandidaten, nicht als Grund zur Migration von Produktionsworkloads. Ich habe K3 noch nicht durch meinen eigenen Produktions-Benchmark laufen lassen, daher trenne ich im Folgenden Ergebnisse von Drittanbietern von meiner Routing-Entscheidung.
Das kurze Urteil
Das Ergebnis ist ein Dreikampf zwischen Modellen mit unterschiedlichen Gewinnern je nach Aufgabe. Ein einzelnes Leaderboard kann Ihnen nicht sagen, welches Modell Ihre Arbeit mit den wenigsten Wiederholungen abschließt.
Was ist Kimi K3?
Moonshot AI stellte Kimi K3 am 16. Juli als ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern vor. Sein Router wählt für jedes Token 16 von 896 Experten aus. K3 verfügt außerdem über native Bild-Eingabe, ein Kontextfenster von einer Million Token und Textausgabe.
Moonshot führt den Sprung von K2 auf zwei architektonische Änderungen zurück: Kimi Delta Attention und Attention Residuals. Das Unternehmen berichtet von einer etwa 2,5-mal besseren Skalierungseffizienz als K2, aber ein technischer Bericht wurde noch nicht veröffentlicht. Diese Zahl bleibt eine Behauptung des Anbieters.
Die API ist jetzt live. Moonshot gibt an, dass die vollständigen Gewichte bis zum 27. Juli eintreffen werden. Bis diese Dateien vorliegen, ist K3 ein angekündigtes Open-Weight-Modell, kein Modell, das Sie bereits herunterladen und auf Ihrer eigenen Infrastruktur verifizieren können.
Kimi K3 vs GPT-5.6 Sol vs Claude Fable 5
Der sauberste Vergleich kombiniert unabhängige Tests mit offiziellen Produktspezifikationen. Die ersten vier Zeilen unten stammen von Artificial Analysis und Arena; Kontext und Preise stammen aus der Dokumentation der jeweiligen Anbieter.
| Maßnahme | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| Artificial Analysis Intelligence Index | 57 | 59 | 60 |
| GDPval-AA v2 | 1.668 Elo | 1.748 Elo | 1.760 Elo |
| AA-Briefcase Wissensarbeit | 1.547 Elo | 1.495 Elo | 1.583 Elo |
| Frontend Code Arena | 1.679 Elo | 1.618 Elo | 1.631 Elo |
| Kontextfenster | 1M Token | 1,05M Token | 1M Token |
| API Input/Output pro 1M Token | 3 $ / 15 $ | 5 $ / 30 $ | 10 $ / 50 $ |
| Gewichte | Angekündigt für 27. Juli | Geschlossen | Geschlossen |

*Quelle: Artificial Analysis, 17. Juli 2026. Der v4.1-Index kombiniert neun Evaluierungen für Coding, Reasoning, Wissen und Agentic-Fähigkeiten.*
Der Zwei-Punkte-Abstand zwischen K3 und Sol ist klein genug, um weniger ins Gewicht zu fallen als die Qualität des Harness, die Latenz, der Token-Verbrauch und die Fehlerbehebung. Der Drei-Punkte-Abstand zu Fable 5 ist jedoch real. K3 hat die Spitzengruppe erreicht; es hat die Gruppe nicht gewonnen.
Wo gewinnt Kimi K3?
Frontend-Coding und visuelle Iteration
Das stärkste unabhängige Ergebnis von K3 ist die Frontend Code Arena. Menschliche Evaluatoren vergleichen anonyme, ausführbare Frontend-Ausgaben und stimmen für das bessere Ergebnis. K3 erreichte 1.679 Elo, 48 Punkte über Fable 5 und 61 über Sol. Arena platzierte es auch in sechs von sieben Frontend-Kategorien auf den ersten Platz.
Dieses Ergebnis ist für Teams relevant, die Landing Pages, Dashboards, Design-Rekreationen und visuelle Tools erstellen. Es misst die Präferenz für funktionierende Ausgaben, nicht nur, ob ein Unit-Test besteht.
Moonshots breitere Coding-Tabelle ist gemischt. K3 führt Program Bench mit 77,8 und SWE Marathon mit 42,0 an. Sol führt DeepSWE mit 73,0 und Terminal-Bench 2.1 mit 88,8 an. Fable 5 führt FrontierSWE mit 86,6 und Moonshots internen Kimi Code Bench-Vergleich mit 76,9 an.

*Quelle: Moonshot AIs Kimi K3 Launch-Post. Dies sind vom Anbieter zusammengestellte Ergebnisse, und die Modelle verwenden manchmal unterschiedliche Agent-Harnesses.*
Die Wahl des Harness ändert die Punktzahl. K3 läuft oft in Kimi Code, Sol in Codex und Fable in Claude Code. Ein Benchmark kann das Modell, den Harness oder die Interaktion zwischen beiden messen. Ich würde eine repräsentative Repository-Aufgabe in dem Tool erneut ausführen, das ich bereitstellen plane.
Automatisierung und Wissensarbeit
Artificial Analysis gibt K3 eine Punktzahl von 53 % und den ersten Platz auf AutomationBench-AA. Bei AA-Briefcase, einer privaten Evaluierung für langfristige Wissensarbeit, erzielt K3 1.547 Elo. Das schlägt Sols 1.495 und liegt hinter Fable 5s 1.583.
Moonshots Evaluierung platziert K3 auch knapp vorne bei BrowseComp und SpreadsheetBench 2. Fable führt GDPval-AA, JobBench und den breiten AA-Briefcase-Score an. Sol bleibt bei der Präsentationsqualität innerhalb der AA-Briefcase-Aufschlüsselung am stärksten.

*Quelle: Moonshot AI. Das Diagramm enthält unabhängige Scores, öffentliche Leaderboards und von Moonshot durchgeführte Tests; lesen Sie die Fußnoten, bevor Sie die Balken als ein kontrolliertes Experiment behandeln.*
K3 scheint nützlich für Research-Agents, Tabellenkalkulationsarbeit und Browser-Automatisierung zu sein. Fable bleibt die sicherere Wette, wenn die analytische Qualität wichtiger ist als der Preis. Sol passt zu Teams, die bereits Codex, die Responses API, gehostete Tools und programmatischen Tool-Calling verwenden.
Wo hinkt Kimi K3 noch hinterher?
Breites Reasoning und Expertenwissen
Fable 5 behält einen klaren Vorsprung bei Humanity's Last Exam. Moonshot berichtet von 53,3 für Fable, 44,5 für Sol und 43,5 für K3 ohne Tools. Mit Tools steigen die Scores auf 63, 58 und 56. Das ist eine größere Lücke, als der Gesamtindex vermuten lässt.
Sol erzielt die stärksten veröffentlichten Scores bei mehreren Tests zu Wissenschaft, Computernutzung und langem Kontext in OpenAIs Launch-Tabelle. Fable führt GDPval-AA und AA-Briefcase insgesamt an. K3 gewinnt ausgewählte Aufgaben, zeigt aber nicht die gleiche Konsistenz über alle Kategorien hinweg.
Wissenszuverlässigkeit
K3 verbesserte seine AA-Omniscience-Genauigkeit von 33 % auf 46 % im Vergleich zu K2.6. Seine Halluzinationsrate stieg ebenfalls von 39 % auf 51 %. Der kombinierte Omniscience-Score verbessert sich von 6 auf 18, weil K3 mehr Fragen korrekt beantwortet, doch der Rückschritt bei nicht unterstützten Antworten verdient Tests bei zitierintensiver Arbeit.

*Quelle: Artificial Analysis. Die Halluzinationsrate gehört zu AA-Omniscience und sollte nicht auf jeden Prompt-Typ verallgemeinert werden.*
Ich würde Quellenabruf, zitierte Beweise und deterministische Verifizierung verlangen, bevor ich eines dieser Modelle für faktische Veröffentlichungen verwende. Das Ergebnis von K3 ändert diese Regel nicht.
Ist Kimi K3 in der Praxis günstiger?
Die Listenpreise lassen K3 entscheidend aussehen:
Artificial Analysis schätzt 0,94 $ pro Intelligenz-Index-Aufgabe für K3, 1,04 $ für Sol und 2,75 $ für Fable 5. Der Token-Verbrauch von K3 verringert seinen Listenpreisvorteil gegenüber Sol bei dieser Workload auf zehn Cent. Fable kostet viel mehr, beendet aber auch den Gesamtindex und die schwierigsten Tests für Wissensarbeit als Erster.
Der Preis pro Token ist ein unvollständiges Budget. Die Produktionskosten umfassen Wiederholungen, Tool-Aufrufe, Review-Zeit, Latenz und die Arbeit, die erforderlich ist, um sich von einer falschen Antwort zu erholen. Ein Modell, das die Hälfte berechnet und doppelt so viele Reparatur-Schleifen benötigt, hat kein Geld gespart.
Warum mein Stack bei OpenAI und Anthropic bleibt
Ich verwende OpenAI und Anthropic bereits für Coding, Research und Agent-Workflows. K3 hat mir noch nicht genügend Beweise geliefert, um einen dritten Produktionsanbieter zu integrieren.
OpenAI bleibt mein Standard für agentic Coding, weil Sol den unabhängigen Coding Agent Index mit 80 Punkten anführt, sich in Codex und die Responses API integriert und die breiteste Tool-Oberfläche für meine Arbeit bietet. Mein Vergleich von GPT-5.6 Sol und Fable 5→ behandelt diese Routing-Entscheidung detaillierter.
Anthropic bleibt meine zweite Route für lange, schwierige Analysen und komplexe Codebase-Arbeiten. Fable 5 führt den Gesamt-Intelligenzindex, GDPval-AA, AA-Briefcase und Humanity's Last Exam an. Der Preis von 10 $/50 $ und die Anforderung einer 30-tägigen Datenaufbewahrung bedeuten, dass ich es für Arbeiten reservieren werde, bei denen der Qualitätsgewinn diese Einschränkungen rechtfertigt.
Mein Standard leitet sich aus dem Bauen von AI Agents, die tatsächlich funktionieren→, ab: abgeschlossene Aufgaben, beobachtete Tool-Fehler und Review-Kosten sind wichtiger als ein Schlagzeilen-Score.
K3 geht in eine Testspur mit drei Aufgaben:
Ich werde das Produktions-Routing überdenken, nachdem Moonshot die Gewichte und den technischen Bericht veröffentlicht hat, nachdem ich die endgültige Lizenz geprüft habe und nachdem K3 diese Tests bestanden hat. Teams mit schweren Frontend- oder Automatisierungs-Workloads könnten diesen Punkt früher erreichen.
Eine praktische Modellwahl
Wählen Sie Kimi K3 für eine kontrollierte Evaluierung, wenn Frontend-Qualität, Browser-Automatisierung oder niedrigere API-Listenpreise die Workload dominieren.
Wählen Sie GPT-5.6 Sol, wenn Sie eine ausgereifte Coding-Agent-Umgebung, breite Tool-Unterstützung, starke Präsentationsqualität und konsistente Ergebnisse über technische Aufgaben hinweg benötigen.
Wählen Sie Claude Fable 5, wenn die Aufgabe lang, mehrdeutig und analytisch schwierig genug ist, um die höheren Kosten und Datenaufbewahrungs-Einschränkungen zu rechtfertigen.
Meine Antwort heute lautet OpenAI plus Anthropic, mit K3 im Test. Moonshot hat sich diesen Test verdient. Es hat sich keine automatische Migration verdient.
Quellen und Methodik
Ich habe Moonshots Kimi K3 Launch-Post und API-Preise, Artificial Analysiss unabhängige K3-Evaluierung, Arenas blindes Frontend-Ranking, wie von AP berichtet, OpenAIs GPT-5.6 Release und Sol-Modell-Dokumentation sowie Anthropics Fable 5 Launch und Claude Fable 5 API-Guide geprüft.
Alle Scores und Preise sind aktuell zum Stand 18. Juli 2026. Modell-Anbieter können Preise, Routing, Sicherheitsvorkehrungen und Serververhalten ändern, ohne den Modellnamen zu ändern.
---