Kimi K3 vs GPT-5.6 Sol et Claude Fable 5 : Verdict des benchmarks
Tech
Kimi K3
Moonshot AI
GPT-5.6 Sol
Claude Fable 5

Kimi K3 vs GPT-5.6 Sol et Claude Fable 5 : Verdict des benchmarks

Kimi K3 atteint le niveau de pointe et remporte des tests de codage clés. Mon verdict basé sur les benchmarks : testez-le, mais gardez OpenAI et Anthropic en production.

Uygar DuzgunUUygar Duzgun
Jul 18, 2026
Mis à jour 22 juil. 2026
9 min read

Kimi K3 vs GPT-5.6 Sol est suffisamment serré pour que je relance mes tests de routage. Le modèle de Moonshot ne remplace toujours pas OpenAI ou Anthropic dans ma stack.

Cette conclusion est moins spectaculaire que les titres de lancement, mais les chiffres la soutiennent. Le nouveau modèle phare de Moonshot AI se classe troisième sur un indice d'intelligence indépendant, mène une arène de codage frontend en aveugle et bat GPT-5.6 Sol sur un test de travail intellectuel à long horizon. Il reste cependant en retrait par rapport à Claude Fable 5 et Sol sur les mesures les plus larges, et ses poids téléchargeables sont toujours promis pour une date future.

Au 18 juillet 2026, je considère Kimi K3 comme un candidat sérieux pour l'évaluation plutôt que comme une raison de migrer le travail de production. Je n'ai pas encore soumis K3 à mon propre benchmark de production, donc je sépare ci-dessous les résultats de tiers de ma décision de routage.

Le verdict rapide

Meilleur score global : Claude Fable 5 mène l'Artificial Analysis Intelligence Index avec 60. GPT-5.6 Sol obtient 59 et Kimi K3 obtient 57.
Meilleur résultat frontend en aveugle : Kimi K3 mène le classement Frontend Code d'Arena avec 1 679 Elo, devant Fable 5 à 1 631 et Sol à 1 618.
Meilleur prix API : K3 coûte 3 $ par million de tokens d'entrée et 15 $ par million de tokens de sortie. Sol coûte 5 $/30 $, tandis que Fable 5 coûte 10 $/50 $.
Mon choix : Je garderai OpenAI comme plateforme principale de codage et d'agents, avec Anthropic pour les analyses les plus difficiles à long horizon. Je testerai K3 sur des charges de travail frontend, d'automatisation et de recherche avant de lui confier du trafic de production.

Le résultat est une course à trois modèles avec différents vainqueurs selon la tâche. Un seul leaderboard ne peut pas vous dire quel modèle terminera votre travail avec le moins de nouvelles tentatives.

Qu'est-ce que Kimi K3 ?

Moonshot AI a présenté Kimi K3 le 16 juillet en tant que modèle Mixture-of-Experts de 2 800 milliards de paramètres. Son routeur sélectionne 16 experts sur 896 pour chaque token. K3 dispose également d'une entrée d'image native, d'une fenêtre de contexte d'un million de tokens et d'une sortie textuelle.

Moonshot attribue le saut de K2 à deux changements architecturaux : Kimi Delta Attention et Attention Residuals. L'entreprise rapporte une efficacité de mise à l'échelle environ 2,5 fois meilleure que K2, mais un rapport technique n'a pas encore été publié. Ce chiffre reste une affirmation du fournisseur.

L'API est maintenant en ligne. Moonshot indique que les poids complets arriveront d'ici le 27 juillet. En attendant l'arrivée de ces fichiers, K3 est un modèle open-weight annoncé, et non un modèle que vous pouvez déjà télécharger et vérifier sur votre propre infrastructure.

Kimi K3 vs GPT-5.6 Sol vs Claude Fable 5

La comparaison la plus propre combine des tests indépendants avec les spécifications officielles des produits. Les quatre premières lignes ci-dessous proviennent d'Artificial Analysis et d'Arena ; le contexte et les tarifs proviennent de la documentation de chaque fournisseur.

MesureKimi K3GPT-5.6 SolClaude Fable 5
------:---:---:
Artificial Analysis Intelligence Index575960
GDPval-AA v21 668 Elo1 748 Elo1 760 Elo
AA-Briefcase travail intellectuel1 547 Elo1 495 Elo1 583 Elo
Frontend Code Arena1 679 Elo1 618 Elo1 631 Elo
Fenêtre de contexte1M tokens1,05M tokens1M tokens
API entrée/sortie par 1M tokens3 $ / 15 $5 $ / 30 $10 $ / 50 $
PoidsPromis le 27 juilletFerméFermé
Artificial Analysis Intelligence Index comparant Kimi K3, Claude Fable 5, GPT-5.6 Sol et d'autres modèles
Artificial Analysis Intelligence Index comparant Kimi K3, Claude Fable 5, GPT-5.6 Sol et d'autres modèles

*Source : Artificial Analysis, 17 juillet 2026. Son indice v4.1 combine neuf évaluations de codage, de raisonnement, de connaissances et d'agents.*

L'écart de deux points entre K3 et Sol est suffisamment faible pour importer moins que la qualité du harness, la latence, l'utilisation des tokens et la récupération après échec. L'écart de trois points avec Fable 5 est bien réel. K3 a atteint le groupe de pointe ; il n'a pas gagné le groupe.

Où Kimi K3 gagne-t-il ?

Codage frontend et itération visuelle

Le résultat indépendant le plus fort de K3 est le Frontend Code Arena. Des évaluateurs humains comparent des sorties frontend anonymes et exécutables et votent pour le meilleur résultat. K3 a atteint 1 679 Elo, soit 48 points de plus que Fable 5 et 61 de plus que Sol. Arena l'a également classé premier dans six des sept catégories frontend.

Ce résultat importe aux équipes qui construisent des landing pages, des tableaux de bord, des recreations de design et des outils visuels. Il mesure la préférence pour un résultat fonctionnel, et non seulement si un test unitaire réussit.

Le tableau de codage plus large de Moonshot est mitigé. K3 mène Program Bench à 77,8 et SWE Marathon à 42,0. Sol mène DeepSWE à 73,0 et Terminal-Bench 2.1 à 88,8. Fable 5 mène FrontierSWE à 86,6 et la comparaison interne Kimi Code Bench de Moonshot à 76,9.

Comparaison des benchmarks de codage de Moonshot AI pour Kimi K3, GPT-5.6 Sol, Claude Fable 5 et d'autres modèles
Comparaison des benchmarks de codage de Moonshot AI pour Kimi K3, GPT-5.6 Sol, Claude Fable 5 et d'autres modèles

*Source : Post de lancement de Kimi K3 par Moonshot AI. Ce sont des résultats assemblés par le fournisseur, et les modèles utilisent parfois des harness d'agents différents.*

Le choix du harness change le score. K3 s'exécute souvent dans Kimi Code, Sol dans Codex, et Fable dans Claude Code. Un benchmark peut mesurer le modèle, le harness, ou l'interaction entre les deux. Je relancerais une tâche représentative de dépôt dans l'outil que je prévois de déployer.

Automatisation et travail intellectuel

Artificial Analysis donne à K3 un score de 53 % et la première place sur AutomationBench-AA. Sur AA-Briefcase, une évaluation privée de travail intellectuel à long horizon, K3 obtient 1 547 Elo. Cela bat les 1 495 de Sol et suit les 1 583 de Fable 5.

L'évaluation de Moonshot place également K3 légèrement en avance sur BrowseComp et SpreadsheetBench 2. Fable mène GDPval-AA, JobBench et le score global AA-Briefcase. Sol reste le plus fort sur la qualité de présentation dans la ventilation AA-Briefcase.

Comparaison des benchmarks d'agents et de vision de Moonshot AI pour Kimi K3, GPT-5.6 Sol et Claude Fable 5
Comparaison des benchmarks d'agents et de vision de Moonshot AI pour Kimi K3, GPT-5.6 Sol et Claude Fable 5

*Source : Moonshot AI. Le graphique inclut des scores indépendants, des leaderboards publics et des tests exécutés par Moonshot ; lisez ses notes de bas de page avant de traiter les barres comme une expérience contrôlée unique.*

K3 semble utile pour les agents de recherche, le travail sur tableurs et l'automatisation du navigateur. Fable reste le pari le plus sûr lorsque la qualité analytique importe plus que le prix. Sol convient aux équipes utilisant déjà Codex, l'API Responses, des outils hébergés et l'appel d'outils programmatique.

Où Kimi K3 est-il encore en retard ?

Raisonnement large et connaissances expertes

Fable 5 conserve une avance claire sur Humanity's Last Exam. Moonshot rapporte 53,3 pour Fable, 44,5 pour Sol et 43,5 pour K3 sans outils. Avec outils, les scores montent à 63, 58 et 56. C'est un écart plus grand que ce que suggère l'indice global.

Sol affiche les scores publiés les plus forts sur plusieurs tests de sciences, d'utilisation d'ordinateur et de contexte long dans le tableau de lancement d'OpenAI. Fable mène GDPval-AA et AA-Briefcase dans l'ensemble. K3 gagne des tâches sélectionnées, mais il ne montre pas la même cohérence à travers les catégories.

Fiabilité des connaissances

K3 a amélioré sa précision AA-Omniscience de 33 % à 46 % par rapport à K2.6. Son taux d'hallucination est également passé de 39 % à 51 %. Le score combiné Omniscience s'améliore de 6 à 18 car K3 répond correctement à plus de questions, mais la régression dans les réponses non étayées mérite d'être testée sur des travaux riches en citations.

Tests de précision des connaissances et d'hallucination d'Artificial Analysis pour Kimi K3 et les principaux modèles d'IA
Tests de précision des connaissances et d'hallucination d'Artificial Analysis pour Kimi K3 et les principaux modèles d'IA

*Source : Artificial Analysis. Le taux d'hallucination appartient à AA-Omniscience et ne doit pas être généralisé à chaque type de prompt.*

J'exigerais la récupération de sources, des preuves citées et une vérification déterministe avant d'utiliser l'un de ces modèles pour une publication factuelle. Le résultat de K3 ne change pas cette règle.

Kimi K3 est-il moins cher en pratique ?

Les prix de liste font paraître K3 décisif :

Kimi K3 : 3 $ d'entrée, 15 $ de sortie et 0,30 $ d'entrée mise en cache par million de tokens.
GPT-5.6 Sol : 5 $ d'entrée, 30 $ de sortie et 0,50 $ d'entrée mise en cache.
Claude Fable 5 : 10 $ d'entrée et 50 $ de sortie, avec une réduction de 90 % sur le cache de prompt.

Artificial Analysis estime le coût à 0,94 $ par tâche d'indice d'intelligence pour K3, 1,04 $ pour Sol et 2,75 $ pour Fable 5. L'utilisation des tokens par K3 réduit son avantage de prix de liste sur Sol à dix cents sur cette charge de travail. Fable coûte beaucoup plus cher, mais il termine également premier sur l'indice global et les tests de travail intellectuel les plus difficiles.

Le prix par token est un budget incomplet. Le coût de production inclut les nouvelles tentatives, les appels d'outils, le temps de révision, la latence et le travail requis pour récupérer d'une mauvaise réponse. Un modèle qui facture moitié moins cher et nécessite deux fois plus de boucles de réparation n'a pas fait économiser d'argent.

Pourquoi ma stack reste OpenAI et Anthropic

J'utilise déjà OpenAI et Anthropic pour le codage, la recherche et les flux de travail d'agents. K3 ne m'a pas encore donné assez de preuves pour absorber un troisième fournisseur de production.

Recommandé pour vous

OpenAI reste ma valeur par défaut pour le codage agentique car Sol mène l'indice indépendant Coding Agent à 80, s'intègre avec Codex et l'API Responses, et dispose de la surface d'outils la plus large pour mon travail. Ma comparaison GPT-5.6 Sol et Fable 5 couvre cette décision de routage plus en détail.

Anthropic reste ma deuxième voie pour les analyses longues et difficiles et le travail sur des bases de code complexes. Fable 5 mène l'indice d'intelligence global, GDPval-AA, AA-Briefcase et Humanity's Last Exam. Son prix de 10 $/50 $ et son exigence de rétention de données de 30 jours signifient que je le réserverai pour les travaux où le gain de qualité couvre ces contraintes.

Recommandé pour vous

Ma norme vient de la construction d'agents IA qui fonctionnent réellement : les tâches terminées, les échecs d'outils observés et le coût de révision importent plus qu'un score de titre.

K3 entre dans une voie de test avec trois missions :

Reconstruire un frontend réel à partir d'une image de référence et comparer les défauts visuels après une et trois itérations.
Exécuter la même tâche de dépôt dans Kimi Code, Codex et Claude Code, puis compter les changements acceptés, les tokens, les échecs d'outils et le temps de révision.
Donner à chaque modèle le même brief de recherche et noter les affirmations non étayées, la couverture des citations et les corrections après feedback.

Je reconsidérerai le routage de production après que Moonshot aura publié les poids et le rapport technique, après avoir examiné la licence finale, et après que K3 aura survécu à ces tests. Les équipes avec de lourdes charges de travail frontend ou d'automatisation pourraient atteindre ce point plus tôt.

Un choix de modèle pratique

Choisissez Kimi K3 pour une évaluation contrôlée lorsque la qualité frontend, l'automatisation du navigateur ou des prix de liste API plus bas dominent la charge de travail.

Choisissez GPT-5.6 Sol lorsque vous avez besoin d'un environnement d'agent de codage mature, d'un large support d'outils, d'une forte qualité de présentation et de résultats cohérents sur les tâches techniques.

Choisissez Claude Fable 5 lorsque le travail est long, ambigu et analytiquement assez difficile pour justifier le coût plus élevé et les contraintes de rétention de données.

Ma réponse aujourd'hui est OpenAI plus Anthropic, avec K3 en test. Moonshot a mérité ce test. Il n'a pas mérité une migration automatique.

Sources et méthodologie

J'ai vérifié le post de lancement de Kimi K3 et les tarifs API de Moonshot, l'évaluation indépendante de K3 d'Artificial Analysis, le classement frontend en aveugle d'Arena tel que rapporté par AP, la sortie de GPT-5.6 et la documentation du modèle Sol d'OpenAI, ainsi que le lancement de Fable 5 et le guide API de Claude Fable 5 d'Anthropic.

Tous les scores et prix sont à jour au 18 juillet 2026. Les fournisseurs de modèles peuvent modifier les tarifs, le routage, les sauvegardes et le comportement de service sans changer le nom du modèle.

---