Kimi K3 vs GPT-5.6 Sol est suffisamment serré pour que je relance mes tests de routage. Le modèle de Moonshot ne remplace toujours pas OpenAI ou Anthropic dans ma stack.
Cette conclusion est moins spectaculaire que les titres de lancement, mais les chiffres la soutiennent. Le nouveau modèle phare de Moonshot AI se classe troisième sur un indice d'intelligence indépendant, mène une arène de codage frontend en aveugle et bat GPT-5.6 Sol sur un test de travail intellectuel à long horizon. Il reste cependant en retrait par rapport à Claude Fable 5 et Sol sur les mesures les plus larges, et ses poids téléchargeables sont toujours promis pour une date future.
Au 18 juillet 2026, je considère Kimi K3 comme un candidat sérieux pour l'évaluation plutôt que comme une raison de migrer le travail de production. Je n'ai pas encore soumis K3 à mon propre benchmark de production, donc je sépare ci-dessous les résultats de tiers de ma décision de routage.
Le verdict rapide
Le résultat est une course à trois modèles avec différents vainqueurs selon la tâche. Un seul leaderboard ne peut pas vous dire quel modèle terminera votre travail avec le moins de nouvelles tentatives.
Qu'est-ce que Kimi K3 ?
Moonshot AI a présenté Kimi K3 le 16 juillet en tant que modèle Mixture-of-Experts de 2 800 milliards de paramètres. Son routeur sélectionne 16 experts sur 896 pour chaque token. K3 dispose également d'une entrée d'image native, d'une fenêtre de contexte d'un million de tokens et d'une sortie textuelle.
Moonshot attribue le saut de K2 à deux changements architecturaux : Kimi Delta Attention et Attention Residuals. L'entreprise rapporte une efficacité de mise à l'échelle environ 2,5 fois meilleure que K2, mais un rapport technique n'a pas encore été publié. Ce chiffre reste une affirmation du fournisseur.
L'API est maintenant en ligne. Moonshot indique que les poids complets arriveront d'ici le 27 juillet. En attendant l'arrivée de ces fichiers, K3 est un modèle open-weight annoncé, et non un modèle que vous pouvez déjà télécharger et vérifier sur votre propre infrastructure.
Kimi K3 vs GPT-5.6 Sol vs Claude Fable 5
La comparaison la plus propre combine des tests indépendants avec les spécifications officielles des produits. Les quatre premières lignes ci-dessous proviennent d'Artificial Analysis et d'Arena ; le contexte et les tarifs proviennent de la documentation de chaque fournisseur.
| Mesure | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| Artificial Analysis Intelligence Index | 57 | 59 | 60 |
| GDPval-AA v2 | 1 668 Elo | 1 748 Elo | 1 760 Elo |
| AA-Briefcase travail intellectuel | 1 547 Elo | 1 495 Elo | 1 583 Elo |
| Frontend Code Arena | 1 679 Elo | 1 618 Elo | 1 631 Elo |
| Fenêtre de contexte | 1M tokens | 1,05M tokens | 1M tokens |
| API entrée/sortie par 1M tokens | 3 $ / 15 $ | 5 $ / 30 $ | 10 $ / 50 $ |
| Poids | Promis le 27 juillet | Fermé | Fermé |

*Source : Artificial Analysis, 17 juillet 2026. Son indice v4.1 combine neuf évaluations de codage, de raisonnement, de connaissances et d'agents.*
L'écart de deux points entre K3 et Sol est suffisamment faible pour importer moins que la qualité du harness, la latence, l'utilisation des tokens et la récupération après échec. L'écart de trois points avec Fable 5 est bien réel. K3 a atteint le groupe de pointe ; il n'a pas gagné le groupe.
Où Kimi K3 gagne-t-il ?
Codage frontend et itération visuelle
Le résultat indépendant le plus fort de K3 est le Frontend Code Arena. Des évaluateurs humains comparent des sorties frontend anonymes et exécutables et votent pour le meilleur résultat. K3 a atteint 1 679 Elo, soit 48 points de plus que Fable 5 et 61 de plus que Sol. Arena l'a également classé premier dans six des sept catégories frontend.
Ce résultat importe aux équipes qui construisent des landing pages, des tableaux de bord, des recreations de design et des outils visuels. Il mesure la préférence pour un résultat fonctionnel, et non seulement si un test unitaire réussit.
Le tableau de codage plus large de Moonshot est mitigé. K3 mène Program Bench à 77,8 et SWE Marathon à 42,0. Sol mène DeepSWE à 73,0 et Terminal-Bench 2.1 à 88,8. Fable 5 mène FrontierSWE à 86,6 et la comparaison interne Kimi Code Bench de Moonshot à 76,9.

*Source : Post de lancement de Kimi K3 par Moonshot AI. Ce sont des résultats assemblés par le fournisseur, et les modèles utilisent parfois des harness d'agents différents.*
Le choix du harness change le score. K3 s'exécute souvent dans Kimi Code, Sol dans Codex, et Fable dans Claude Code. Un benchmark peut mesurer le modèle, le harness, ou l'interaction entre les deux. Je relancerais une tâche représentative de dépôt dans l'outil que je prévois de déployer.
Automatisation et travail intellectuel
Artificial Analysis donne à K3 un score de 53 % et la première place sur AutomationBench-AA. Sur AA-Briefcase, une évaluation privée de travail intellectuel à long horizon, K3 obtient 1 547 Elo. Cela bat les 1 495 de Sol et suit les 1 583 de Fable 5.
L'évaluation de Moonshot place également K3 légèrement en avance sur BrowseComp et SpreadsheetBench 2. Fable mène GDPval-AA, JobBench et le score global AA-Briefcase. Sol reste le plus fort sur la qualité de présentation dans la ventilation AA-Briefcase.

*Source : Moonshot AI. Le graphique inclut des scores indépendants, des leaderboards publics et des tests exécutés par Moonshot ; lisez ses notes de bas de page avant de traiter les barres comme une expérience contrôlée unique.*
K3 semble utile pour les agents de recherche, le travail sur tableurs et l'automatisation du navigateur. Fable reste le pari le plus sûr lorsque la qualité analytique importe plus que le prix. Sol convient aux équipes utilisant déjà Codex, l'API Responses, des outils hébergés et l'appel d'outils programmatique.
Où Kimi K3 est-il encore en retard ?
Raisonnement large et connaissances expertes
Fable 5 conserve une avance claire sur Humanity's Last Exam. Moonshot rapporte 53,3 pour Fable, 44,5 pour Sol et 43,5 pour K3 sans outils. Avec outils, les scores montent à 63, 58 et 56. C'est un écart plus grand que ce que suggère l'indice global.
Sol affiche les scores publiés les plus forts sur plusieurs tests de sciences, d'utilisation d'ordinateur et de contexte long dans le tableau de lancement d'OpenAI. Fable mène GDPval-AA et AA-Briefcase dans l'ensemble. K3 gagne des tâches sélectionnées, mais il ne montre pas la même cohérence à travers les catégories.
Fiabilité des connaissances
K3 a amélioré sa précision AA-Omniscience de 33 % à 46 % par rapport à K2.6. Son taux d'hallucination est également passé de 39 % à 51 %. Le score combiné Omniscience s'améliore de 6 à 18 car K3 répond correctement à plus de questions, mais la régression dans les réponses non étayées mérite d'être testée sur des travaux riches en citations.

*Source : Artificial Analysis. Le taux d'hallucination appartient à AA-Omniscience et ne doit pas être généralisé à chaque type de prompt.*
J'exigerais la récupération de sources, des preuves citées et une vérification déterministe avant d'utiliser l'un de ces modèles pour une publication factuelle. Le résultat de K3 ne change pas cette règle.
Kimi K3 est-il moins cher en pratique ?
Les prix de liste font paraître K3 décisif :
Artificial Analysis estime le coût à 0,94 $ par tâche d'indice d'intelligence pour K3, 1,04 $ pour Sol et 2,75 $ pour Fable 5. L'utilisation des tokens par K3 réduit son avantage de prix de liste sur Sol à dix cents sur cette charge de travail. Fable coûte beaucoup plus cher, mais il termine également premier sur l'indice global et les tests de travail intellectuel les plus difficiles.
Le prix par token est un budget incomplet. Le coût de production inclut les nouvelles tentatives, les appels d'outils, le temps de révision, la latence et le travail requis pour récupérer d'une mauvaise réponse. Un modèle qui facture moitié moins cher et nécessite deux fois plus de boucles de réparation n'a pas fait économiser d'argent.
Pourquoi ma stack reste OpenAI et Anthropic
J'utilise déjà OpenAI et Anthropic pour le codage, la recherche et les flux de travail d'agents. K3 ne m'a pas encore donné assez de preuves pour absorber un troisième fournisseur de production.
OpenAI reste ma valeur par défaut pour le codage agentique car Sol mène l'indice indépendant Coding Agent à 80, s'intègre avec Codex et l'API Responses, et dispose de la surface d'outils la plus large pour mon travail. Ma comparaison GPT-5.6 Sol et Fable 5→ couvre cette décision de routage plus en détail.
Anthropic reste ma deuxième voie pour les analyses longues et difficiles et le travail sur des bases de code complexes. Fable 5 mène l'indice d'intelligence global, GDPval-AA, AA-Briefcase et Humanity's Last Exam. Son prix de 10 $/50 $ et son exigence de rétention de données de 30 jours signifient que je le réserverai pour les travaux où le gain de qualité couvre ces contraintes.
Ma norme vient de la construction d'agents IA qui fonctionnent réellement→ : les tâches terminées, les échecs d'outils observés et le coût de révision importent plus qu'un score de titre.
K3 entre dans une voie de test avec trois missions :
Je reconsidérerai le routage de production après que Moonshot aura publié les poids et le rapport technique, après avoir examiné la licence finale, et après que K3 aura survécu à ces tests. Les équipes avec de lourdes charges de travail frontend ou d'automatisation pourraient atteindre ce point plus tôt.
Un choix de modèle pratique
Choisissez Kimi K3 pour une évaluation contrôlée lorsque la qualité frontend, l'automatisation du navigateur ou des prix de liste API plus bas dominent la charge de travail.
Choisissez GPT-5.6 Sol lorsque vous avez besoin d'un environnement d'agent de codage mature, d'un large support d'outils, d'une forte qualité de présentation et de résultats cohérents sur les tâches techniques.
Choisissez Claude Fable 5 lorsque le travail est long, ambigu et analytiquement assez difficile pour justifier le coût plus élevé et les contraintes de rétention de données.
Ma réponse aujourd'hui est OpenAI plus Anthropic, avec K3 en test. Moonshot a mérité ce test. Il n'a pas mérité une migration automatique.
Sources et méthodologie
J'ai vérifié le post de lancement de Kimi K3 et les tarifs API de Moonshot, l'évaluation indépendante de K3 d'Artificial Analysis, le classement frontend en aveugle d'Arena tel que rapporté par AP, la sortie de GPT-5.6 et la documentation du modèle Sol d'OpenAI, ainsi que le lancement de Fable 5 et le guide API de Claude Fable 5 d'Anthropic.
Tous les scores et prix sont à jour au 18 juillet 2026. Les fournisseurs de modèles peuvent modifier les tarifs, le routage, les sauvegardes et le comportement de service sans changer le nom du modèle.
---