Kimi K3 vs GPT-5.6 Solは、私がルーティングテストを再実行するのに十分近いです。Moonshotのモデルは、私のスタックでOpenAIやAnthropicを置き換えるものではありません。
その結論は、発表の見出しほど劇的ではありませんが、数字がそれを裏付けています。Moonshot AIの新しいフラッグシップは、独立したインテリジェンスインデックスで3位にランクされ、盲目的なフロントエンドコーディングアリーナでリードし、1つの長期的な知識作業テストでGPT-5.6 Solを上回っています。また、Claude Fable 5やSolの広範な指標では依然として後れを取っており、そのダウンロード可能な重みはまだ将来の日時に約束されています。
2026年7月18日現在、私はKimi K3を生産作業に移行する理由ではなく、真剣な評価候補と見ています。私はまだK3を自分の生産ベンチマークにかけていないので、以下のルーティング決定から第三者の結果を分けています。
短い結論
結果は、異なるタスクで異なる勝者を持つ3モデルのレースです。単一のリーダーボードでは、どのモデルが最も少ないリトライで作業を完了するかを教えてくれません。
Kimi K3とは?
Moonshot AIはKimi K3を 7月16日に2.8兆パラメータのMixture-of-Expertsモデルとして発表しました。そのルーターは各トークンに対して896の専門家のうち16を選択します。K3はネイティブの画像入力、百万トークンのコンテキストウィンドウ、およびテキスト出力も備えています。
MoonshotはK2からの飛躍を2つのアーキテクチャの変更、Kimi Delta AttentionとAttention Residualsに帰しています。同社はK2よりも約2.5倍のスケーリング効率を報告していますが、技術報告はまだ公開されていません。その数字はベンダーの主張にとどまります。
APIは現在稼働中です。Moonshotは、完全な重みが7月27日までに到着すると述べています。そのファイルが到着するまで、K3は発表されたオープンウェイトモデルであり、すでに自分のインフラストラクチャでダウンロードして検証できるモデルではありません。
Kimi K3 vs GPT-5.6 Sol vs Claude Fable 5
最もクリーンな比較は、独立したテストと公式製品仕様を組み合わせます。以下の最初の4行は人工分析とArenaからのもので、コンテキストと価格は各プロバイダーのドキュメントからのものです。
| 測定基準 | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| 人工分析インテリジェンスインデックス | 57 | 59 | 60 |
| GDPval-AA v2 | 1,668 Elo | 1,748 Elo | 1,760 Elo |
| AA-Briefcase知識作業 | 1,547 Elo | 1,495 Elo | 1,583 Elo |
| フロントエンドコードアリーナ | 1,679 Elo | 1,618 Elo | 1,631 Elo |
| コンテキストウィンドウ | 1Mトークン | 1.05Mトークン | 1Mトークン |
| API入力/出力(百万トークンあたり) | $3 / $15 | $5 / $30 | $10 / $50 |
| 重み | 7月27日約束 | クローズド | クローズド |

*出典: 人工分析、2026年7月17日。そのv4.1インデックスは、9つのコーディング、推論、知識、およびエージェント評価を組み合わせています。*
K3とSolの間の2ポイントのギャップは、品質、レイテンシ、トークン使用、失敗回復の重要性を考えると、あまり重要ではありません。Fable 5との3ポイントのギャップは依然として現実です。K3は最前線グループに達しましたが、グループで勝利したわけではありません。
Kimi K3が勝つ場所は?
フロントエンドコーディングと視覚的反復
K3の最も強力な独立した結果はフロントエンドコードアリーナです。人間の評価者は匿名の実行可能なフロントエンド出力を比較し、より良い結果に投票します。K3は1,679 Eloに達し、Fable 5を48ポイント、Solを61ポイント上回りました。Arenaはまた、7つのフロントエンドカテゴリのうち6つでK3を1位に位置付けました。
その結果は、ランディングページ、ダッシュボード、デザイン再現、視覚ツールを構築しているチームにとって重要です。これは、単にユニットテストが合格するかどうかだけでなく、作業出力の好みを測定します。
Moonshotの広範なコーディングテーブルは混在しています。K3はProgram Benchで77.8、SWE Marathonで42.0でリードしています。SolはDeepSWEで73.0、Terminal-Bench 2.1で88.8でリードしています。Fable 5はFrontierSWEで86.6、Moonshotの内部Kimi Code Bench比較で76.9でリードしています。

*出典: Moonshot AIのKimi K3発表記事。これらはベンダーが集めた結果であり、モデルは時々異なるエージェントハーネスを使用します。*
ハーネスの選択がスコアを変えます。K3はしばしばKimi Codeで、SolはCodexで、FableはClaude Codeで実行されます。ベンチマークはモデル、ハーネス、または両者の相互作用を測定できます。私は、デプロイする予定のツール内で代表的なリポジトリタスクを再実行します。
自動化と知識作業
人工分析はK3に53%のスコアを与え、AutomationBench-AAで1位にしています。AA-Briefcaseでは、プライベートな長期知識作業評価でK3は1,547 Eloを記録しています。これはSolの1,495を上回り、Fable 5の1,583には及びません。
Moonshotの評価はまた、K3をBrowseCompとSpreadsheetBench 2でわずかにリードしています。FableはGDPval-AA、JobBench、広範なAA-Briefcaseスコアでリードしています。SolはAA-Briefcaseの内訳内でプレゼンテーション品質が最も強いままです。

*出典: Moonshot AI。このチャートには独立したスコア、公開リーダーボード、Moonshotが実施したテストが含まれています。バーを1つの制御実験として扱う前に脚注を読んでください。*
K3は研究エージェント、スプレッドシート作業、ブラウザ自動化に役立つようです。Fableは、分析品質が価格よりも重要な場合にはより安全な選択肢です。SolはすでにCodex、Responses API、ホスティングツール、およびプログラム的ツール呼び出しを使用しているチームに適しています。
Kimi K3がまだ遅れている場所は?
幅広い推論と専門知識
Fable 5はHumanity's Last Examで明確なリードを維持しています。MoonshotはFableが53.3、Solが44.5、K3が43.5(ツールなし)であると報告しています。ツールを使用すると、スコアは63、58、56に上昇します。これは、全体のインデックスが示唆するよりも大きなギャップです。
SolはOpenAIの発表テーブルで、いくつかの科学、コンピュータ使用、長いコンテキストテストで最も強力な公開スコアを記録しています。FableはGDPval-AAとAA-Briefcaseで全体的にリードしています。K3は選択されたタスクで勝利しますが、カテゴリ全体で同じ一貫性を示していません。
知識の信頼性
K3はK2.6と比較してAA-Omniscienceの精度を33%から46%に改善しました。その幻覚率も39%から51%に上昇しました。AA-Omniscienceスコアは6から18に改善され、K3はより多くの質問に正しく回答していますが、サポートされていない回答の回帰は引用が多い作業でのテストが必要です。

*出典: 人工分析。幻覚率はAA-Omniscienceに属し、すべてのプロンプトタイプに一般化すべきではありません。*
私は、事実を出版するためにこれらのモデルのいずれかを使用する前に、ソースの取得、引用された証拠、決定論的な検証を要求します。K3の結果はそのルールを変えません。
Kimi K3は実際に安いのか?
リスト価格はK3を決定的に見せます:
人工分析は、K3のインテリジェンスインデックスタスクあたり$0.94、Solが$1.04、Fable 5が$2.75と推定しています。K3のトークン使用は、そのワークロードにおいてSolに対するリスト価格の利点を10セントに狭めます。Fableははるかに高価ですが、全体のインデックスと最も難しい知識作業テストで1位を獲得しています。
トークンあたりの価格は不完全な予算です。生産コストには、リトライ、ツール呼び出し、レビュー時間、レイテンシ、および誤った回答から回復するために必要な作業が含まれます。半分の料金を請求し、修復ループが2倍必要なモデルは、コストを節約していません。
なぜ私のスタックはOpenAIとAnthropicのままなのか
私はすでにコーディング、研究、エージェントワークフローのためにOpenAIとAnthropicを使用しています。K3は、まだ私に第三の生産プロバイダーを吸収するのに十分な証拠を提供していません。
OpenAIは、エージェントコーディングのデフォルトとして残ります。なぜなら、Solは独立したコーディングエージェントインデックスで80でリードし、CodexとResponses APIと統合し、私の作業に最も広範なツールサーフェスを持っているからです。私のGPT-5.6 SolとFable 5の比較→は、そのルーティング決定をより詳細にカバーしています。
Anthropicは、長く難しい分析や複雑なコードベースの作業のための第二のルートとして残ります。Fable 5は全体のインテリジェンスインデックス、GDPval-AA、AA-Briefcase、Humanity's Last Examでリードしています。その$10/$50の価格と30日間のデータ保持要件は、品質の向上がそれらの制約をカバーする作業に予約することを意味します。
私の基準は、実際に機能するAIエージェントを構築すること→から来ています: 完了したタスク、観察されたツールの失敗、レビューコストは、見出しスコアよりも重要です。
K3は3つの仕事でテストレーンに入ります:
Moonshotが重みと技術報告をリリースし、最終ライセンスをレビューし、K3がそれらのテストを生き延びた後に生産ルーティングを再考します。フロントエンドや自動化のワークロードが重いチームは、そのポイントに早く到達するかもしれません。
実用的なモデル選択
フロントエンドの品質、ブラウザ自動化、または低いAPIリスト価格がワークロードを支配する場合は、Kimi K3を制御された評価のために選択してください。
成熟したコーディングエージェント環境、広範なツールサポート、強力なプレゼンテーション品質、技術タスク全体での一貫した結果が必要な場合は、GPT-5.6 Solを選択してください。
仕事が長く、あいまいで、分析的に難しい場合は、Claude Fable 5を選択してください。高いコストとデータ保持の制約を正当化するのに十分です。
私の答えは今日、OpenAIとAnthropicで、K3はテスト中です。Moonshotはそのテストを受けるに値します。それは自動的な移行を得ていません。
出典と方法論
私はMoonshotのKimi K3発表記事とAPI価格、人工分析の独立したK3評価、Arenaの盲目的なフロントエンドランキングをAPが報告したもの、OpenAIのGPT-5.6リリースとSolモデルドキュメント、さらにAnthropicのFable 5発表とClaude Fable 5 APIガイドを確認しました。
すべてのスコアと価格は2026年7月18日現在のものです。モデルプロバイダーは、モデル名を変更することなく、価格、ルーティング、セーフガード、および提供動作を変更できます。