Grok 4.5 vs GPT-5.6 Sol と Claude Fable 5: ベンチマークの判決
Tech
Grok 4.5
SpaceXAI
xAI
GPT-5.6 Sol

Grok 4.5 vs GPT-5.6 Sol と Claude Fable 5: ベンチマークの判決

Grok 4.5は低コストでフロンティアに到達します。GPT-5.6 SolとClaude Fable 5に勝る点を見てみましょう—そしてなぜ私は現在のスタックを維持しているのか。

Uygar DuzgunUUygar Duzgun
Jul 18, 2026
更新日 2026年7月23日
9 min read

Grok 4.5 vs GPT-5.6 Solは、このリリースサイクルでコストを別のプロバイダーを試す真剣な理由にする最初の比較です。それでも、私はOpenAIやAnthropicを置き換えることはありません。

SpaceXAIの最新モデルはフロンティアに到達し、迅速に動作し、入力トークン1百万あたり2ドル、出力トークン1百万あたり6ドルを請求します。独立したテストでは、これが主要なコーディングエージェントに近いことが示されています。同じテストでは、全体的な知性でSolに5ポイント、Claude Fable 5に6ポイント遅れています。

2026年7月18日現在、私のルートはOpenAIが第一、Anthropicが第二です。Grok 4.5はコーディングエージェント、自動化、高ボリュームのワークロードのための制御されたテストレーンに入ります。私はまだ生産環境で使用していないので、この比較は公開された測定値と私自身のルーティング決定を分けます。

短い判決

全体的な知性のベスト: Claude Fable 5は人工分析知性指数で60点を獲得。GPT-5.6 Solは59点、Grok 4.5は54点です。
コーディングエージェントのベスト結果: CodexでのSolは80点でリード。フォールバックを持つFable 5は77点、Grok 4.5はGrok Buildで76点です。
コストのベスト: Grok 4.5は人工分析知性指数タスクあたり0.31ドルで、Solは1.04ドル、Fable 5は2.75ドルです。
私の選択: OpenAIを主要なコーディングおよびエージェントプラットフォームとして維持し、最も難しい分析作業にはAnthropicを使用し、Grokの速度と低コストが経済性を変える可能性がある場合にテストします。

Grok 4.5には明確な役割があります。それはコスト効率の良いフロンティアモデルであり、新しい品質リーダーではありません。

Grok 4.5とは?

SpaceXAIはGrok 4.5を 7月8日にコーディング、エージェントタスク、知識作業のためのフラッグシップとしてリリースしました。同社はCursorと並行してトレーニングし、xAI API、Grok Build、およびCursorを通じて利用可能にしました。

このモデルはテキストと画像を受け入れ、テキストを返し、関数呼び出し、構造化出力、および設定可能な推論をサポートします。コンテキストウィンドウは500,000トークンです。公開された知識のカットオフは2026年2月1日であるため、現在の情報はxAIのウェブまたはX検索ツールを必要とします。

Grok Buildはオープンソースであり、チームがエージェントループ、コンテキストアセンブリ、ツールディスパッチ、フック、スキル、プラグイン、およびMCP統合を検査する方法を提供します。Grok 4.5モデル自体はプロプライエタリであり、SpaceXAIはその重みを公開していません。

Grok 4.5 vs GPT-5.6 Sol vs Claude Fable 5

広範な比較では、品質に関してAnthropicとOpenAIが優位であり、コストに関してGrokが優位です。これらの値は、独立した人工分析テストと各プロバイダーの現在のAPIドキュメントを組み合わせたものです。

測定Grok 4.5GPT-5.6 SolClaude Fable 5
------:---:---:
人工分析知性指数545960
コーディングエージェント指数Grok Buildで76Codexで80フォールバック付きのClaude Codeで77
知性指数タスクあたりのコスト$0.31$1.04$2.75
コンテキストウィンドウ500kトークン1.05Mトークン1Mトークン
API入力/出力あたりの1Mトークン$2 / $6$5 / $30$10 / $50
重みクローズドクローズドクローズド
Grok 4.5, GPT-5.6 Sol, Claude Fable 5 および他のフロンティアモデルの人工分析知性指数
Grok 4.5, GPT-5.6 Sol, Claude Fable 5 および他のフロンティアモデルの人工分析知性指数

*出典: 人工分析, 2026年7月17日。そのv4.1インデックスは、9つのエージェント、コーディング、推論、知識、および長いコンテキスト評価を組み合わせています。*

GrokとSolの間には5ポイント、Fableとの間には6ポイントの差があります。このギャップは難しいタスクで現れるには十分大きいですが、コスト、レイテンシ、ツールの信頼性が高ボリュームの作業で実際の結果を逆転させるには十分小さいです。

Grok 4.5が得意なところは?

コーディングエージェントとターミナル作業

Grok 4.5は人工分析コーディングエージェント指数でGrok Buildで76点を獲得しています。SolはCodexで80点でリードしています。Fable 5はClaude Codeで77点を獲得していますが、その構成はOpus 4.8にフォールバックすることができます。

GrokとテストされたFable構成の間には1ポイントの差があります。Solとの間には4ポイントの差があります。これは、エージェントが数百のツール呼び出しを実行し、出力トークンコストが累積する場合に、リポジトリレベルの試験を正当化するには十分近いです。

Grok 4.5 in Grok BuildとGPT-5.6 Sol in Codex、Claude Fable 5 in Claude Codeのコーディングエージェント指数の比較
Grok 4.5 in Grok BuildとGPT-5.6 Sol in Codex、Claude Fable 5 in Claude Codeのコーディングエージェント指数の比較

*出典: 人工分析。インデックスはDeepSWE、Terminal-Bench v2、およびSWE-Atlas-QnAの平均です。ハーネスが異なるため、チャートはモデルエージェントの組み合わせを測定します。*

SpaceXAIのローンチテーブルは、似たようなが、より古いストーリーを語っています。GrokはSWEマラソンで29.0%でリードし、Terminal-Bench 2.1で83.3%、SWE-Bench Proで64.7%を達成しています。Fable 5は示された5つのコーディングテストのうち4つでリードしています。SpaceXAIはGrokをGPT-5.5と比較したため、直接的なSolの判決のためにそのベンダーテーブルを使用することはありません。

速度とトークン効率

人工分析はGrok 4.5を約112出力トークン/秒で測定しました。SpaceXAIは80トークン/秒を報告し、このモデルは解決されたSWE-Bench Proタスクあたり15,954出力トークンを使用したと言っています。これはClaude Opus 4.8の比較で4.2倍少ないです。

これらの数値は異なるテストセットアップを説明していますが、同じ方向を指しています: Grokは出力を少なくしてエージェント作業を完了するように設計されています。この節約は、コーディングエージェントがファイルを読み込み、コマンドを実行し、障害を修復し、ループを繰り返すときに重要です。

Grok 4.5はコストの勝者か?

200,000トークン未満のプロンプトに対して、xAIは入力トークン1百万あたり2ドル、キャッシュされた入力に対して0.50ドル、出力に対して6ドルを請求します。プロンプトが200,000トークンを超えると、料金は全体のリクエストでそれぞれ4ドル、1ドル、12ドルに倍増します。

短いコンテキストのリスト価格は、入力でSolより60%低く、出力で80%低いです。Fable 5は入力で5倍、出力で8倍以上のコストがかかります。

人工分析チャート、モデル知性とベンチマークタスクあたりのコストを比較、Grok 4.5、GPT-5.6 Sol、Claude Fable 5を含む
人工分析チャート、モデル知性とベンチマークタスクあたりのコストを比較、Grok 4.5、GPT-5.6 Sol、Claude Fable 5を含む

*出典: 人工分析。タスクあたりのコストは、各モデルが使用したトークンを含み、価格カードのみを比較するのではありません。*

独立したタスクコストは価格カードよりも有用です: Grokは0.31ドル、Solは1.04ドル、Fableは2.75ドルです。GrokはSolに対して5ポイントの知性を放棄しながら、そのテストコストを約70%削減します。

生産コストには、失敗したツール呼び出し、繰り返しのパッチ、レビュー時間、回帰も含まれます。結果を修正するためにシニア開発者が必要な安価な実行は、高価なクリーン実行よりもコストがかかる可能性があります。

Grok 4.5が劣るところは?

全体的な品質と長いコンテキスト

SolとFableは広範な独立したインデックスでリードしています。両者はGrokの約2倍のコンテキストウィンドウも提供しています。その違いは、大規模なリポジトリ、長い研究パケット、および有用な証拠を失うことなく履歴を圧縮できないエージェントセッションに影響を与えます。

Grokのローンチベンチマークはギャップを強化します。FableはSpaceXAIの独自のチャートでDeepSWE 1.0、DeepSWE 1.1、Terminal-Bench 2.1、およびSWE-Bench Proでリードしています。GrokはSWEマラソンで勝利していますが、1回の勝利では一貫したリーダーシップを確立することはできません。

知識の信頼性

Grok 4.5はAA-Omniscienceの精度をGrok 4.3の35%から52%に改善しました。その幻覚率は25%から54%に上昇しました。結合されたOmniscienceスコアは18から26に増加しましたが、Grokはより多くの質問に正しく回答した一方で、拒否する代わりにより多くの根拠のない回答を提供しました。

Grok 4.5の知識精度、幻覚率、AA-Omniscienceスコアを主要なAIモデルと比較
Grok 4.5の知識精度、幻覚率、AA-Omniscienceスコアを主要なAIモデルと比較

*出典: 人工分析のGrok 4.5評価。幻覚率はAA-Omniscienceに属し、すべてのプロンプトタイプに一般化すべきではありません。*

私はGrokで事実を公開するためには、リトリーバル、引用された証拠、外部検証を必要とします。同じルールはSolとFableにも適用されますが、Grokの精度と幻覚のシフトは専用のテストに値します。

Grok 4.5が私の現在のスタックをブロックする理由は?

このデプロイメントにはEU互換のアクセスが必要です。xAIのGrok 4.5ドキュメントは、APIコンソールアクセスがEUユーザーには利用できず、7月後半に期待されていると記載しています。それはすぐに変わるかもしれませんが、今日の安定した生産ルートをブロックしています。

xAIはデフォルトでAPIの入力と出力を30日間保存し、明示的な許可なしにそれらをトレーニングに使用しないと述べています。ゼロデータ保持は適格なチームに利用可能ですが、それを有効にすると、状態を持つResponses API機能、ファイルとコレクション、バッチAPIサポートが削除されます。生産試験には、コードや顧客資料がサービスに到達する前にデータ処理のレビューが必要です。

おすすめ

OpenAIは私のデフォルトのままであり、Solは現在のコーディングエージェントインデックスでリードし、1.05百万トークンのコンテキストウィンドウを持ち、私がすでに使用しているCodexおよびResponses APIワークフローに適合しています。私のGPT-5.6 SolとFable 5の比較はそのルートをより詳細に説明しています。

Anthropicは、Fableの品質リードがその高い価格をカバーできる長くあいまいな分析のための第二のルートとして残ります。Grokは、トークン価格だけでなく、完了したタスクコストでこれらのルートの1つを上回る必要があります。

おすすめ

私の基準は、実際に機能するAIエージェントを構築することから来ています: 完了した作業、ツールの失敗、レビュー時間、悪いアクションの後の回復を測定します。

Grok 4.5をテストする方法

Grok Build、Codex、Claude Codeで同じリポジトリの問題を実行します。受け入れられた変更、トークン、コマンド、失敗したテスト、レビュー時間を記録します。
各モデルに対して対立するソースを持つ長い研究パケットを与えます。引用のカバレッジ、根拠のない主張、フィードバック後の修正を測定します。
ブラウザとスプレッドシートのワークフローを10回繰り返します。最良の単一実行ではなく、完了率、レイテンシ、および総APIコストを比較します。

EUアクセスが開放され、Grokがこれらのテストを通過した後にルーティングを再考します。それまでの間、Grok 4.5は生産依存関係ではなく、ベンチマークに値する候補です。

実用的なモデルの選択

高ボリュームのエージェント作業、迅速な出力、完了したタスクあたりのコストが決定を支配する場合は、Grok 4.5を選択してください—そしてその500,000トークンのコンテキストと地域の可用性があなたのデプロイメントに適しているとき。

最も強力な現在のコーディングエージェントの結果、成熟したツールの表面、およびOpenAIエコシステム内のより大きなコンテキストウィンドウを望む場合は、GPT-5.6 Solを選択してください。

分析的に難しいタスクで最高のトークン価格を正当化し、広範な知性ベンチマークでのリードを重視する場合は、Claude Fable 5を選択してください。

私のルートはOpenAIとAnthropicの組み合わせであり、Grokはテスト中です。Grok 4.5はそのテストを経済的に興味深いものにします。公開された結果は、まだ移行を正当化するものではありません。

出典と方法論

私はSpaceXAIのGrok 4.5発表モデルドキュメントライブ価格表セキュリティFAQ、およびGrok Buildオープンソース発表を確認しました。独立した結果は、人工分析のGrok 4.5評価とその7月17日のフロンティア比較から得られました。私はOpenAIのGPT-5.6 SolとAnthropicのClaude Fable 5ドキュメントを競合する仕様と価格のために使用しました。

スコア、価格、アクセスノート、および製品の動作は2026年7月18日現在のものです。プロバイダーは、記事を変更することなく、提供動作、価格、地域アクセス、およびモデルの別名を変更することができます。