AI推論トークンは、現代のAIパフォーマンスの最も重要な部分の一つになりつつあります。
OpenAIとAnthropicは、以前よりもトレードオフをより明確に示しています。OpenAIには`reasoning.effort`があります。Anthropicは拡張思考と`budget_tokens`を持っています。これらの制御は同じパターンを指し示しています: 難しいタスクでは、より良い結果はしばしばモデルに考える余地を与えることから得られます。
これはコーディング、研究、計画、数学、エージェントのワークフローに役立ちます。また、AI業界がより多くの作業を推論時間に移行していることも意味します。より多くの推論トークンは、より多くのアクセラレーター時間、より多くの冷却、より多くのデータセンターの容量、そしてより多くの電力を意味します。
私の見解はシンプルです: モデル競争はインフラ競争になりつつあります。
AI推論トークンとは?
AI推論トークンは、モデルが最終的な回答の前または同時に問題を解決するために使うトークンです。その作業の一部はユーザーからは隠れているかもしれません。推論テキストが常に見えるわけではありませんが、プロバイダーは依然として計算を実行する必要があります。
OpenAIの推論ドキュメントによれば、`reasoning.effort`はモデルがどれだけの推論を行うかを制御します。低い努力は速度とトークンの削減を優先します。高い努力は複雑なタスクに対してより完全な回答を生成することができます。OpenAIはまた、推論モデルが入力トークンや可視出力トークンに加えて隠れた推論トークンを使用できることを説明しています。
Anthropicは、Claudeの拡張思考で同じクラスのトレードオフを説明しています。そのドキュメントによれば、`budget_tokens`はClaudeが内部推論に使用できるトークンの最大数を設定します。より大きな予算は複雑な問題に対する応答の質を向上させることができますが、モデルは必ずしも全予算を使うわけではなく、高い範囲では利得が平坦化することがあります。
重要な区別はこれです: より長い最終回答が目標ではありません。より良い中間推論が目標です。
なぜより多くのトークンがより良いAI結果を生むのか
推論モデルは、タスクを検査し、可能な回答をテストし、間違いを修正し、急がずにツールを使用するための十分な予算があると改善します。小さなトークン予算は単純なプロンプトには機能しますが、作業に隠れた依存関係がある場合にはしばしば失敗します。
私はこれをコーディングエージェントで最も明確に見ます。安価なファストパスは変数の名前を変更したり、小さな関数を説明したりできます。同じモードは、タスクがリポジトリのコンテキスト、テスト、ブラウザの検証、デプロイメントの制約、何に触れないべきかの判断を必要とする場合には苦労します。
モデルは、退屈な部分をうまく行うための予算が必要です:
そのワークフローはトークンを消費します。また、迅速な推測よりも良いソフトウェアを生み出します。
私は21.54億トークン後のコードエージェント→で自分の使用からこれについて書きました。役立つ教訓は、1つのモデルがすべてを修正するわけではないということでした。モデルの周りのシステムが重要です: コンテキスト、ツール、検証、メモリ、そしてエージェントがそれらを使用するための十分な予算です。
OpenAIとAnthropicは計算を製品設定に変えている
新しいモデル制御は、知性を調整可能に感じさせます。
プロバイダーは、同じモデルファミリーから異なる動作を提供できるようになりました: 迅速な回答、バランスの取れた回答、深い推論、長いコンテキストのエージェント作業、または高い努力のツール使用。ユーザーは内部トークン数を気にしないかもしれませんが、製品はそれに対して支払う必要があります。
ビルダーにとって、これはルーティングを変えます。すべてのリクエストで最大の推論を望んではいけません。
| タスクタイプ | より良いデフォルト |
|---|---|
| --- | --- |
| フォーマット、抽出、短いリライト | 低い推論努力 |
| 通常の研究、コード編集、サポート分析 | 中程度の推論努力 |
| プロダクションコードの変更、法的レビュー、財務論理 | 高い推論努力 |
| ツールと検証を伴うマルチステップエージェント | 拡張思考またはより大きな推論予算 |
ここがOpenAIとAnthropicが収束しているところです。彼らは異なるAPIと製品言語を公開していますが、どちらもビルダーに知性が固定された設定ではないことを教えています。それは予算の決定です。
それはまた、OpenAI GPT-5.6 Sol, Terra, and Luna→や24h with Claude Fable 5→のような作品でのモデルルーティングについて私が考える方法でもあります。最良のモデルは常に最大のモデルではありません。最良のルートは、タスクに合ったものです。
推論トークンの背後にあるインフラ問題
すべての追加の推論トークンは、どこかで実行されなければなりません。
国際エネルギー機関は、データセンターが2024年に約415 TWhの電力を使用し、世界の電力消費の約1.5%を占めると推定しています。基本ケースでは、2030年までに世界のデータセンターの電力消費は約945 TWhにほぼ倍増します。IEAはまた、AI駆動の加速サーバーが将来の需要の主要なドライバーの一つであることを指摘しています。
タイミングが難しい部分です。AI企業はモデルのアップデートを迅速に出荷したり、コンテキスト制限を増やしたり、新しい推論モードを追加したりできます。発電、送電線、変電所、冷却システム、土地の許可、水の計画は異なる速度で進みます。
Gartnerの2026年の予測は、Tom's Hardwareによって報告され、別の有用な信号を提供します。2026年の世界のデータセンターの電力使用量は565 TWh、2030年には1,200 TWhを超えると予測しています。また、AI最適化サーバーは2026年に175 TWhを使用すると予測されており、2025年の約95 TWhから増加し、2027年までには従来のサーバーよりも多くの電力を消費するとされています。
これらの数字は、トークンの物理的なストーリーを作ります。より多くの思考は、より多くの推論を意味します。より多くの推論は、より多くのGPU、より密なラック、冷却、グリッドアクセス、そして電力契約を意味します。
なぜデータセンターと電力が制約になるのか
公共のAIの会話はチップに焦点を当てています。チップは重要ですが、それが全体の制約ではありません。
大規模な推論モデルは、物理インフラのフルスタックを必要とします:
モデルは、ローカルグリッドが準備できる前に準備が整うことがあります。プロバイダーは、希望する密度でそれらに電力を供給できる前にGPUを購入できます。地域はデータセンター投資を引き寄せることができ、その後送電ボトルネックに直面することがあります。
だからこそ、私はAIのために多くの新しいデータセンターが建設されると予想しています。また、ハイパースケールAIクラスターが集中する地域では電力供給に対する圧力が高まると予想しています。制約はモデルアーキテクチャだけではありません。それは電力、冷却、場所、そしてすべてを十分に速く接続する能力です。
より多くの推論トークンは無料の知性ではない
このトレンドには罠があります。
チームが「より多くのトークンはより良い結果を意味する」と聞くと、高努力モードを過剰に使用することになります。それはアプリを遅くし、より高価にします。また、悪化したUXを生む可能性もあります。単純なタスクについて長く考えるモデルは壊れているように感じます。
実用的なルールは狭いです: より多くの推論予算は、タスクに十分な隠れた複雑さがあるときに役立ちます。
より大きな推論予算の良い候補:
悪い候補:
未来は、すべてのリクエストでできるだけ一生懸命考えるモデルではありません。未来は、考えることがコストに見合うときに考えることを決定するシステムです。
私の見解
AI推論トークンは隠れたトレードオフを可視化します。
OpenAIとAnthropicは、ユーザーに同じ基本的なパターンを示しています: 難しいタスクはより多くの推論時間の計算を必要とします。開発者はそれを推論努力、拡張思考、コンテキストウィンドウ、隠れたトークン、そして高い請求として体験します。インフラチームはそれをラック、冷却、電力、許可、そしてグリッド容量として体験します。
私は、次の真剣なAI製品が推論予算を希少な資源のように扱うと考えています。彼らは、間違いが高価で、検証が重要で、タスクに本当の計画が必要なところでそれを使います。彼らは単純なリクエストに無駄にすることを避けます。
より良いAIは、単により大きなモデルからは生まれません。より良い計算の割り当てから生まれます。
Sources:
