Claude Sonnet 5 登場:ベンチマーク、価格設定、そして初見の印象
Tech
Claude Sonnet 5
Anthropic
AI Models
Claude Code

Claude Sonnet 5 登場:ベンチマーク、価格設定、そして初見の印象

Claude Sonnet 5 が正式発表されました。ベンチマークでは、より安価な Sonnet モデルが Opus クラスのエージェント作業に近づいていることが示されていますが、重要な制限もあります。

Uygar DuzgunUUygar Duzgun
Jul 1, 2026
更新日 2026年7月4日
7 min read

Claude Sonnet 5 は、Fable 5 を巡る騒動の後に Anthropic がリリースすると私が予想していたモデルです。Mythos ほど劇的ではなく、小幅なアップグレードよりも実用的であり、明確に日常のエージェント作業をターゲットにしています。

Anthropic は 2026 年 6 月 30 日に Claude Sonnet 5 をリリースしました。見出しとなるニュースは、Sonnet が突然すべての Opus クラスのモデルを凌駕したというものではありません。そうではありません。本当に価値あるストーリーはコストパフォーマンスです。Sonnet 5 はエージェント作業において Opus 4.8 に大幅に近づきつつ、Sonnet の価格帯を維持しており、多くの Claude ユーザーにとって新しいデフォルトモデルとなります。

これは私が AI エージェントを使用する方法にとって重要です。私は一発勝負のチャット回答よりも、モデルがリポジトリを検査し、ツールを使用し、タスクに留まり、混乱を招くことなく作業を完了できるかどうかをより重視します。

ベンチマークのスナップショット

Anthropic のリリース表では、Sonnet 5 を Sonnet 4.6 および Opus 4.8 と比較しています。パターンは明確です。Sonnet 5 は Sonnet 4.6 から飛躍的な進歩を遂げていますが、最も困難なエージェントタスクの一部では依然として Opus 4.8 がリードしています。

Anthropic による Sonnet 5、Sonnet 4.6、Opus 4.8 を比較した Claude Sonnet 5 ベンチマーク表
Anthropic による Sonnet 5、Sonnet 4.6、Opus 4.8 を比較した Claude Sonnet 5 ベンチマーク表
ベンチマークSonnet 5Sonnet 4.6Opus 4.8
------:---:---:
SWE-bench Pro63.2%58.1%69.2%
Terminal-Bench 2.180.4%67.0%82.7%
Humanity's Last Exam(ツールなし)43.2%34.6%49.8%
Humanity's Last Exam(ツールあり)57.4%46.8%57.9%
OSWorld-Verified81.2%78.5%83.4%
GDPval-AA v2161813951615

最も強い信号は Terminal-Bench 2.1 です。Sonnet 5 は Sonnet 4.6 の 67.0% から 80.4% へとジャンプし、82.7% の Opus 4.8 に近づいています。これはコーディングエージェントにとって重要なギャップの縮小です。ターミナル作業は、計画を立てたり、回復したり、ツールを使用したりできないモデルを罰するからです。

SWE-bench Pro はより保守的です。Sonnet 5 は Sonnet 4.6 より改善されていますが、Opus 4.8 が依然として先行しています。私はこれを誇大宣伝への回答ではなく、調達に関する回答として捉えるべきでしょう。通常のエージェント実行には Sonnet 5 を使用し、追加の信頼性が価格に見合うケースでは Opus を維持するのです。

コストパフォーマンスこそが真のリリースストーリー

Anthropic はまた、努力レベルに応じた BrowseComp および OSWorld-Verified のコストパフォーマンスチャートも公開しました。これらは単一のトップラインスコアよりも有用です。Sonnet 5 により、チームには選択肢が生まれたからです。中程度の努力には少ない費用をかけ、タスクが必要であれば努力レベルを高くすることもできます。

BrowseComp における Claude Sonnet 5 のエージェント検索コストパフォーマンス曲線
BrowseComp における Claude Sonnet 5 のエージェント検索コストパフォーマンス曲線
OSWorld-Verified における Claude Sonnet 5 のエージェントコンピュータ使用コストパフォーマンス曲線
OSWorld-Verified における Claude Sonnet 5 のエージェントコンピュータ使用コストパフォーマンス曲線

これはまさに Sonnet クラスのモデルが勝利すべき領域です。Opus はより困難な推論のために存在しますが、ほとんどのワークフローでは、エージェントを繰り返し実行できる価格帯で十分な知能が必要です。デバッグ、ブラウザ QA、リポジトリ検査、コンテンツ運用、小規模な自動化タスクはすべて、途中で糸が切れることなく、より安価に実行できるモデルから恩恵を受けます。

Anthropic によると、Sonnet 5 は 2026 年 8 月 31 日まで、入力トークン 100 万あたり 2 ドル、出力トークン 100 万あたり 10 ドルという導入期の API 価格で利用可能です。その後、入力 3 ドル、出力 15 ドル(100 万トークンあたり)に移行します。この標準価格はトークンあたり Sonnet 4.6 と一致しますが、注意点があります。ドキュメントによると、Sonnet 5 は同じテキストに対して約 30% 多くのトークンを生成する新しいトークナイザーを使用するとのことです。

したがって、移行が自動的にコストニュートラルになるとは言えません。長期間実行されるエージェントを Sonnet 4.6 から Sonnet 5 に移行する前に、プロンプトを再計算すべきでしょう。

開発者にとっての変更点

モデル ID は `claude-sonnet-5` です。Anthropic はこれを Sonnet 4.6 からのドロップインアップグレードと説明していますが、ドキュメントには実際のアプリケーションで重要な動作変更点がリストされています。

第一に、adaptive thinking(適応的思考)がデフォルトで有効になっています。thinking フィールドを渡さない場合でも、Sonnet 5 は adaptive thinking で実行されます。無効にすることはできますが、デフォルトが変更されました。

第二に、手動による extended thinking(拡張思考)は廃止されました。古い `thinking: { type: "enabled", budget_tokens: N }` というパターンは 400 エラーを返します。Anthropic は開発者に対し、effort パラメータと共に adaptive thinking を使用することを求めています。

第三に、デフォルト以外のサンプリングパラメータは拒否されます。`temperature`、`top_p`、または `top_k` をデフォルト以外の値に設定したリクエストは 400 エラーを返します。ラッパーが自動的にサンプリングデフォルトを設定している場合、これは実際の移行問題となります。

良い点は、Sonnet 5 がデフォルトで 100 万トークンのコンテキストウィンドウをサポートし、最大 128k の出力トークンに対応していることです。リポジトリ規模の作業や長いコンテキストのワークフローにおいて、これによりエージェントは編集前に検査するためのより多くの余地を得られます。

安全性とサイバーベンチマーク

Anthropic は、Sonnet 4.6 と比較して、通常のエージェント使用において Sonnet 5 の方が安全であると位置づけています。リリース投稿によると、Sonnet 5 は Sonnet 4.6 よりも望ましくない動作の発生率が低く、エージェントコンテキストにおいてより安全です。

より重要な制限はサイバーチャートです。Anthropic は、Sonnet 5 をサイバーセキュリティタスクに対して意図的にトレーニングしていないと述べています。Firefox 147 のエクスプロイト開発評価において、Sonnet 5 は完全な動作するエクスプロイトを生成しませんでした。動作するエクスプロイトの成功率は 0.0%、部分的な成功率は 13.2% でした。Opus 4.8 および Mythos 5 はその評価において遥かに強力であり、这正是 Anthropic がよりリスクの高いモデル周辺で異なるアクセスおよびガードレールポリシーを維持している理由です。

Anthropic による Claude Sonnet 5 の Firefox 147 エクスプロイト開発評価
Anthropic による Claude Sonnet 5 の Firefox 147 エクスプロイト開発評価

この枠組みは理にかなっています。Sonnet 5 は通常のコーディングおよびエージェント作業に十分な強度を持つべきですが、危険なサイバー能力のために最適化されるべきではありません。Anthropic はまた、Sonnet 5 はデフォルトでリアルタイムのサイバーセキュリティ保護機能が有効になった状態でリリースされると述べています。

私の初見の印象

私は Claude Sonnet 5 を、Claude エージェントのための新しいデフォルトの主力モデルとして扱うべきだと考えます。

すべての困難なコードベースの問題に対して私が選ぶモデルではありません。Opus 4.8 は依然として一部のエージェントコーディングおよびコンピュータ使用ベンチマークで勝利しています。Fable 5 は依然としてより劇的なフロンティアのストーリーです。しかし、Sonnet 5 は、価格、コンテキスト、ツール使用、そしてエージェントが継続できるかどうかという、ほとんどのビルダーが実際に実感する市場の部分に着地しています。

Claude Code にとって、これがおそらく最も興味深い角度です。より長く実行でき、ツールをよりうまく使用し、多くのタスクで Opus に近づきながら安価なモデルは、エージェントループの経済性を変えます。レビュー、困難なデバッグ、または高リスクの変更には Opus クラスのモデルを予約し、メインの実行パスには Sonnet 5 を使用することができます。

私が最初にテストする方法は以下の通りです。

汚れたリポジトリ
失敗するビルド
ブラウザ QA タスク
長いコンテキストの移行
実際のリンクと画像を含むコンテンツワークフロー
抑制を必要とする小規模なデプロイステップ
おすすめ

ベンチマークで好スコアを出すモデルでも、実際のワークフロー内で振る舞う必要があります。現在のファイルを読み取り、無関係な編集を避け、チェックを実行し、次のステップに人間の判断が必要な場合に停止しなければなりません。私はその運用スタイルについて、Claude Code の /loop および /goal に関する記事 で執筆しました。

結論

Claude Sonnet 5 は、エージェント時代における Anthropic のコストパフォーマンスへの回答のように見えます。どこでも置き換えるふりをすることなく、Opus 4.8 とのギャップを狭めています。

ベンチマークは、ターミナル作業、ツール使用、コンピュータ使用、ナレッジワーク、および推論において、Sonnet 4.6 よりも遥かに強力であることを示しています。ドキュメントは、開発者がトークン数、adaptive thinking、およびサンプリングパラメータの変更点に注意する必要があると述べています。安全性の物語は、Anthropic が Sonnet 5 を日常のエージェントのために強力でありながら、Opus や Mythos と同じサイバープロファイルを持たせないようにしたいと考えていることを示しています。

それは実用的なリリースです。私は実用的なモデルとしてそれをテストするつもりです。

2026 年 7 月 1 日に確認したソース