ハイブリッド AI コードレビュー:ループ内で連携する Claude Opus 4.8 と Codex
Tech
AI
Claude Opus 4.8
Codex
GPT-5.5

ハイブリッド AI コードレビュー:ループ内で連携する Claude Opus 4.8 と Codex

ループ内で連携する 2 つの最先端モデル:Claude Opus 4.8 が修正を記述し、Codex が私の AI ブリッジを通じてそれをレビューし、実際のビルドが採決します。39 件の本番環境用修正をすべて手書きなしで完了しました。

Uygar DuzgunUUygar Duzgun
Jun 20, 2026
更新日 2026年6月24日
7 min read

単一の AI エージェントが静かに失敗してしまう仕事のカテゴリーがあります。それは、間違った仮定が数十回の編集にわたって累積してしまう、大規模で多段階のクリーンアップ作業です。私の答えはハイブリッド AI コードレビューです。これは、1 つが構築し、もう 1 つがレビューするという、ループ内で連携する 2 つの異なる最先端モデルによるアプローチです。先週、この手法により、私がコードを 1 行も書かずに、午後だけで messy な SwiftUI プロトタイプを App Store のブロック要因ゼロの状態に持ち込むことができました。

2 つのモデルは、エンジニア役のClaude Opus 4.8とレビュアー役のCodex (GPT-5.5)でした。すべてのタスクを私の AI ブリッジを通じてやり取りさせ、実際のビルドに合格するまで繰り返しました。私の経験では、このハイブリッド AI コードレビューのセットアップは、どちらかのモデルが単独で作業する場合を一貫して上回ります。そして今回の実行は、そのことを最も明確に証明する結果となりました。これがまさにどのように機能したかの詳細です。

雰囲気ではなく計画から始める

エージェントに「これを本番環境対応にして」と指示してはいけません。そうすると、自信満々な nonsense が出来上がってしまいます。

そこで、計画から始めました。Claude にリポジトリ(Kiddays という小規模なメモリ iOS アプリ)をクローンさせ、並列サブエージェントを使ってコードベース*全体*を読み込ませ、本番環境対応の監査レポートを作成させました。その結果、39 の具体的な項目(9 つの重大な App Store ブロック要因と、残りの高・中程度の重要度項目)が挙がりました。各项目には、ファイル名、行番号、工数見積もり、提案された修正が含まれていました。

その監査レポートは `PRODUCTION_READINESS.md` となりました。これは `- [ ]` チェックボックス付きの Markdown チェックリストで、ブロック要因を優先してソートされています。1 つのファイル、それが唯一の真実源です。そこに記載されたすべてのタスクは小さく、具体的で、*検証可能*なものでした。最後の言葉が重要です。チェックボックスにマークを入れて証明できないのであれば、それはタスクではなく単なる願望です。

ハイブリッド AI コードレビューのループ:ステップバイステップ

全体をセルフペースのループ(Claude Code の/loopモード)で実行しました。各イテレーションは 1 つのタスク、または密接に関連するタスクのクラスターを処理し、常に同じリズムに従いました。

5 つのステップのリズム

Claude Opus 4.8 が実際のファイルを読み込み、修正を設計します。メモリに頼るのではなく、まず実際のコードを開きます。
設計を [Codex](https://github.com/openai/codex) に渡し、独立した意見を求めます。これは私の AI ピアレビューブリッジ(オープンソースの ai-collab-bridge スキル)を通じて、CLI ハンドオフで行われます。

bash codex exec --sandbox read-only -o /tmp/answer.txt <<'PROMPT' Pair-reviewing a fix for this SwiftUI app. Here are the files... Recommend the idiomatic iOS 17 approach, flag pitfalls, validate the diff. PROMPT

やり取りを行います。Codex は慣用的なアプローチを提案し、何が壊れるかを指摘し、計画を検証(または反証)します。Claude は実装し、フィードバックに適応し、同意できない点については反論します。
実際のビルドが審判となります。すべてのタスクは `xcodebuild` が緑(成功)で終わらなければ完了とはみなされません。「コンパイルできるはず」という表現は許されません。
チェックボックスにマークを入れ、チェックリストを更新し、次のタスクへ進みます。

その後、ループは何時間も無人で繰り返し実行されます。ハイブリッド AI コードレビューの真髄は、私が監視せずともこのサイクルが実行される点にあります。各ステップを制限するのは私の注意力ではなく、ビルドの結果です。

2 つのモデルが 1 つに勝る理由

おすすめ

魔法は個々のモデルにあるのではありません。どちらも優れており、以前に 私のコードベースにおいて Claude Opus 4.8 が Codex を上回った方法 についても執筆しました。魔法は、両者が異なる盲点を持っていること、そしてコードを書いていないレビュアーには diff に対するエゴが投入されていないことにあります。

このセットアップの価値を証明した発見

今回の実行におけるいくつかの実際の瞬間を紹介します。

Keychain 移行。認証トークンを平文の `UserDefaults` から移動させるのは些細に見えるかもしれません。しかし Codex は、安易な置き換えが SwiftUI のリアクティビティを静かに破壊することを指摘し、環境を通じて注入される `@Observable` ストアを推進しました。Claude は代わりにそれを構築しました。その結果、サインアウト UI が壊れることはありませんでした。
エラーハンドリング。データベースエラーを `try?` で握りつぶしている箇所が約 20 か所ありました。Claude の最初の直感はビューごとのアラートでした。Codex は単一のルートエラープレゼンターを主張しました。1 つのアラート表面であり、すべての保存がそこを経由します。よりクリーンであり、これが出荷されたバージョンです。
StoreKit 2、SwiftData スキーマバージョニング、およびディスク上ファイル保護チェック。これらはすべて iOS 17 固有の地雷原であり、第二の意見が微妙なミスを救いました。まさに、短時間の読み取りでは合格し、実環境で失敗するような類いのものです。
おすすめ

これが、形式的な承認とレビューの違いです。Codex は物事を反証し、Claude は良い反証を取り入れ、残りを擁護しました。diff は、脳を共有しない 2 つのモデルの境界線で改善されました。これこそが ガバナンスされたエージェントワークフロー の背后的な全体的な提案です。構造化されたハンドオフは、1 つのモデルが自分自身と話すことに勝ります。

正直な部分:エージェントはハングするので、ウォッチドッグを構築する

2 回、Codex CLI がハングしました。思考過程中ではなく、バックグラウンドの MCP サーバーが cleanly に閉じなかったシャットダウン時です。プロセスが数分間停止した後、最初のストールを MCP ブートストラップに特定しました。無人ループでは、1 つのハングがすべてを停止させます。

修正策は厳格なウォッチドッグでした。すべての相談ごとにキルタイマーを設け、呼び出しのために MCP を完全に無効化(`-c mcp_servers={}`)し、ハングする要素をなくしました。ループはストールを検知し、ゾンビプロセスを殺し、すでに記述されていた回答を取得して続行しました。「何も止まらない」ことは、自律的な作業における「あれば良いもの」ではなく、ゲームそのものです。

結果

39 件中 39 件完了。9 つの App Store ブロック要因すべてを解消。
最初からクリーンなビルド(`xcodebuild clean build`、終了コード 0)を最終的に達成。単なる増分ビルドの成功ではありません。
13 の新規ファイル。実際の Keychain 保存、実際の StoreKit 2 購入、実際の音声録音、実際のローカル通知、GDPR-K 保護者同意記録、スキーマバージョニング、クラッシュレポート用のシーム。
偽物を現実に、あるいは正直に削除。偽の「プレミアム」トグルが実際のサブスクリプションフローになりました。偽の Google ボタンと偽の家族招待(不正なデータを生成していたもの)は削除され、存在しないバックエンドを約束しないよう法務文書が書き換えられました。

残っているのは、どのモデルもあなたのためにできない仕事だけです。App Store Connect でアプリ内課金商品を作成し、実際のバックエンドを立ち上げ、弁護士にプライバシーポリシーの署名をもらうこと。それぞれがチェックリストに、必要なことが正確にフラグ付けされています。

手法と情報源

これは、私の自身の Kiddays コードベースにおける 1 回の実際の実行に関する firsthand アカウントです。レビュアーは Codex CLI (GPT-5.5) でした。モデル間ハンドオフには、私のオープンソースである ai-collab-bridge スキルを使用しました。iOS 固有の決定は、Apple 自身の StoreKit、SwiftData、およびファイル保護ドキュメントに対してチェックされました。そして、より重要なのは、完了とみなす前に、すべての変更が最初からクリーンな `xcodebuild` によって確認されたことです。私はモデルが主張したことを報告しているのではありません。コンパイルされたものを報告しています。

教訓:アシスタントではなくチーム

ハイブリッド AI コードレビューに依存してきたプロジェクト全体を通じて、鍵となったのは「すべてを行う 1 つのモデルを見つける」ことではありませんでした。それはスタックでした。

チェック可能なチェックリストに変換された計画
各タスクを構築するClaude Opus 4.8
利害関係なくレビューするCodex
クリーンな CLI ハンドオフでそれらをつなぐブリッジ
最終投票を行うビルド
リストが空になるまで実行する/loop

コードを書く 1 つのモデルはアシスタントです。しかし、ノーと言ってくれるビルドに対して互いをレビューし合う 2 つのモデルは、チームのように見え始めています。そして今回の実行では、そのチームが私が監視している間に 39 件の本番環境用修正を出荷しました。