Hybride KI-Code-Überprüfung: Claude Opus 4.8 + Codex in einer Schleife
Tech
AI
Claude Opus 4.8
Codex
GPT-5.5

Hybride KI-Code-Überprüfung: Claude Opus 4.8 + Codex in einer Schleife

Zwei Grenzmodelle in einer Schleife: Claude Opus 4.8 schreibt jede Korrektur, Codex überprüft sie über meine KI-Brücke, und ein echtes Build stimmt ab. 39 Produktionskorrekturen, keine manuell.

Uygar DuzgunUUygar Duzgun
Jun 20, 2026
Aktualisiert 24. Juni 2026
7 min read

Es gibt eine Kategorie von Arbeiten, in der ein einzelner KI-Agent leise versagt: große, mehrstufige Bereinigungen, bei denen eine falsche Annahme sich über Dutzende von Änderungen kumuliert. Meine Antwort ist hybride KI-Code-Überprüfung — zwei verschiedene Grenzmodelle in einer Schleife, eines baut und eines überprüft — und letzte Woche hat es ein chaotisches SwiftUI-Prototyp geschafft, alle App Store-Blockaden an einem Nachmittag zu beseitigen, ohne dass ich eine Zeile Code geschrieben habe.

Die beiden Modelle waren Claude Opus 4.8 als Ingenieur und Codex (GPT-5.5) als Prüfer, die jede Aufgabe über meine KI-Brücke schickten, bis sie ein echtes Build bestanden. Nach meiner Erfahrung schlägt dieses hybride KI-Code-Überprüfungs-Setup konsequent jedes Modell, das alleine arbeitet, und dieser Durchlauf war der klarste Beweis bisher. Hier ist genau, wie es funktioniert hat.

Beginnen Sie mit einem Plan, nicht mit einem Gefühl

Sie geben einem Agenten nicht "mach das produktionsbereit." So erhalten Sie selbstbewusstes Unsinn.

Also begann ich mit einem Plan. Ich ließ Claude das Repository klonen (eine Baby-Memory-iOS-App namens Kiddays), den *gesamten* Code mit parallelen Unteragenten lesen und ein Produktionsbereitschafts-Audit erstellen: 39 konkrete Punkte — 9 harte App Store-Blockaden, der Rest von hoher und mittlerer Schwere. Jeder Punkt hatte eine Datei, eine Zeile, eine Aufwandsschätzung und einen vorgeschlagenen Fix.

Dieses Audit wurde zu `PRODUCTION_READINESS.md` — einer Markdown-Checkliste mit `- [ ]` Kästchen, sortiert nach Blockaden zuerst. Eine Datei, die einzige Quelle der Wahrheit. Jede Aufgabe darin war klein, spezifisch und *überprüfbar*. Das letzte Wort ist wichtig: Wenn Sie kein Kästchen abhaken und es beweisen können, ist es keine Aufgabe, sondern ein Wunsch.

Der hybride KI-Code-Überprüfungsloop, Schritt für Schritt

Ich führte das Ganze in einer selbstgesteuerten Schleife (Claude Code's /loop-Modus) aus. Jede Iteration behandelte eine Aufgabe oder einen engen Cluster verwandter Aufgaben und folgte immer demselben Rhythmus.

Der fünfstufige Rhythmus

Claude Opus 4.8 liest die echten Dateien und entwirft die Korrektur. Nicht aus dem Gedächtnis — es öffnet zuerst den tatsächlichen Code.
Es übergibt das Design an [Codex](https://github.com/openai/codex) für eine unabhängige Meinung über meine KI-Peer-Review-Brücke — die Open-Source ai-collab-bridge Fähigkeit — über einen CLI-Übergang:

bash codex exec --sandbox read-only -o /tmp/answer.txt <<'PROMPT' Pair-reviewing a fix for this SwiftUI app. Here are the files... Recommend the idiomatic iOS 17 approach, flag pitfalls, validate the diff. PROMPT

Sie prallen ab. Codex schlägt den idiomatischen Ansatz vor, weist auf mögliche Probleme hin und validiert (oder widerlegt) den Plan. Claude implementiert, passt sich dem Feedback an und weicht zurück, wo es nicht einverstanden ist.
Ein echtes Build ist der Schiedsrichter. Jede Aufgabe endet mit `xcodebuild` grün, oder sie ist nicht abgeschlossen. Kein "sollte kompilieren."
Haken Sie das Kästchen ab, aktualisieren Sie die Checkliste, gehen Sie zur nächsten über.

Dann feuert die Schleife wieder, und wieder, stundenlang, unbeaufsichtigt. Der ganze Sinn der hybriden KI-Code-Überprüfung ist, dass dieser Zyklus ohne meine Aufsicht läuft — das Build, nicht meine Aufmerksamkeit, ist das, was jeden Schritt steuert.

Warum zwei Modelle besser sind als eins

Empfohlen für dich

Die Magie liegt nicht in einem der Modelle — beide sind ausgezeichnet, und ich habe zuvor darüber geschrieben, wie Claude Opus 4.8 Codex in meinem eigenen Codebase geschlagen hat. Die Magie ist, dass sie unterschiedliche blinde Flecken haben, und ein Prüfer, der den Code nicht geschrieben hat, hat kein Ego, das in den Diff investiert ist.

Die Fallen, die für das Setup bezahlt haben

Einige echte Momente aus diesem Durchlauf:

Keychain-Migration. Authentifizierungstoken aus dem Klartext `UserDefaults` zu verschieben, sieht trivial aus. Codex wies darauf hin, dass ein naiver Austausch die SwiftUI-Reaktivität stillschweigend brechen würde, und drängte auf einen `@Observable`-Speicher, der durch die Umgebung injiziert wird. Claude baute das stattdessen. Keine kaputte Abmelde-UI.
Fehlerbehandlung. Ich hatte ~20 Stellen, die Datenbankfehler mit `try?` unterdrückten. Claudes erster Instinkt war pro-Ansicht Warnungen. Codex argumentierte für einen einzigen Root-Fehler-Präsentator — eine Warnungsoberfläche, jede Speicherung wird darüber geleitet. Sauberer, und es ist die Version, die ausgeliefert wurde.
StoreKit 2, SwiftData-Schema-Versionierung und On-Disk-Dateischutzprüfungen. Alle iOS-17-spezifischen Minenfelder, in denen die zweite Meinung einen subtilen Fehler rettete — genau die Art von Dingen, die bei einer schnellen Durchsicht bestehen und in der Wildnis scheitern.
Empfohlen für dich

Das ist der Unterschied zwischen einem Gummistempel und einer Überprüfung. Codex widerlegte Dinge; Claude integrierte die guten Widerlegungen und verteidigte den Rest. Der Diff wurde besser an der Grenze zwischen zwei Modellen, die kein gemeinsames Gehirn haben — was das ganze Konzept hinter gesteuerten Agenten-Workflows ist: strukturierte Übergaben schlagen ein Modell, das mit sich selbst spricht.

Der ehrliche Teil: Agenten hängen, also bauen Sie einen Wächter

Zweimal ist mir die Codex-CLI hängen geblieben — nicht beim Denken, sondern beim Herunterfahren, als seine Hintergrund-MCP-Server nicht sauber schlossen. Ich habe die erste Störung selbst auf das MCP-Bootstrap zurückverfolgt, nachdem der Prozess minutenlang tot war. In einer unbeaufsichtigten Schleife stoppt ein Hänger alles.

Die Lösung war ein harter Wächter: ein Kill-Timer um jede Konsultation, plus das vollständige Deaktivieren von MCP für den Anruf (`-c mcp_servers={}`), sodass es nichts gab, woran man hängen bleiben konnte. Die Schleife erkannte die Störung, tötete den Zombie-Prozess, ergriff die Antwort, die bereits geschrieben war, und machte weiter. "Nichts bleibt stecken" ist kein Nice-to-Have in autonomer Arbeit — es ist das ganze Spiel.

Das Ergebnis

39 von 39 Punkten erledigt. Alle 9 App Store-Blockaden beseitigt.
Sauberes Build von Grund auf (`xcodebuild clean build`, exit 0) am Ende — nicht nur inkrementell grün.
13 neue Dateien. Echte Keychain-Speicherung, echte StoreKit 2-Käufe, echte Sprachaufzeichnung, echte lokale Benachrichtigungen, ein GDPR-Kinderzustimmungsprotokoll, Schema-Versionierung, ein Fehlerberichterstattungs-Naht.
Fälschung wurde real oder ehrlich entfernt. Der gefälschte "Premium"-Schalter wurde zu einem echten Abonnementfluss. Der gefälschte Google-Button und die gefälschten Familieneinladungen — die falsche Daten generierten — wurden entfernt, und der rechtliche Text wurde umgeschrieben, um zu stoppen, dass ein Backend versprochen wird, das noch nicht existiert.

Was bleibt, ist nur die Arbeit, die kein Modell für Sie erledigen kann: die In-App-Kaufprodukte in App Store Connect zu erstellen, das echte Backend aufzubauen, einen Anwalt zu bekommen, der die Datenschutzrichtlinie abzeichnet. Jede einzelne ist in der Checkliste mit genau dem, was benötigt wird, gekennzeichnet.

Methode und Quellen

Dies ist ein firsthand Bericht über einen echten Durchlauf in meiner eigenen Kiddays-Codebasis. Der Prüfer war die Codex CLI (GPT-5.5); der Modell-zu-Modell-Übergang verwendete meine Open-Source ai-collab-bridge Fähigkeit. Die iOS-spezifischen Entscheidungen wurden mit Apples eigener StoreKit-, SwiftData- und Dateischutzdokumentation überprüft — und, was noch wichtiger ist, jede einzelne Änderung wurde durch ein sauberes `xcodebuild` von Grund auf bestätigt, bevor ich es als abgeschlossen betrachtete. Ich berichte nicht, was die Modelle behaupteten; ich berichte, was kompiliert wurde.

Die Erkenntnis: ein Team, kein Assistent

In den Projekten, in denen ich mich auf hybride KI-Code-Überprüfung gestützt habe, war die Entsperrung nie "finden Sie das eine Modell, das alles macht." Es war ein Stapel:

ein Plan, der in eine Checkliste verwandelt wurde, die Sie abhaken können,
Claude Opus 4.8, um jede Aufgabe zu erstellen,
Codex, um sie ohne Eigeninteresse zu überprüfen,
die Brücke, um sie über einen sauberen CLI-Übergang zu verbinden,
ein Build, das die endgültige Abstimmung erhält,
und eine /loop, um es auszuführen, bis die Liste leer ist.

Ein Modell, das Code schreibt, ist ein Assistent. Zwei Modelle, die sich gegenseitig gegen ein Build überprüfen, das Nein sagen kann, beginnen wie ein Team auszusehen — und bei diesem Durchlauf hat dieses Team 39 Produktionskorrekturen ausgeliefert, während ich zusah.