Існує категорія робіт, де один AI-агент тихо зазнає невдачі: великі багатокрокові очищення, де одна хибна припущення накопичується через десятки змін. Моя відповідь — гібридний AI-код-рев'ю — дві різні передові моделі в циклі, одна будує, інша перевіряє — і минулого тижня це перетворило брудний прототип SwiftUI на проект без жодних блокерів для App Store за один день, без того, щоб я написав хоча б рядок коду.
Двома моделями були Claude Opus 4.8 як інженер і Codex (GPT-5.5) як рецензент, які передавали кожне завдання через мій AI-міст, доки воно не пройшло реальну збірку. На мій досвід, ця настройка гібридного AI-код-рев'ю стабільно перевершує будь-яку модель, що працює окремо, і цей запуск став найяснішим доказом цього. Ось точно, як це працювало.
Почніть з плану, а не з відчуття
Ви не доручаєте агенту "зроби це готовим до продакшену". Саме так ви отримуєте впевнену нісенітницю.
Тому я почав з плану. Я попросив Claude клонувати репозиторій (iOS-додаток для дитячої пам'яті під назвою Kiddays), прочитати *всю* кодову базу за допомогою паралельних суб-агентів і створити аудит готовності до продакшену: 39 конкретних пунктів — 9 жорстких блокерів для App Store, решта — високої та середньої критичності. Кожен пункт мав файл, рядок, оцінку зусиль і запропоноване виправлення.
Цей аудит став `PRODUCTION_READINESS.md` — markdown-чеклістом з коробками `- [ ]`, відсортованими спочатку блокери. Один файл — єдине джерело істини. Кожне завдання в ньому було малим, конкретним і *перевірним*. Останнє слово важливе: якщо ви не можете поставити галочку і довести це, це не завдання, це бажання.
Цикл гібридного AI-код-рев'ю, крок за кроком
Я запускав усе це в самостійному циклі (режим /loop у Claude Code). Кожна ітерація обробляла одне завдання або тісний кластер пов'язаних завдань і завжди дотримувалася одного й того самого ритму.
П'ятикроковий ритм
bash codex exec --sandbox read-only -o /tmp/answer.txt <<'PROMPT' Pair-reviewing a fix for this SwiftUI app. Here are the files... Recommend the idiomatic iOS 17 approach, flag pitfalls, validate the diff. PROMPT
Потім цикл запускається знову і знову, протягом годин, без нагляду. Весь сенс гібридного AI-код-рев'ю в тому, що цей цикл працює без мого нянькування — саме збірка, а не моя увага, контролює кожен крок.
Чому дві моделі кращі за одну
Магія не в жодній моделі окремо — обидві чудові, і я вже писав про те, як Claude Opus 4.8 переміг Codex на моїй власній кодовій базі→. Магія в тому, що у них різні сліпі зони, і рецензент, який не писав код, не має его, вкладеного в diff.
Моменти, які виправдали налаштування
Кілька реальних моментів з цього запуску:
Це різниця між формальним затвердженням і рецензуванням. Codex спростовував речі; Claude інтегрував хороші спростування та захищав решту. Diff став кращим на межі між двома моделями, які не мають спільного мозку — що й є всією суттю керованих агентських робочих процесів→: структуровані передачі кращі, ніж одна модель, що говорить сама з собою.
Чесна частина: агенти зависають, тому створіть сторожа
Двічі CLI Codex зависав на мені — не на мисленні, а під час завершення роботи, коли його фонові MCP-сервери не закривалися чисто. Я відстежив перше зависання самостійно до MCP bootstrap, після того як процес сидів мертвим хвилинами. У циклі без нагляду одне зависання зупиняє все.
Виправленням став жорсткий сторож: таймер вбивства навколо кожної консультації плюс повне вимкнення MCP для виклику (`-c mcp_servers={}`), щоб не було нічого, на чому можна було б зависнути. Цикл виявляв зависання, вбивав процес-зомбі, забирав відповідь, яка вже була записана, і продовжував роботу. "Ніщо не застрягає" — це не просто приємна опція в автономній роботі — це вся гра.
Результат
Залишилася лише робота, яку жодна модель не може зробити за вас: створити продукти внутрішньододаткових покупок у App Store Connect, розгорнути реальний бекенд, отримати підпис юриста на політиці конфіденційності. Кожен з них позначений у чеклісті з точною вказівкою того, що потрібно.
Метод і джерела
Це розповідь з перших рук про один реальний запуск на моїй власній кодовій базі Kiddays. Рецензентом був Codex CLI (GPT-5.5); передача між моделями використовувала мою open-source навичку ai-collab-bridge. Рішення, специфічні для iOS, перевірялися проти власної документації Apple щодо StoreKit, SwiftData та захисту файлів — і, що важливіше, кожна зміна була підтверджена чистою збіркою `xcodebuild` з нуля, перш ніж я вважав її завершеною. Я не повідомляю про те, що стверджували моделі; я повідомляю про те, що скомпілювалося.
Висновок: команда, а не асистент
У проектах, де я покладався на гібридне AI-код-рев'ю, розблокуванням ніколи не було "знайти одну модель, яка робить усе". Це був стек:
Одна модель, що пише код, — це асистент. Дві моделі, які рецензують одна одну проти збірки, яка може сказати "ні", починають виглядати як команда — і в цьому запуску ця команда випустила 39 виправлень для продакшену, поки я спостерігав.
