Grok 4.5 проти GPT-5.6 Sol та Claude Fable 5: Вирок бенчмарку
Tech
Grok 4.5
SpaceXAI
xAI
GPT-5.6 Sol

Grok 4.5 проти GPT-5.6 Sol та Claude Fable 5: Вирок бенчмарку

Grok 4.5 досягає межі за нижчою ціною. Дивіться, де він перевершує GPT-5.6 Sol та Claude Fable 5 — і чому я залишаю свою поточну стек.

Uygar DuzgunUUygar Duzgun
Jul 18, 2026
Оновлено 23 лип. 2026 р.
9 min read

Grok 4.5 проти GPT-5.6 Sol — це перше порівняння в цьому циклі випуску, яке робить вартість серйозною причиною для тестування іншого постачальника. Це все ще не змушує мене замінити OpenAI або Anthropic.

Модель SpaceXAI досягає межі, працює швидко і коштує $2 за мільйон вхідних токенів і $6 за мільйон вихідних токенів. Незалежне тестування ставить її близько до провідних агентів кодування. Ті ж тести ставлять її на п'ять пунктів позаду Sol і на шість позаду Claude Fable 5 за загальною інтелектуальною оцінкою.

Станом на 18 липня 2026 року, мій маршрут залишається OpenAI першим, а Anthropic другим. Grok 4.5 входить у контрольовану тестову зону для агентів кодування, автоматизації та обробки великих обсягів даних. Я ще не використовував його в продукції, тому це порівняння відокремлює опубліковані вимірювання від мого власного рішення маршруту.

Короткий вердикт

Найкраща загальна інтелектуальна оцінка: Claude Fable 5 отримує 60 за Індекс Інтелектуальної Аналізу. GPT-5.6 Sol отримує 59, тоді як Grok 4.5 отримує 54.
Найкращий результат агента кодування: Sol у Codex веде з 80. Fable 5 з резервом отримує 77, а Grok 4.5 у Grok Build отримує 76.
Найкраща вартість: Grok 4.5 коштує $0.31 за завдання Індексу Інтелектуальної Аналізу, в той час як Sol коштує $1.04, а Fable 5 — $2.75.
Мій вибір: Я залишу OpenAI як свою основну платформу для кодування та агентів, використовую Anthropic для найскладнішої аналітичної роботи і тестую Grok, де його швидкість і нижча вартість можуть змінити економіку.

Grok 4.5 має чітку роль. Це економічна модель на межі, а не новий лідер якості.

Що таке Grok 4.5?

SpaceXAI випустила Grok 4.5 8 липня як свій флагман для кодування, агентських завдань і знань. Компанія навчила його разом з Cursor і зробила доступним через xAI API, Grok Build і Cursor.

Модель приймає текст і зображення, повертає текст і підтримує виклики функцій, структуровані виходи та налаштовуване міркування. Її контекстне вікно становить 500,000 токенів. Опублікований термін знань закінчується 1 лютого 2026 року, тому актуальна інформація вимагає використання веб-інструментів xAI або X.

Grok Build є відкритим кодом, що дає командам можливість перевіряти цикл агента, складання контексту, відправку інструментів, хуки, навички, плагіни та інтеграцію MCP. Модель Grok 4.5 залишається власницькою; SpaceXAI не опублікувала її ваги.

Grok 4.5 проти GPT-5.6 Sol проти Claude Fable 5

Широке порівняння віддає перевагу Anthropic і OpenAI за якістю, а потім Grok за вартістю. Ці значення поєднують незалежні тести Інтелектуальної Аналізу з поточною документацією API кожного постачальника.

ВимірюванняGrok 4.5GPT-5.6 SolClaude Fable 5
------:---:---:
Індекс Інтелектуальної Аналізу545960
Індекс Агента Кодування76 у Grok Build80 у Codex77 у Claude Code з резервом
Вартість за завдання Індексу Інтелектуальної Аналізу$0.31$1.04$2.75
Контекстне вікно500k токенів1.05M токенів1M токенів
API вхід/вихід за 1M токенів$2 / $6$5 / $30$10 / $50
ВагиЗакритіЗакритіЗакриті
Grok 4.5, GPT-5.6 Sol, Claude Fable 5 та інші моделі на межі за Індексом Інтелектуальної Аналізу
Grok 4.5, GPT-5.6 Sol, Claude Fable 5 та інші моделі на межі за Індексом Інтелектуальної Аналізу

*Джерело: Інтелектуальний Аналіз, 17 липня 2026. Його індекс v4.1 поєднує дев'ять оцінок агентів, кодування, міркування, знань і довгого контексту.*

П'ять пунктів відокремлюють Grok від Sol, а шість — від Fable. Ця різниця достатньо велика, щоб проявитися в складних завданнях, але досить мала, щоб вартість, затримка та надійність інструментів могли змінити практичний результат у роботі з великими обсягами даних.

Де Grok 4.5 показує хороші результати?

Агенти кодування та термінальна робота

Grok 4.5 отримує 76 у Grok Build за Індексом Агента Кодування. Sol веде з 80 у Codex. Fable 5 отримує 77 у Claude Code, хоча ця конфігурація може повернутися до Opus 4.8.

Один пункт відокремлює Grok від протестованої конфігурації Fable. Чотири пункти відокремлюють його від Sol. Це досить близько, щоб виправдати випробування на рівні репозиторію, особливо коли агент виконує сотні викликів інструментів, а витрати на вихідні токени накопичуються.

Grok 4.5 у Grok Build в порівнянні з GPT-5.6 Sol у Codex та Claude Fable 5 у Claude Code на Індексі Агента Кодування
Grok 4.5 у Grok Build в порівнянні з GPT-5.6 Sol у Codex та Claude Fable 5 у Claude Code на Індексі Агента Кодування

*Джерело: Інтелектуальний Аналіз. Індекс середнього значення DeepSWE, Terminal-Bench v2 та SWE-Atlas-QnA. Вузли різняться, тому графік вимірює комбінацію моделі та агента.*

Таблиця запуску SpaceXAI розповідає схожу, але менш актуальну історію. Grok веде SWE Marathon з 29.0%, отримує 83.3% на Terminal-Bench 2.1 і досягає 64.7% на SWE-Bench Pro. Fable 5 веде у чотирьох з п'яти показаних тестів кодування. SpaceXAI порівняла Grok з GPT-5.5, а не з GPT-5.6 Sol, тому я б не використовував цю таблицю постачальника для прямого вердикту по Sol.

Швидкість та ефективність токенів

Інтелектуальний Аналіз виміряв Grok 4.5 приблизно в 112 вихідних токенів на секунду. SpaceXAI повідомляє про 80 токенів на секунду і стверджує, що модель використовувала 15,954 вихідних токенів на кожне вирішене завдання SWE-Bench Pro, що в 4.2 рази менше, ніж Claude Opus 4.8 у своєму порівнянні.

Ці цифри описують різні налаштування тестування, але вони вказують в одному напрямку: Grok призначений для завершення агентських завдань з меншими виходами. Економія має значення, коли агент кодування читає файли, виконує команди, виправляє збої та повторює цикл.

Чи є Grok 4.5 переможцем за вартістю?

Для запитів нижче 200,000 токенів xAI стягує $2 за мільйон вхідних токенів, $0.50 за кешовані вхідні дані та $6 за вихід. Як тільки запит перевищує 200,000 токенів, тарифи подвоюються до $4, $1 і $12 на весь запит.

Ціна на короткий контекст на 60% нижча за Sol на вхід і на 80% нижча на вихід. Fable 5 коштує в п'ять разів більше за вхід і більше ніж у вісім разів більше за вихід.

Графік Інтелектуального Аналізу, що порівнює інтелект моделі з вартістю за завданням бенчмарку, включаючи Grok 4.5, GPT-5.6 Sol та Claude Fable 5
Графік Інтелектуального Аналізу, що порівнює інтелект моделі з вартістю за завданням бенчмарку, включаючи Grok 4.5, GPT-5.6 Sol та Claude Fable 5

*Джерело: Інтелектуальний Аналіз. Вартість за завдання включає токени, які використовувала кожна модель, а не просто порівняння цінових карток.*

Незалежна вартість завдання є більш корисною, ніж цінова картка: $0.31 для Grok, $1.04 для Sol і $2.75 для Fable. Grok поступається Sol п'ятьма пунктами інтелекту, зменшуючи вартість тесту приблизно на 70%.

Вартість виробництва все ще включає невдалі виклики інструментів, повторні патчі, час на перегляд і регресії. Дешевий запуск, який потребує старшого розробника для виправлення результату, може коштувати більше, ніж дорогий чистий запуск.

Де Grok 4.5 відстає?

Загальна якість та довгий контекст

Sol і Fable ведуть широкий незалежний індекс. Обидва також пропонують приблизно вдвічі більше контекстне вікно, ніж Grok. Ця різниця впливає на великі репозиторії, довгі дослідницькі пакети та сесії агентів, які не можуть компактно зберігати свою історію без втрати корисних доказів.

Бенчмарки запуску Grok підкреслюють цю різницю. Fable веде у DeepSWE 1.0, DeepSWE 1.1, Terminal-Bench 2.1 і SWE-Bench Pro у власному графіку SpaceXAI. Grok виграє у SWE Marathon, який тестує довші завдання програмної інженерії, але одна перемога не встановлює постійного лідерства.

Надійність знань

Grok 4.5 покращив точність AA-Omniscience з 35% для Grok 4.3 до 52%. Його рівень галюцинацій зріс з 25% до 54%. Загальний бал Omniscience збільшився з 18 до 26, оскільки Grok відповідав на більше запитань правильно, але також давав більше непідтверджених відповідей замість відмови.

Точність знань Grok 4.5, рівень галюцинацій та бал AA-Omniscience в порівнянні з провідними AI моделями
Точність знань Grok 4.5, рівень галюцинацій та бал AA-Omniscience в порівнянні з провідними AI моделями

*Джерело: Оцінка Grok 4.5 від Інтелектуального Аналізу. Рівень галюцинацій належить AA-Omniscience і не повинен узагальнюватися на всі типи запитів.*

Я б вимагав отримання, цитовані докази та зовнішню перевірку для фактичної публікації з Grok. Те ж правило застосовується до Sol і Fable, але зміна точності та галюцинацій Grok заслуговує на окреме тестування.

Що блокує Grok 4.5 для мого поточного стеку?

Мені потрібен доступ, сумісний з ЄС, для цього розгортання. Документація xAI для Grok 4.5 все ще говорить, що доступ до API-консолі недоступний для користувачів з ЄС і очікується пізніше в липні. Це може змінитися найближчим часом, але сьогодні це блокує стабільний маршрут виробництва.

xAI зберігає вхідні та вихідні дані API за замовчуванням протягом 30 днів і стверджує, що не навчається на них без явної згоди. Нульове зберігання даних доступне для відповідних команд, хоча його активація видаляє функції API відповідей, файлів і колекцій, а також підтримку пакетного API. Будь-яке виробниче випробування потребує перевірки обробки даних перед тим, як код або матеріали клієнта досягнуть служби.

Рекомендовано для вас

OpenAI залишається моїм за замовчуванням, оскільки Sol веде поточний індекс агента кодування, має контекстне вікно в 1.05 мільйона токенів і підходить для робочих процесів Codex і API відповідей, які я вже використовую. Моє порівняння GPT-5.6 Sol та Fable 5 пояснює цей маршрут детальніше.

Anthropic залишається моїм другим маршрутом для довгого, неоднозначного аналізу, де якість Fable може покрити його вищу ціну. Grok потрібно перевершити один з цих маршрутів за вартістю завершеного завдання, а не лише за ціною токенів.

Рекомендовано для вас

Мій стандарт походить від створення AI агентів, які дійсно працюють: вимірюйте завершену роботу, збої інструментів, час на перегляд і відновлення після поганої дії.

Як я б тестував Grok 4.5

Запустіть ту ж проблему репозиторію в Grok Build, Codex і Claude Code. Запишіть прийняті зміни, токени, команди, невдалі тести та хвилини перегляду.
Дайте кожній моделі довгий дослідницький пакет з конфліктуючими джерелами. Виміряйте покриття цитат, непідтверджені твердження та виправлення після зворотного зв'язку.
Повторіть робочий процес браузера та електронної таблиці десять разів. Порівняйте швидкість завершення, затримку та загальну вартість API, а не найкращий окремий запуск.

Я б переглянув маршрути після відкриття доступу до ЄС і проходження Grok цих тестів. До тих пір Grok 4.5 є кандидатом, гідним бенчмарку, а не залежністю виробництва.

Практичний вибір моделі

Виберіть Grok 4.5, коли робота агентів з великими обсягами, швидкий вихід і вартість за завершене завдання домінують у рішенні — і коли його контекст у 500,000 токенів та регіональна доступність підходять для вашого розгортання.

Виберіть GPT-5.6 Sol, коли ви хочете найсильніший поточний результат агента кодування, зрілу поверхню інструментів і більше контекстне вікно в межах екосистеми OpenAI.

Виберіть Claude Fable 5, коли завдання є аналітично складним достатньо, щоб виправдати найвищу ціну токенів, і ви цінуєте його перевагу в широкому інтелектуальному бенчмарку.

Мій маршрут залишається OpenAI плюс Anthropic, з Grok у тестуванні. Grok 4.5 робить це тестування економічно цікавим. Опубліковані результати поки не виправдовують міграцію.

Джерела та методологія

Я перевірив оголошення Grok 4.5 від SpaceXAI, документацію моделі, живу цінову таблицю, FAQ з безпеки та оголошення про відкритий код Grok Build. Незалежні результати походять з оцінки Grok 4.5 від Інтелектуального Аналізу та його порівняння на межі 17 липня. Я використовував GPT-5.6 Sol від OpenAI та документацію Claude Fable 5 від Anthropic для порівняння специфікацій та цін.

Бали, ціни, нотатки про доступ та поведінку продукту є актуальними станом на 18 липня 2026 року. Постачальники можуть змінювати поведінку обслуговування, ціни, регіональний доступ та псевдоніми моделей без зміни статті.