Kimi K3 проти GPT-5.6 Sol — це достатньо близьке протистояння, щоб змусити мене перезапустити мої тести маршрутизації. Модель від Moonshot все ще не замінює OpenAI або Anthropic у моєму стеку.
Цей висновок менш драматичний, ніж заголовки під час запуску, але цифри підтверджують його. Новий флагман від Moonshot AI посідає третє місце в незалежному індексі інтелекту, лідирує на арені сліпого тестування фронтенд-коду та перевершує GPT-5.6 Sol в одному тесті знань з довгим горизонтом планування. Водночас він поступається Claude Fable 5 та Sol за найширшими метриками, а його ваги для завантаження все ще обіцяні лише на майбутнє.
Станом на 18 липня 2026 року я розглядаю Kimi K3 як серйозного кандидата для оцінки, а не як причину для міграції продакшен-роботи. Я ще не прогнав K3 через власний продакшен-бенчмарк, тому нижче я розділяю результати третіх сторін та своє рішення щодо маршрутизації.
Короткий вердикт
Результатом є гонка трьох моделей з різними переможцями залежно від завдання. Єдиний лідерборд не може сказати вам, яка модель завершить вашу роботу з найменшою кількістю повторних спроб.
Що таке Kimi K3?
Moonshot AI представила Kimi K3 16 липня як модель типу Mixture-of-Experts з 2,8 трильйона параметрів. Її маршрутизатор обирає 16 із 896 експертів для кожного токена. K3 також має нативну підтримку вхідних зображень, контекстне вікно в один мільйон токенів та текстовий вихід.
Moonshot пояснює стрибок від K2 до K3 двома архітектурними змінами: Kimi Delta Attention та Attention Residuals. Компанія повідомляє про приблизно 2,5-разове покращення ефективності масштабування порівняно з K2, але технічний звіт ще не опубліковано. Ця цифра залишається твердженням вендора.
API вже працює. Moonshot каже, що повні ваги з'являться до 27 липня. Доки ці файли не надійдуть, K3 є оголошеною моделлю з відкритими вагами, а не моделлю, яку ви вже можете завантажити та перевірити на своїй інфраструктурі.
Kimi K3 проти GPT-5.6 Sol проти Claude Fable 5
Найчітніше порівняння поєднує незалежні тести з офіційними специфікаціями продуктів. Перші чотири рядки нижче взяті з Artificial Analysis та Arena; дані про контекст і ціноутворення походять з документації кожного постачальника.
| Метрика | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| Індекс інтелекту Artificial Analysis | 57 | 59 | 60 |
| GDPval-AA v2 | 1,668 Elo | 1,748 Elo | 1,760 Elo |
| Робота зі знаннями AA-Briefcase | 1,547 Elo | 1,495 Elo | 1,583 Elo |
| Frontend Code Arena | 1,679 Elo | 1,618 Elo | 1,631 Elo |
| Контекстне вікно | 1M токенів | 1.05M токенів | 1M токенів |
| Вхід/вихід API за 1M токенів | $3 / $15 | $5 / $30 | $10 / $50 |
| Ваги | Обіцяно 27 липня | Закриті | Закриті |

*Джерело: Artificial Analysis, 17 липня 2026. Його індекс v4.1 поєднує дев'ять оцінок кодування, міркувань, знань та агентності.*
Різниця в два пункти між K3 та Sol достатньо мала, щоб мати менше значення, ніж якість обвязки (harness), затримка, використання токенів та відновлення після помилок. Різниця в три пункти до Fable 5 все ще є реальною. K3 досяг групи лідерів; він не виграв у цій групі.
Де перемагає Kimi K3?
Фронтенд-кодування та візуальна ітерація
Найкращий незалежний результат K3 — це Frontend Code Arena. Людські оцінювачі порівнюють анонімні результати роботи фронтенду, які можна запустити, і голосують за кращий результат. K3 досяг 1679 Elo, що на 48 пунктів більше, ніж у Fable 5, і на 61 більше, ніж у Sol. Arena також поставила його на перше місце в шести із семи категорій фронтенду.
Цей результат важливий для команд, які створюють лендінги, панелі приладів, відтворення дизайну та візуальні інструменти. Він вимірює вподобання щодо робочого виводу, а не лише те, чи проходить модульний тест.
Загальна таблиця кодування від Moonshot є змішаною. K3 лідирує в Program Bench з показником 77,8 та в SWE Marathon з показником 42,0. Sol лідирує в DeepSWE з показником 73,0 та в Terminal-Bench 2.1 з показником 88,8. Fable 5 лідирує в FrontierSWE з показником 86,6 та у внутрішньому порівнянні Kimi Code Bench від Moonshot з показником 76,9.

*Джерело: Пост про запуск Kimi K3 від Moonshot AI. Це результати, зібрані вендором, і моделі іноді використовують різні обвязки агентів.*
Вибір обвязки змінює оцінку. K3 часто працює в Kimi Code, Sol — у Codex, а Fable — у Claude Code. Бенчмарк може вимірювати модель, обвязку або взаємодію між ними обома. Я б перезапустив репрезентативне завдання репозиторію всередині інструменту, який планую розгорнути.
Автоматизація та робота зі знаннями
Artificial Analysis надає K3 оцінку 53% та перше місце на AutomationBench-AA. На AA-Briefcase, приватній оцінці роботи зі знаннями з довгим горизонтом планування, K3 набирає 1547 Elo. Це більше, ніж 1495 у Sol, але менше, ніж 1583 у Fable 5.
Оцінка Moonshot також ставить K3 з невеликою перевагою попереду на BrowseComp та SpreadsheetBench 2. Fable лідирує в GDPval-AA, JobBench та загальному балі AA-Briefcase. Sol залишається найсильнішим у якості презентації в рамках розбивки AA-Briefcase.

*Джерело: Moonshot AI. Діаграма включає незалежні оцінки, публічні лідерборди та тести, проведені Moonshot; ознайомтеся з примітками, перш ніж вважати стовпчики частиною одного контрольованого експерименту.*
K3 виглядає корисним для дослідницьких агентів, роботи з електронними таблицями та автоматизації браузера. Fable залишається безпечнішим вибором, коли аналітична якість важливіша за ціну. Sol підходить командам, які вже використовують Codex, Responses API, хостингові інструменти та програмний виклик інструментів.
Де Kimi K3 все ще поступається?
Широкі міркування та експертні знання
Fable 5 зберігає чітку перевагу в Humanity's Last Exam. Moonshot повідомляє 53,3 для Fable, 44,5 для Sol та 43,5 для K3 без інструментів. З інструментами оцінки зростають до 63, 58 та 56 відповідно. Це більший розрив, ніж sugerує загальний індекс.
Sol демонструє найсильніші опубліковані результати в кількох тестах з науки, використання комп'ютера та довгого контексту в таблиці запуску OpenAI. Fable лідирує в GDPval-AA та загалом в AA-Briefcase. K3 перемагає в окремих завданнях, але не демонструє такої ж узгодженості across категорій.
Надійність знань
K3 покращив свою точність AA-Omniscience з 33% до 46% порівняно з K2.6. Його рівень галюцинацій також зріс з 39% до 51%. Комбінований бал Omniscience покращився з 6 до 18, оскільки K3 правильно відповідає на більше запитань, проте регрес у необґрунтованих відповідях заслуговує на тестування в роботі, що heavily спирається на цитування.

*Джерело: Artificial Analysis. Рівень галюцинацій належить до AA-Omniscience і не повинен узагальнюватися на кожен тип запиту.*
Я б вимагав отримання джерел, цитування доказів та детермінованої перевірки перед використанням будь-якої з цих моделей для фактологічних публікацій. Результат K3 не змінює це правило.
Чи дешевший Kimi K3 на практиці?
Прайс-листи роблять K3 вирішальним:
Artificial Analysis оцінює вартість завдання індексу інтелекту в $0,94 для K3, $1,04 для Sol та $2,75 для Fable 5. Використання токенів K3 звужує його перевагу в прайс-листі над Sol до десяти центів на цьому навантаженні. Fable коштує набагато дорожче, але він також фінішує першим у загальному індексі та найскладніших тестах роботи зі знаннями.
Ціна за токен є неповним бюджетом. Вартість продакшену включає повторні спроби, виклики інструментів, час на перевірку, затримку та роботу, необхідну для виправлення неправильної відповіді. Модель, яка бере вдвічі менше грошей і потребує вдвічі більше циклів виправлення, не заощадила гроші.
Чому мій стек залишається OpenAI та Anthropic
Я вже використовую OpenAI та Anthropic для кодування, досліджень та робочих процесів агентів. K3 не надав мені достатньо доказів, щоб додати третього постачальника для продакшену.
OpenAI залишається моїм вибором за замовчуванням для агентного кодування, оскільки Sol лідирує в незалежному індексі Coding Agent із показником 80, інтегрується з Codex та Responses API, і має найширшу поверхню інструментів для моєї роботи. Моє порівняння GPT-5.6 Sol та Fable 5→ детальніше розглядає це рішення щодо маршрутизації.
Anthropic залишається моїм другим маршрутом для довгого, складного аналізу та роботи зі складними кодовими базами. Fable 5 лідирує в загальному індексі інтелекту, GDPval-AA, AA-Briefcase та Humanity's Last Exam. Його ціна $10/$50 та вимога 30-денного зберігання даних означають, що я зарезервую його для роботи, де виграш у якості виправдовує ці обмеження.
Мій стандарт походить від створення AI агентів, які дійсно працюють→: завершені завдання, помічені збої інструментів та вартість перевірки важать більше, ніж заголовний бал.
K3 входить у тестову смугу з трьома завданнями:
Я перегляну маршрутизацію для продакшену після того, як Moonshot випустить ваги та технічний звіт, після того як я перегляну фінальну ліцензію, і після того, як K3 пройде ці тести. Команди з великими навантаженнями на фронтенд або автоматизацію можуть дійти цієї точки раніше.
Практичний вибір моделі
Оберіть Kimi K3 для контрольованої оцінки, коли якість фронтенду, автоматизація браузера або нижчі прайс-листи API домінують у навантаженні.
Оберіть GPT-5.6 Sol, коли вам потрібне зріле середовище агентів кодування, широка підтримка інструментів, висока якість презентації та стабільні результати в технічних завданнях.
Оберіть Claude Fable 5, коли завдання є довгим, неоднозначним і аналітично складним настільки, щоб виправдати вищу вартість та обмеження щодо зберігання даних.
Моя відповідь сьогодні — OpenAI плюс Anthropic, з K3 на етапі тестування. Moonshot заробив це тестування. Він не заробив автоматичну міграцію.
Джерела та методологія
Я перевірив пост про запуск Kimi K3 та ціни на API від Moonshot, незалежну оцінку K3 від Artificial Analysis, сліпий рейтинг фронтенду Arena, про який повідомляє AP, реліз GPT-5.6 та документацію моделі Sol від OpenAI, а також запуск Fable 5 та посібник з API Claude Fable 5 від Anthropic.
Усі бали та ціни актуальні станом на 18 липня 2026 року. Постачальники моделей можуть змінювати ціни, маршрутизацію, засоби захисту та поведінку обслуговування без зміни назви моделі.