GPT-6.1 Sol проти Opus 5.5: бенчмарки, ціна, найкращі способи використання
⚡ Tech
Tech
AI
OpenAI
Claude

GPT-6.1 Sol проти Opus 5.5: бенчмарки, ціна, найкращі способи використання

GPT-6.1 Sol обіцяє більше агентної роботи за той самий бюджет. Я порівнюю його бенчмарки, ціну API та перші відгуки користувачів із Claude Opus 5.5.

Uygar DuzgunUUygar Duzgun
Sep 29, 2026
Оновлено 1 жовт. 2026 р.
7 min read

GPT-6.1 Sol привернув мою увагу, тому що я хочу виконувати більше корисної агентної роботи, не сприймаючи кожне завдання як витрату на преміум-модель. Цікаве питання полягає в тому, скільки правильної роботи, яку можна перевірити, я можу отримати за свій бюджет.

Мій перший висновок: Sol заслуговує на місце в розмові про моделі для щоденного використання. Claude Opus 5.5 також заслуговує на серйозне порівняння, особливо коли якість важливіша за швидкість першої відповіді. Я протестую обидві моделі на реальній роботі. Поки що я розділяю опубліковані бенчмарки, перші звіти користувачів і власні очікування.

*Перевірка джерел: 29 вересня 2026 року. Головне зображення — редакційна ілюстрація, створена за допомогою AI. Діаграми даних я побудував на основі наведених опублікованих значень; це не скриншоти моїх власних тестів.*

Для чого підходить GPT-6.1 Sol?

OpenAI позиціонує GPT-6.1 Sol для складного програмування, роботи з комп’ютером і професійних завдань, прагнучи наблизити його до Astra за нижчою ціною. Його ідентифікатор моделі API — gpt-6.1-sol, контекстне вікно має 1 050 000 токенів, а максимальна кількість вихідних токенів — 128 000. Дивіться офіційну документацію моделі GPT-6.1 Sol.

Для моєї роботи це підказує три корисні напрямки для початку:

Завдання в репозиторіях: обмежена функція, виправлення регресії або написання тестів із чітким визначенням готовності.
Повторювані агентні процеси: дослідження, виклики інструментів і перевірки, де для мене важлива вартість багатьох запусків.
Робота з великою кількістю документів: пошук доказів у файлах і підготовка відповіді, яку можна перевірити за оригіналами.

Це кандидати для оцінювання, а не обіцянки, що модель виконуватиме такі завдання без нагляду. Я все одно залишив би операції запису у production за схваленням і вимагав би від агента показувати свої докази.

Це продовжує те саме практичне питання, яке я порушував у своєму огляді GPT-6 Astra: чи допомагає модель завершити роботу після підключення до наявної системи?

Ціна GPT-6.1 Sol проти Claude Opus 5.5

Стандартне порівняння API є простим. Це ціни в USD за мільйон токенів без урахування інструментів, записів у кеш, надбавок за швидкість або регіональних коефіцієнтів.

Тип токенівGPT-6.1 SolClaude Opus 5.5
------:---:
Вхідні$2.00$4.00
Кешовані вхідні$0.10$0.20
Вихідні$10.00$20.00

Джерела: ціни OpenAI API і ціни Claude Platform.

Стандартні ціни вхідних і вихідних токенів API для GPT-6.1 Sol і Claude Opus 5.5
Стандартні ціни вхідних і вихідних токенів API для GPT-6.1 Sol і Claude Opus 5.5

*Стандартні тарифи для короткого контексту. Таблиця містить кешовані читання; на діаграмі показано звичайні ціни вхідних і вихідних токенів.*

У цих категоріях Sol коштує вдвічі дешевше за токен. Але це не означає, що кожне завершене завдання коштуватиме вдвічі дешевше. Моделі можуть використовувати різний обсяг міркувань, викликати різні інструменти й потребувати різної кількості повторних спроб.

Довгий контекст також змінює порівняння. Sol застосовує вищі тарифи до всього запиту, якщо в одному промпті понад 272 000 вхідних токенів: подвоєну ставку для вхідних і кешованих вхідних токенів та ставку, збільшену в 1,5 раза, для вихідних токенів. Anthropic вказує стандартні ціни для всього контекстного вікна Opus 5.5. Сукупний лічильник токенів тривалої сесії — це не те саме, що один промпт, який перевищує цей поріг.

Для довідки про попередній реліз мій огляд GPT-6 Sol і Luna охоплює попередню лінійку.

Бенчмарки GPT-6.1 Sol: оцінка та вартість разом

AutomationBench: Sol дешевший; Opus досягає вищого результату на максимальному рівні

AutomationBench 1.0.6 тестує наскрізні бізнес-процеси в 47 інструментах. Zapier оцінює кінцевий стан за допомогою детермінованих перевірок, а не просить іншу мовну модель оцінити відповідь.

КонфігураціяОцінкаUSD за спробу виконання завдання
------:---:
Sol 6.1, medium31.7%$0.19
Opus 5.5, medium, стандартні fallback-механізми29.5%$0.65
Sol 6.1, max36.1%$0.30
Opus 5.5, max, стандартні fallback-механізми42.5%$1.44
Оцінки AutomationBench і вартість завдань для GPT-6.1 Sol та Opus 5.5 на середньому й максимальному рівнях зусиль
Оцінки AutomationBench і вартість завдань для GPT-6.1 Sol та Opus 5.5 на середньому й максимальному рівнях зусиль

*Значення з графіків OpenAI, присвячених запуску, з округленням оцінок до одного десяткового знака. Zapier підтверджує результат Opus на максимальному рівні. Конфігурація Opus містить стандартні fallback-механізми; позначення рівня зусиль від постачальників не означають однакових обчислювальних бюджетів.*

На середньому рівні Sol має помірну перевагу за оцінкою та нижчу заявлену вартість завдання. На максимальному рівні Opus має вищу оцінку. Я обирав би між цими компромісами з огляду на ціну помилки процесу, включно з часом, який хтось витрачає на перевірку результату.

Ці витрати охоплюють спроби виконання завдань, зокрема невдалі. Це не ціни за гарантований успішний бізнес-результат.

DeepSWE: корисне покращення порівняно з попереднім Sol

Оцінка програмування та вартість GPT-6.1 Sol у DeepSWE 1.1 порівняно з GPT-6 Sol і GPT-6 Astra на позначених рівнях зусиль
Оцінка програмування та вартість GPT-6.1 Sol у DeepSWE 1.1 порівняно з GPT-6 Sol і GPT-6 Astra на позначених рівнях зусиль

*Вибрані значення DeepSWE 1.1 з тих самих графіків OpenAI, присвячених запуску: Sol 6.1 high — 75.2% за $0.65; попередній Sol max — 68.8% за $2.74; Astra high — 73.2% за $3.92 за завдання. Різні рівні зусиль вказано явно.*

Бенчмарк DeepSWE використовує довгі завдання в репозиторіях і поведінкові верифікатори. OpenAI не включає Opus 5.5 до цього графіка запуску. Я не ставитиму поруч із ним непов’язану оцінку FrontierCode і не робитиму вигляд, що вони вимірюють одне й те саме.

OpenAI поєднує власні оцінювання з публічно оприлюдненими результатами конкурентів. Сприймайте це як опубліковані докази, а не як незалежний очний тест, проведений мною.

Де Claude Opus 5.5 досі важливий

Anthropic позиціонує Opus 5.5 для тривалого програмування та роботи зі знаннями. У звіті про запуск наведено результат 54.6% у FrontierCode v1.1 Main на стандартному середньому рівні зусиль і описано покращення в багатофайловому програмуванні. Ці результати використовують інший бенчмарк, ніж DeepSWE. Anthropic також наводить ранні відгуки партнерів про меншу кількість кроків і токенів, але це все ще атрибутовані відгуки, а не контрольоване порівняння із Sol 6.1. Дивіться анонс Opus 5.5.

Я залишив би Opus у порівнянні для складних змін, рев’ю та візуальної роботи, де ще один прохід може покращити фінальний результат. Я перевірив би цю гіпотезу, а не призначав би моделі постійну спеціалізацію на основі тижня запуску.

Мій матеріал бенчмарки та реакції на Claude Opus 5.5 детальніше розглядає його реліз.

Що кажуть інші користувачі?

Перші реакції неоднозначні. У обговоренні запуску на Reddit деякі користувачі позитивно сприйняли дешевші кешовані читання; інші поставили під сумнів, наскільки модель буде схожою на Astra, і віддали перевагу Claude. Це індивідуальні реакції, а не репрезентативне опитування.

Ще один конкретніший тест трьох моделей від digitalml використовував той самий промпт для кінематографічної сцени Three.js на середньому рівні зусиль. Заявлений час становив 8 хвилин 42 секунди для Sol 6.1, 9 хвилин 37 секунд для Astra та 38 хвилин 54 секунди для Opus 5.5. Автор віддав перевагу кінематографічному результату Opus і повідомив про проблеми з камерою та звуком у версії Sol.

Цей єдиний приклад відображає компроміс, який варто дослідити: швидке завершення може мати значення, але важливими також можуть бути відшліфованість і поведінка після завантаження сторінки. Він не встановлює загального рейтингу швидкості чи якості.

Як я тестуватиму GPT-6.1 Sol

Я дам Sol і Opus те саме завдання, початкові файли, доступ до інструментів і критерії приймання. Я хочу записувати правильність, час виконання, кількість повторних спроб, вартість токенів і обсяг перевірки, який мені все ще потрібно виконати. Швидка відповідь, після якої мені доводиться виправляти регресії, не є дешевим результатом.

Для інтеграцій API Sol потребує Responses API для викликів інструментів; Chat Completions підтримує його без інструментів. Він підтримує низький, середній, високий, xhigh і max рівні зусиль для міркувань, причому середній є стандартним. Наведена вище документація моделі визначає ці обмеження.

Моя практична відправна точка — середній рівень, чітко окреслений опис і виконувані перевірки. Я підвищуватиму рівень зусиль, коли цього потребуватиме завдання, а потім порівнюватиму результат. Додаткові міркування мають виправдовувати свій додатковий час і вартість.

Я радий спробувати GPT-6.1 Sol, тому що опубліковане співвідношення ціни та продуктивності виглядає корисним для повторюваної агентної роботи. Opus 5.5 залишається сильною альтернативою. Я вирішу, де саме використовувати кожну модель, після того як отримаю докази із завдань, які мені потрібно завершити.

---

✻