Токени міркування ШІ стають однією з найважливіших частин сучасної продуктивності ШІ.
OpenAI та Anthropic тепер чіткіше демонструють компроміс, ніж раніше. OpenAI має `reasoning.effort`. Anthropic розширив мислення та `budget_tokens`. Обидва контролі вказують на один і той же шаблон: у складних завданнях кращі результати часто приходять від надання моделі більше простору для роздумів.
Це корисно для кодування, досліджень, планування, математики та робочих процесів агентів. Це також означає, що індустрія ШІ переносить більше роботи в час висновків. Більше токенів міркування означає більше часу прискорювача, більше охолодження, більше потужності дата-центрів та більше електрики.
Мій висновок простий: гонка моделей стає гонкою інфраструктури.
Що таке токени міркування ШІ?
Токени міркування ШІ — це токени, які модель витрачає під час роботи над проблемою перед або разом з фінальною відповіддю. Частина цієї роботи може бути прихована від користувача. Ви не завжди бачите текст міркування, але постачальник все ще повинен виконати обчислення.
Документація OpenAI з міркування говорить, що `reasoning.effort` контролює, скільки міркувань виконує модель. Нижчий зусилля сприяє швидкості та меншій кількості токенів. Вищий зусилля може дати більш повні відповіді на складних завданнях. OpenAI також пояснює, що моделі міркування можуть використовувати приховані токени міркування на додаток до вхідних та видимих вихідних токенів.
Anthropic описує той же клас компромісу з розширеним мисленням Claude. Його документація говорить, що `budget_tokens` встановлює максимальну кількість токенів, які Claude може використовувати для внутрішнього міркування. Більші бюджети можуть покращити якість відповідей на складні проблеми, хоча модель може не витратити весь бюджет, а вигоди можуть згладжуватися на вищих діапазонах.
Важливе розрізнення таке: довші фінальні відповіді не є метою. Краще проміжне міркування є метою.
Чому більше токенів можуть дати кращі результати ШІ
Моделі міркування покращуються, коли у них є достатній бюджет для перевірки завдання, тестування можливих відповідей, виправлення помилок та використання інструментів без поспіху. Малий бюджет токенів може працювати для простих запитів. Він часто зазнає невдачі, коли робота має приховані залежності.
Я бачу це найбільш чітко в агентів кодування. Дешевий швидкий прохід може перейменувати змінну або пояснити невелику функцію. Той же режим стикається з труднощами, коли завдання потребує контексту репозиторію, тестів, перевірки в браузері, обмежень розгортання та судження про те, що не чіпати.
Моделі потрібен бюджет, щоб добре виконувати нудні частини:
Цей робочий процес спалює токени. Він також виробляє краще програмне забезпечення, ніж швидка здогадка.
Я писав про це з власного досвіду в агентах коду після 21.54 мільярда токенів→. Корисний урок полягав не в тому, що одна модель вирішує все. Система навколо моделі має значення: контекст, інструменти, перевірка, пам'ять та достатній бюджет для використання.
OpenAI та Anthropic перетворюють обчислення на налаштування продукту
Нові контролі моделей роблять інтелект відчутним для налаштування.
Постачальник тепер може запропонувати різні поведінки з однієї і тієї ж сім'ї моделей: швидка відповідь, збалансована відповідь, глибоке міркування, робота агента з довгим контекстом або використання інструментів з високими зусиллями. Користувач може не піклуватися про внутрішню кількість токенів. Продукт все ще повинен за це платити.
Для розробників це змінює маршрутизацію. Ви не хочете максимального міркування на кожному запиті.
| Тип завдання | Кращий за замовчуванням |
|---|---|
| --- | --- |
| Форматування, витяг, короткі переписи | Низьке зусилля міркування |
| Звичайні дослідження, редагування коду, аналіз підтримки | Середнє зусилля міркування |
| Зміни в коді виробництва, юридичний огляд, фінансова логіка | Високе зусилля міркування |
| Багатоступеневі агенти з інструментами та перевіркою | Розширене мислення або більший бюджет міркування |
Ось де OpenAI та Anthropic зближуються. Вони відкривають різні API та мову продукту, але обидва навчають розробників, що інтелект не є одним фіксованим налаштуванням. Це рішення бюджету.
Також я так думаю про маршрутизацію моделей у таких частинах, як OpenAI GPT-5.6 Sol, Terra та Luna→ та 24 години з Claude Fable 5→. Найкраща модель не завжди є найбільшою моделлю. Найкращий маршрут — це той, що відповідає завданню.
Проблема інфраструктури за токенами міркування
Кожен додатковий токен міркування має десь працювати.
Міжнародне енергетичне агентство оцінює, що дата-центри використовували близько 415 ТВт·год електрики у 2024 році, приблизно 1,5% світового споживання електрики. У своєму базовому сценарії глобальне споживання електрики дата-центрів приблизно подвоюється до близько 945 ТВт·год до 2030 року. МЕА також вказує на прискорені сервери, що керуються ШІ, як на один з ключових факторів майбутнього попиту.
Час — це важка частина. Компанії ШІ можуть швидко випустити оновлення моделі, збільшити обмеження контексту або додати новий режим міркування. Генерація електроенергії, лінії передачі, підстанції, системи охолодження, дозволи на землю та планування води рухаються з іншою швидкістю.
Прогноз Gartner на 2026 рік, про який повідомляє Tom’s Hardware, дає ще один корисний сигнал. Він прогнозує, що глобальне споживання електрики дата-центрів становитиме 565 ТВт·год у 2026 році та понад 1 200 ТВт·год до 2030 року. Він також очікує, що сервери, оптимізовані для ШІ, використовуватимуть 175 ТВт·год у 2026 році, зростаючи з приблизно 95 ТВт·год у 2025 році, і споживатимуть більше електрики, ніж звичайні сервери до 2027 року.
Ці цифри роблять історію токенів фізичною. Більше роздумів означає більше висновків. Більше висновків означає більше GPU, щільніші стійки, охолодження, доступ до мережі та контракти на електроенергію.
Чому дата-центри та електрика стають обмеженням
Публічна розмова про ШІ зосереджується на чіпах. Чіпи важливі, але вони не є єдиним обмеженням.
Масштабні моделі міркування потребують повного набору фізичної інфраструктури:
Модель може бути готова до того, як місцева мережа буде готова. Постачальник може купити GPU, перш ніж зможе живити їх на бажаній щільності. Регіон може залучити інвестиції в дата-центри, а потім зіткнутися з вузькими місцями в передачі.
Ось чому я очікую, що буде побудовано багато нових дата-центрів для ШІ. Я також очікую більше тиску на постачання електрики в регіонах, де концентруються гіпермасштабні кластери ШІ. Обмеження не буде лише в архітектурі моделі. Це буде енергія, охолодження, місцезнаходження та здатність швидко з'єднати все.
Більше токенів міркування не є безкоштовним інтелектом
У цій тенденції є пастка.
Якщо команди почують "більше токенів означає кращі результати", вони будуть надмірно використовувати режими з високими зусиллями. Це робить програми повільнішими та дорожчими. Це також може призвести до гіршого UX. Модель, яка занадто довго думає про просте завдання, здається зламаною.
Практичне правило є більш вузьким: більше бюджету на міркування допомагає, коли завдання має достатню приховану складність.
Добрі кандидати для більших бюджетів на міркування:
Погані кандидати:
Майбутнє не в одній моделі, яка думає якомога важче на кожному запиті. Майбутнє — це системи, які вирішують, коли варто думати важче.
Моя думка
Токени міркування ШІ роблять прихований компроміс видимим.
OpenAI та Anthropic обидва показують користувачам один і той же основний шаблон: складні завдання потребують більше обчислень у час висновків. Розробники відчувають це як зусилля міркування, розширене мислення, вікна контексту, приховані токени та вищі рахунки. Інфраструктурні команди відчувають це як стійки, охолодження, енергію, дозволи та потужність мережі.
Я вважаю, що наступні серйозні продукти ШІ будуть ставитися до бюджету міркування як до обмеженого ресурсу. Вони витратять його там, де помилки дорогі, перевірка має значення або завдання потребує реального планування. Вони уникатимуть марнування його на простих запитах.
Кращий ШІ не прийде лише від більших моделей. Він прийде від кращого розподілу обчислень.
Джерела:
