Anthropic випустила Claude Fable 5.1 учора, 1 вересня 2026 року, і я провів вечір, запускаючи його у власному стеку, замість того щоб просто читати про нього. Коротко: та сама ціна, що й у Fable 5, витрати на читання кешу скорочено на 75%, менше хибних відмов і модель, яка зберігає узгодженість протягом тригодинної сесії непримітної інфраструктурної роботи.
Fable 5 була найкращою моделлю, якою я користувався, і водночас тією, на яку люди скаржилися найбільше. Я писав про перебудову за день запуску, яку вона виконала для застарілої CRM→, а також про паузу через експортний контроль і повернення моделі→. Випуск із номером після крапки — це відповідь Anthropic на список скарг. Тож питання щодо 5.1 вузьке: чи виправили вони те, що заважало, і чи змінилася ціна.
Що змінилося в Claude Fable 5.1
Згідно з оголошенням Anthropic, ціна за токени не змінилася: $10 за мільйон вхідних токенів і $50 за мільйон вихідних. Зміни стосуються читання кешу: $0.25 за мільйон, що на 75% менше. Anthropic оцінює, що це робить типові робочі навантаження приблизно на 25% дешевшими, а високоагентні — до приблизно 45% дешевшими, оскільки агентські цикли повторно надсилають той самий контекст на кожному кроці.
Другий важіль — effort. Anthropic стверджує, що Fable 5.1 на низькому або середньому рівні effort відповідає Fable 5 або перевершує її за значно нижчої вартості. Для оператора це важливіше. Більшість того, що агент робить протягом дня, є рутинним, а оплата за цінами `xhigh` для рутинної роботи була головною причиною, чому рахунки за Fable 5 виходили з-під контролю.
Змінилися й запобіжні механізми. Запобіжні механізми кібербезпеки блокують на 60% менше хибнопозитивних випадків за сесію, запобіжні механізми біології спрацьовують на 85% рідше для нешкідливих біологічних і медичних запитань, а Fable 5.1 тепер може виявляти вразливості програмного забезпечення для захисної роботи, хоча не може писати експлойти. Mythos 5.1 — це та сама модель із меншою кількістю запобіжних механізмів, наразі доступна лише певному набору організацій у США: на ній побудована Life Sciences Verification Program, тоді як Cyber Verification Program досі працює з моделями класу Opus і Sonnet та має додати моделі класу Mythos «у найближчому майбутньому».
Поведінкові нотатки — це те, що мене цікавить. Anthropic стверджує, що 5.1 уникає скорочених шляхів, які призводять до гіршої роботи, краще аналізує першопричини й зберігає узгодженість у довгих багатокрокових завданнях. Їхній головний приклад — Millennium: збій, який траплявся приблизно в одному запуску з мільйона і роками залишався без пояснення. Fable 5.1 розібрала бібліотеку постачальника, зіставила її з дампом ядра й простежила помилку до цієї бібліотеки.
Доступність — негайна: `claude-fable-5-1` в API, claude.ai, Amazon Bedrock, Google Cloud's Agent Platform і Microsoft Foundry.
Бенчмарки Fable 5.1 у порівнянні з Fable 5, Opus 5 і GPT-5.6 Sol
Власна таблиця Anthropic. Дані надані постачальником, тож сприймайте відмінності як орієнтовні, доки незалежні рейтинги не наздоженуть.
| Бенчмарк | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| --- | --- | --- | --- | --- |
| Terminal-Bench 4.0 (агентське програмування) | 55.8% | 42.0% | 52.3% | 37.3% |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| AutomationBench (бізнес-процеси) | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| GDPval-AA v2 (інтелектуальна робота) | 1853 | 1723 | 1824 | 1711 |
| Humanity's Last Exam (без інструментів) | 60.9% | 57.8% | 56.6% | – |
| OSWorld 2.0 (суворий режим) | 41.7% | 36.1% | 39.6% | – |
Впадають в око дві речі. Terminal-Bench-Science, Terminal-Bench 4.0 і AutomationBench — це тести агентів на довгих горизонтах, і саме вони змінилися найбільше: науковий бенчмарк зріс більш ніж удвічі, з 24.7% до 52.6%, а два інші додали приблизно по 14 пунктів. І Opus 5, до якої багато хто повертався, коли Fable 5 ставала дорогою або впертою, тепер явно відстає на тих самих завданнях. Cognition повідомила, що в день запуску переводить трафік Devin з Opus 5 на Fable 5.1, і назвала ціни на читання кешу причиною, чому модель класу Fable тепер доступна їм за ціною.
Одне застереження з іншого боку барикад: на OpenAI's Agents' Last Exam GPT-5.6 Sol→ випередила Fable 5 на 13.1 пункту, а за середнього рівня міркування все ще лідирувала на 11.4 пункту при приблизно чверті розрахункової вартості. Anthropic не опублікувала показник 5.1 для цього бенчмарку. Sol усе ще коштує вдвічі дешевше за токен: $5 за вхідні й $30 за вихідні, тож цінова перевага 5.1 ґрунтується на читанні кешу та низькому effort, а не на прайсовій ціні.
Список скарг, для якого створювали 5.1
Негативна реакція на Fable 5 мала послідовну структуру. П’ятигодинний ліміт використання у вебзастосунку. Класифікатори безпеки, які непомітно передавали вашу розмову до Opus 4.8. Високе споживання токенів, зокрема широко поширений звіт про $110, витрачені за день. Лінощі наприкінці довгих завдань, багатослівність, уповільнення посеред запуску й час до першого токена понад хвилину для складних запитів. Фраза «Ferrari з обмежувачем на 30 миль/год» запам’яталася найбільше. Opus 5 теж отримала власну порцію скарг, а Thariq, який працює над Claude Code в Anthropic, погодився в X, що це «справді дуже нерівна модель» і що її виправлення — «величезний пріоритет для нас».
Під час поетапного розгортання в останній тиждень серпня тестувальники, яких спрямували на нову контрольну точку, повідомляли про краще міркування в довгих ланцюжках, відсутність забування попередніх умов посеред завдання, а також краще використання інструментів і планування кроків. Деякі тестувальники оцінювали покращення результатів у юридичній роботі на 10–20%. Єдине місце, де модель стала суворішою: вона відмовляється генерувати зображення, що містять матеріали, захищені авторським правом.
Це відповідає офіційному позиціонуванню. Менше хибних відмов, менше лінощів, нижча вартість виконаного завдання. Ліміт використання у споживчому застосунку — це єдиний пункт, щодо якого я не бачив відповіді.
Що потрібно змінити розробникам
Якщо ви викликаєте API безпосередньо, у Fable 5.1 є кілька гострих кутів, яких не було у Fable 5, згідно з посібником Anthropic з міграції:
У Claude Code жоден із цих моментів мені не завадив, оскільки він обробляє їх за вас. Вони завадять усім, хто має власний агентський цикл із примусовими викликами інструментів.
Вечір із Fable 5.1 у моєму власному стеку
Бенчмарки вимірюють модель на чужих проблемах. Моїми проблемами минулої ночі були три години роботи, яка заповнює вечір оператора: зламаний інструмент, дві міграції бази даних, два деплої й віджет, який ніколи не підключали до Spotify. Fable 5.1 у Claude Code виконала все це, а я перевіряв роботу в процесі.
Зламаний інструмент. MCP-сервер мого сайту має інструмент `search_console`, який тижнями повертав Unauthorized. Причина була на два рівні глибше. Процес, що обслуговував виклики моїх інструментів, був не тим, який визначено в MCP-конфігурації репозиторію; Claude Desktop запускав другий процес через shell-скрипт, який ніколи не отримував правильний ключ. А production досі працював зі старішим правилом автентифікації, оскільки робоче дерево з 48 файлами з новим правилом ніколи не було закомічене. Таблиця процесів показувала нерозгорнутий заповнювач там, де мав бути ключ, і модель відмовилася вгадувати. Вона знайшла процес, який обслуговував мої виклики, вибірково перевіряючи TCP-з’єднання з моїм доменом під час виклику інструмента, потім під’єднала Node inspector до процесу, запущеного конфігурацією репозиторію, і підтвердила, що заповнювач справжній. Виправленням став один прапорець Node у двох файлах.
Міграції. Конектор Supabase MCP повертав permission denied для DDL. Supabase CLI не зміг обробити мій `.env.local`. Vercel env pull повернув заповнювачі `[SENSITIVE]` замість рядків підключення, і модель ненадовго записала ці заповнювачі у мій env-файл, перш ніж помітити це й скасувати зміни. Запуск пов’язаного проєкту із symlinked-директорії не міг знайти ref проєкту. Чотири тупикові шляхи, але міграції все одно було виконано. Я спостерігав, як попередні моделі зациклювалися на першому невдалому маршруті; ця продовжувала змінювати підхід.
Деплой. Сімдесят файлів, дві міграції, три нові змінні Vercel, збірка, push, production-деплой і перевірка стану деплою та зачеплених endpoint'ів, включно з негативним випадком: застарілий ключ тепер правильно отримує 401 на маршруті лише для власника.
Віджет. У дереві існував футер-віджет Spotify із позначкою «зараз відтворюється», але крок OAuth ніколи не виконувався; redirect URI навіть не було зареєстровано в панелі Spotify. Fable 5.1 провела мене через налаштування OAuth, протестувала маршрут локально, а потім запустила 18-агентну змагальну перевірку функції: троє рев’юерів із різними підходами, а кожне зауваження передавалося окремому агенту, завданням якого було його спростувати. У роботу потрапило 15 знахідок, 5 пережили перевірку. Вони були реальними: контраст тексту виконавця 2.04:1 замість вимоги 4.5:1, фізичні відступи, які ламали pill на моєму Arabic-маршруті, відсутні тайм-аути fetch, необроблена помилка upstream, яка проявилася б як некешований 500, і refresh token, який сплив би через шість місяців і непомітно зник. Вона виправила всі п’ять, виміряла контраст і RTL-відступи в браузері та виконала деплой. Я навмисно не залишив refresh token у production, тож віджет там залишається прихованим. Коли я попросив про це, модель записала стан, щоб наступна сесія знала, що працює. Дев’ять хвилин на перевірку, близько 1.65 мільйона токенів для 18 агентів.
А тепер — неприємні факти. Двічі того вечора вона вивела секрет у результат інструмента: одного разу мій Spotify client secret, іншого — короткоживучий access token, через помилку shell-розгортання під час перевірки, чи встановлено змінні. Вона помітила обидва випадки, повідомила мені про них і сказала змінити секрет. Також вона витратила майже годину на з’ясування, який процес обслуговував мої MCP-виклики, перш ніж зупинитися на виправленні у два рядки. Ця година була наслідком того, що модель відмовлялася приймати докази, які суперечили одне одному, — саме такої поведінки я хочу, але це все одно година.
З якою моделлю її порівнювати
Спочатку порівнюйте її з Fable 5. Випуск із номером після крапки — це ремонт, тож перевірка полягає в тому, чи спрацювали виправлення. Того вечора: жодних лінощів наприкінці сесії, модель утримувала контекст протягом трьох годин, двох деплоїв і 18-агентної перевірки. Відмови я не рахував, а один вечір — не вибірка. Зниження вартості я теж не вимірював; воно ґрунтується на ціні читання кешу Anthropic і налаштуванні effort, а я не відстежував ні те, ні інше.
Потім порівнюйте її з GPT-5.6 Sol. Sol коштує вдвічі дешевше за прайсовою ціною й досі лідирує за показником агентської роботи на довгому горизонті у власному бенчмарку OpenAI. Якщо ваше робоче навантаження велике, а помилки не критичні, Sol залишається дешевшим варіантом. Якщо ж це робота, де один неправильний короткий шлях може коштувати вам дня, я доручив би її Fable 5.1.
Поки що не порівнюйте її з Gemini. Флагманом Google досі є Gemini 3.1 Pro, і свіжих показників немає. А за OpenAI's Astra, про яку ходять чутки на першу половину вересня, варто стежити. Якщо вона вийде, цей пост буде оновлено.
Розкриття інформації в дусі цього блогу: Fable 5.1 підготувала цей пост у тій самій сесії, яку він описує, використовуючи джерела дня та власний журнал інструментів. Я перевірив кожне твердження й кожне число.
