Найдорожча частина мого контентного конвеєра — не написання тексту. Це ухвалення рішень. Саме для цієї проблеми створили TypeSafe Jev, тому я витратив ранок на модель, яка не може написати жодного речення.
Кожна стаття, що проходить через цей процес, запускає низку невеликих оцінок: чи варта ця тема висвітлення, це технічний допис чи музичний, чи достатньо якісний чернетковий текст, щоб пройти редакторський етап, чи виправдовує SEO-оцінка повторне редагування. Для жодної з них не потрібна проза. Потрібна відповідь, яку може прочитати switch statement. І до минулого тижня єдиним способом отримати її для мене було орендувати frontier-модель, яка генерує абзац, обгортає його в JSON і виставляє рахунок за обидві операції.
15 вересня 2026 року лабораторія під назвою TypeSafe AI випустила модель, спеціально створену для знищення цього шаблону. TypeSafe Jev — це модель System One: вона взагалі не генерує текст і коштує $0.042 за мільйон вхідних токенів, тоді як вихідні дані безкоштовні.
Я ще не мав можливості попрацювати з нею особисто. Ранній доступ надається через список очікування. Тож це не польове тестування. Це дослідження, яке я провів перед рішенням, чи варто додавати її до дорожньої карти, аналіз частин запуску, що витримують перевірку, частин, що її не витримують, і місця, яке вона насправді могла б зайняти в системах, якими я вже користуюся.
Що насправді випустила TypeSafe
TypeSafe AI вийшла приблизно з дворічного stealth-режиму із seed-раундом на $40M під керівництвом DCVC. Команда засновників — Diogo Almeida, Erik Gafni та Sasha Sheng.
Саме досвід Almeida привернув до запуску увагу, замість того щоб він загубився в стрічці. Він працював в OpenAI, був одним із головних авторів із рівним внеском у статтю про InstructGPT і долучався до створення GPT-4. Частина матеріалів про запуск спростила це до формулювання «співвинахідник ChatGPT», що є перебільшенням і зводить масштабну колективну роботу до однієї людини. Точна версія все одно переконлива: він допомагав створювати дослідження з дотримання інструкцій, які зробили розмовних асистентів працездатними, а тепер стверджує, що цей підхід є неправильним інтерфейсом для автоматизації.
Його ключове питання — найкраща частина: моделі вже роками перевершують людей у чаті, тож де вся автоматизація?
Відповідь TypeSafe полягає в тому, що вузьким місцем ніколи не був інтелект. Проблема в тому, що модель, яка відповідає прозою, незручна як основа для програмного забезпечення. Ви ставите запитання, отримуєте рядок, розбираєте його, перевіряєте, обробляєте випадок, коли модель відмовилася, обробляєте випадок, коли вона спочатку написала три абзаци міркувань, і лише після цього переходите до потрібної гілки. Структуровані вихідні дані зробили це менш болісним. Але вони не змінили того факту, що інтерфейс під ними все ще є генеративним.
Jev починає з простору рішень. Назва навмисно має відсилання з обох боків: «System One» — це натяк на швидке, інтуїтивне мислення System 1 за Kahneman, а Jev названо на честь William Stanley Jevons, чий парадокс стверджує, що зниження вартості призводить до зростання споживання. TypeSafe повідомляє, що, на її думку, станеться з кількістю викликів.
Три примітиви — і це весь API
Ви надсилаєте стан програми разом із типізованими запитаннями. У відповідь отримуєте типізовані відповіді, кожна з яких містить калібровану ймовірність. Існує рівно три типи запитань.
Choice, Score і Noul
Choice обирає один варіант із оголошеного набору — до 255 варіантів — і повертає розподіл імовірностей для всіх варіантів, а також значення впевненості.
Score розміщує вхідні дані на спектрі від двох до десяти впорядкованих рівнів, які ви описуєте словами. Він повертає безперервну позицію, яка може опинитися між рівнями, тож 1.035 є допустимою відповіддю.
Noul оцінює бінарне твердження й повертає одне число від 0 до 1: імовірність того, що воно істинне. Окремого поля впевненості немає, оскільки саме це число вже є мірою переконаності.
Як виглядає реальний виклик
Ось форма, яку документує Python SDK TypeSafe:
python from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
client = TypeSafeClient()
response = client.system_one( state={ "ticket": {"subject": "Duplicate charge", "body": "I was charged twice for order A-104."}, "order": {"id": "A-104", "charges": [{"amount_usd": 49}, {"amount_usd": 49}]}, "refund_policy": "Duplicate charges are eligible for a refund.", }, questions={ "department": Choice( instructions="Which team should handle this", criteria={ "billing": "Payment or subscription issues", "technical": "Bugs or integration problems", "other": "Anything else", }, ), "frustration": Score( instructions="How frustrated the customer appears", criteria=["Calm, just stating facts", "Frustrated but civil", "Very angry"], ), "refund_requested": Noul(instructions="The customer is explicitly asking for a refund"), "policy_supports": Noul(instructions="The stated refund policy covers this situation"), }, )
if response.answers["refund_requested"].noul > 0.7 and response.answers["policy_supports"].noul > 0.8: start_refund_flow("A-104")
Чотири оцінки, один запит, один round trip. Модель забезпечує семантичне розуміння. Політика залишається в коді, де я можу її прочитати, порівняти зміни та протестувати.
Саме остання частина є архітектурним аргументом, і вона цікавіша за ціну. Замість того щоб просити модель «обробити цього клієнта», ви визначаєте, що саме потрібно зрозуміти, а подальші дії залишаєте у звичайній системі контролю версій.
Скільки коштує TypeSafe Jev
Саме це число привернуло увагу.
| Параметр | Jev | Frontier LLMs |
|---|---|---|
| --- | --- | --- |
| Ціна вхідних даних | $0.042 / MTok | $0.20 - $10 / MTok |
| Ціна вихідних даних | Безкоштовно | Приблизно у 5 разів вища за вхідні дані |
| Затримка (за даними постачальника) | 70 - 500 мс | 3 - 329 с |
| Контекст | 64k стану + запитання | Сотні тисяч |
| Форма вихідних даних | Типізована, фіксована схема | Рядки, які потрібно розбирати |
| Впевненість | Калібрована, для кожного поля | Непослідовна під час prompting |
Безкоштовні вихідні дані — не рекламна акція. Тут немає авторегресійного циклу декодування, тож немає чого вимірювати. Чи є $0.042 сталою ціною, чи вона субсидується венчурним капіталом, наразі невідомо, і TypeSafe прямо говорить про це у власному дописі про запуск. Компанія очікує, що ціна знижуватиметься, а не зростатиме, але це твердження може перевірити лише час.
Обмеження контексту працюють інакше, ніж у LLM, оскільки стан завантажується один раз, а запитання виконуються паралельно: приблизно 64k токенів для стану й усіх запитань разом, із близько 32k для стану плюс одного найдовшого запитання. Лише текст і структурований JSON. Без зображень, аудіо та відео.
Заява про затримку і те, що насправді виміряли
TypeSafe опублікувала показник 70–500 мс end-to-end. У дописі про запуск чесно зазначено, що ці запуски виконувалися на власних ноутбуках команди на західному узбережжі США, тобто це найкращий сценарій для API, розміщеного у США.
Інженер із Classmethod Malaysia перевірив її на реальному завданні маршрутизації. Він отримав доступ зі списку очікування, напряму викликав POST https://api.typesafe.ai/v1/systemone і використав Choice, щоб відтворити класифікатор у системі маршрутизації NVIDIA NeMo Switchyard, розподіляючи розмови за чотирма рівнями. Сорок викликів, по десять на кожен рівень.
Усі 40 викликів завершилися успішно. Усі 40 збіглися з очікуваним рівнем. Медіанна затримка становила 0.64–0.67 секунди. Вартість одного виклику: $0.000025–$0.000027.
Це приблизно вдесятеро повільніше за заявлені 70 мс, але все одно є найцікавішим результатом усього циклу запуску. Адже Jev замінила класифікатор Gemini 3.5 Flash із медіаною 2.1 секунди або класифікатор DeepSeek V4 Flash із медіаною 7.2 секунди. Jev виявилася приблизно втричі швидшою за швидший і дорожчий варіант та вдесятеро швидшою за дешевший і повільніший, водночас коштуючи частки цента за виклик.
Одна деталь цього тесту важливіша за самі показники швидкості. Для трьох однозначних рівнів впевненість становила 1.0. Для справді прикордонного рівня «medium» вона знизилася до 0.57–0.67. Модель знала, який виклик був складним. Це властивість, яку неможливо надійно отримати від chat-моделі, і саме вона реально змінює спосіб написання навколишнього коду.
Що інші говорять про TypeSafe Jev
Запуск спричинив появу гілки на Hacker News із 256 коментарями. Її корисність у тому, що майже ніхто не стверджував, ніби технологія несправжня. Кілька коментаторів сказали, що готові випустити її у production. Критика була спрямована саме на маркетинг, і її варто прочитати, перш ніж будувати на цьому дорожню карту.
«Frontier-модель» — дуже широке формулювання
Jev не може писати код, підтримувати розмову чи створювати речення. Згадка про неї в одному формулюванні з GPT або Claude позичає авторитет, якого вона самостійно ще не здобула. Один із коментаторів запропонував чесніший заголовок: вона розширила межі швидкості та вартості структурованих рішень. Це реальне досягнення. Але це не те саме твердження.
«Не може галюцинувати» — твердження вужче, ніж здається
Правда, що модель, яка ніколи не генерує довільний текст, не може вигадати цитату чи назву інструмента, а показник TypeSafe у 0% помилок типів випливає з конструкції, а не з вимірювання. Але модель, обмежена трьома дозволеними категоріями, усе одно може впевнено обрати неправильну. Усунено некоректну відповідь, але не помилкове судження. Власний CEO TypeSafe прямо погодився з цим розмежуванням у гілці.
Порівняння швидкості може бути некоректним
Показник 70 мс вимірюють порівняно з LLM, які авторегресійно генерують усю структуровану відповідь, включно з назвами схеми та форматуванням, а не з LLM, обмеженою генерацією еквівалентного короткого рішення. Це методологічне питання досі не вирішене.
Evals розробила сама компанія
TypeSafe створила новий формат «workflow eval» замість запуску публічних бенчмарків і оцінювала моделі порівняно із середнім прогнозом GPT-6 Astra та Fable 5.1, а не з ground truth. Компанія сама вказує на обмеження: workflow створила її власна команда, референсні моделі зміщують результати в бік OpenAI та Anthropic, а конкуруючі LLM працюють через власний адаптер TypeSafe. Також компанія заявила, що не публікуватиме відкриті таблиці лідерів, що кілька людей сприйняли як зручне рішення.
Архітектурної статті немає. RLCD, або Reinforcement Learning for Calibrated Decisions, — це метод навчання, на якому ґрунтується весь підхід, і його описано, але не розкрито. Немає функції винагороди, калібрувальних кривих — нічого, що можна було б незалежно відтворити. Як зазначив Anthony Maio, reinforcement learning для калібрування також не є новим сам по собі; попередні роботи на кшталт «Rewarding Doubt» досліджують той самий напрям. Новизна може бути в комплексному рішенні, а не обов’язково в самому методі.
Число, яке пропустила більшість матеріалів
У власній оцінці TypeSafe, що охоплює чотири workflow — реагування на інциденти безпеки, observability трас агентів, обробку рахунків і обслуговування клієнтів, — захована картина точності.
| Модель | Збіг | Вартість / випадок | Затримка |
|---|---|---|---|
| --- | --- | --- | --- |
| Jev | 67.8% | $0.0004 | 0.4 с |
| GPT-5.6 Terra | 67.9% | $0.0304 | 10.1 с |
| Claude Sonnet 5 | 67.8% | вища | вища |
| Claude Opus 5 | 73.1% | не опубліковано | не опубліковано |
| GPT Sol | 74.1% | не опубліковано | не опубліковано |
Уважно прочитайте це, адже воно змінює всю картину. Jev відповідає моделям frontier-середнього рівня приблизно за одну сімдесят шосту вартості та одну двадцять п’яту затримки. Але вона не відповідає найвищому рівню. Саме в обробці рахунків розрив був найбільшим: Jev — 61.8% проти 79.1% у Sol.
Тож чесне позиціонування звучить не як «інтелект frontier-рівня дешевше». Воно звучить як «судження рівня Sonnet за ціною, за якої можна викликати модель для кожного запиту, а не лише для частини з них». Для маршрутизатора, класифікатора або pre-filter це чудовий компроміс. Для рішення, помилка в якому дорого коштує, дванадцятивідсотковий розрив із Sol — це вся історія.
Де TypeSafe Jev вписується в мій стек
Якщо перевірити її на системах, якими я вже керую, три місця підходять, а два — ні.
Етапи перевірки статей у контентному конвеєрі
Координатор, який запускає мультиагентний конвеєр цього сайту, ухвалює близько десятка обмежених рішень за один запуск. Присвоєння категорії між технікою та музикою зараз базується на евристиках розподілу тегів. Етапи редактури, полірування та humanizer кожен відповідає на варіацію запитання «чи готовий цей текст». Це запитання Choice і Noul, замасковані під LLM. Тут калібрування важливіше за ціну: показник впевненості дає змогу автоматично пропускати очевидні випадки й передавати лише неоднозначні більшій моделі.
Актори Apify
Один із них оцінює наявні статті за якістю SEO, що буквально є завданням оцінювання, і єдине, що впливає на беззбитковість, — витрати на модель усередині API. Примітив Score за $0.000026 за виклик порівняно з frontier-моделлю, яка виконує ту саму роботу, змінює маржу, а не просто оптимізує процес. Саме це я виміряв би першим, а повірив би — другим.
Маршрутизація запитань клієнтів в e-commerce
Вхідним запитанням у FAQ потрібні категорія, оцінка терміновості та прапорець «чи потрібна тут людина». Три паралельні запитання, один запит, менше секунди. Це канонічний сценарій використання і той, навколо якого побудовано демонстрацію запуску.
Де вона не підходить
Є два місця, і в обох йдеться про жорсткі обмеження, а не про суб’єктивні рішення. Mixanalytic — це аналіз аудіо, а Jev приймає лише текст і JSON, тож спочатку потрібно виконати транскрипцію або вилучення ознак, і до того моменту найцікавіша робота вже буде зроблена. Також вона не підходить для всього, що пише: чернеток статей, генерації твітів, перекладів. Jev навмисно не повертає рядки. Це не дешевший Claude, а інший компонент.
Саме це розмежування я б запам’ятав. Це не заміна моделі. Це новий рівень, який розташовується під викликами LLM і обробляє рішення, для яких ці виклики наразі надмірно потужні.
Пов’язані матеріали: мій workflow мультиагентного code review→ описує, як я структурую незалежні оцінки агентів, огляд Claude Fable 5.1→ містить ціни frontier-моделей, із якими це порівнюють, а журнал розробки, де ці актори були випущені→ дає контекст щодо їхньої роботи.
Як почати роботу з TypeSafe Jev
Доступ надається через список очікування на console.typesafe.ai або через Vercel AI Gateway. Інженер Classmethod повідомив, що отримав доступ одразу після реєстрації, тож на практиці черга може бути короткою.
bash export TYPESAFE_API_KEY="sk-..."
pip install typesafe-sdk # Python 3.10+ npm install @typesafe-ai/sdk # Node 20+
Обидва SDK читають TYPESAFE_API_KEY із середовища та за замовчуванням використовують jev-latest. Якщо ви хочете повністю обійти SDK, існує один endpoint: POST https://api.typesafe.ai/v1/systemone. У консолі є playground із готовими прикладами маршрутизації тікетів, відбору резюме та аудитів support-агентів.
Перед першим викликом варто знати дві речі — обидві взяті з практичного посібника, опублікованого протягом перших 48 годин. Ставте всі запитання одразу, а не робіть дешевий виклик із подальшим уточненням, оскільки запитання оцінюються паралельно: десяте запитання збільшує кількість токенів, але майже не впливає на час. У cookbook TypeSafe зазначено, що пакетна обробка приблизно у 12 разів дешевша й у 10 разів швидша за послідовне надсилання запитань. Також завжди додавайте явний варіант other у Choice, щоб модель могла сказати, що жоден варіант не підходить, замість того щоб обрати найближчий неправильний.
Вердикт щодо TypeSafe Jev
Ціна — це заголовок, а архітектура — справжній аргумент. Якщо відкинути формулювання «frontier-модель» і показники у 200 разів, побудовані на власних evals, залишиться все одно найцікавіше, що я прочитав про AI-інфраструктуру цього кварталу: компонент, який ухвалює обмежені рішення всередині програмного забезпечення, додає до них чесну невизначеність, а детермінований код зберігає контроль над виконанням.
Я не став би вважати калібрування доведеним. Кожне важливе твердження — що ймовірності є чесними, що точність зберігається в чужій предметній області, що все це витримує production-навантаження — наразі самостійно повідомляється компанією, яка лише тиждень перебуває на етапі раннього доступу, без статті та незалежного відтворення. Швидкість і ціну можна перевірити в перший день. Калібрування потребує тисяч розмічених результатів, а їх поки ніхто не опублікував.
Отже: реєстрація у списку очікування, завдання оцінювання, яке я вже виконую у великому обсязі, і власне вимірювання перед будь-яким переходом. Це правильний рівень ентузіазму щодо моделі, якій лише тиждень, яка має справді хорошу ідею, але не має жодних підтверджень, перевірених кимось за межами компанії.
Джерела
Розкриття інформації: досліджено й підготовлено за допомогою Claude Opus 5 через MCP мого персонального сайту 19 вересня 2026 року на основі допису TypeSafe про запуск і шести незалежних матеріалів, включно з одним практичним вимірюванням API. Я не маю раннього доступу до Jev і не заявляю про власне тестування. Дані, повідомлені постачальником, позначені як такі в усьому тексті; кожне число тут можна пов’язати з одним із наведених вище джерел.
