İçerik hattımın en pahalı kısmı yazmak değil. Karar vermek. TypeSafe Jev tam olarak bu sorun için geliştirildi; bu yüzden bir cümle bile yazamayan bir model üzerinde bir sabah geçirdim.
İçinden geçen her makale bir dizi küçük yargıyı tetikliyor: Bu konu ele alınmaya değer mi, bu bir teknoloji yazısı mı yoksa müzik yazısı mı, taslak editör kontrolünü geçecek kadar iyi mi, bu SEO puanı yeniden yazmayı haklı çıkarıyor mu? Bunların hiçbirinin düzyazıya ihtiyacı yok. Bir switch ifadesinin okuyabileceği bir yanıta ihtiyaçları var. Geçen haftaya kadar böyle bir yanıt almanın tek yolu, bir paragraf üreten, onu JSON içine saran ve ikisi için de ücret alan bir frontier model kiralamaktı.
15 Eylül 2026'da TypeSafe AI adlı bir laboratuvar bu kalıbı ortadan kaldırmak için özel olarak geliştirilmiş bir model yayınladı. TypeSafe Jev bir System One modelidir: hiç metin üretmez ve çıktı fiyatı sıfırken milyon input token başına 0,042 $ ücret alır.
Henüz kendim kullanmadım. Erken erişim bekleme listesinde. Dolayısıyla bu bir saha testi değil. Bu, onu yol haritasına alıp almamaya karar vermeden önce yaptığım araştırma; lansmanın incelemeye dayanan kısımları, dayanmayan kısımları ve hâlihazırda çalıştırdığım sistemlerde gerçekte nereye oturacağı.
TypeSafe gerçekte ne yayınladı
TypeSafe AI, DCVC liderliğinde aldığı 40 milyon dolarlık seed yatırımıyla yaklaşık iki yıllık gizlilik döneminden çıktı. Kurucu ekip Diogo Almeida, Erik Gafni ve Sasha Sheng'den oluşuyor.
Almeida'nın geçmişi, bu lansmanın akışta kaybolmak yerine dikkat çekmesinin nedeni. OpenAI'da çalıştı, InstructGPT makalesinin eşit katkılı baş yazarlarından biriydi ve GPT-4'e katkıda bulundu. Lansman haberlerinin bir kısmı bunu "ChatGPT'nin ortak mucidi" şeklinde basitleştirdi; bu, büyük bir kolektif çabayı tek kişiye indirgeyen bir abartı. Doğru ifade yine de güçlü: konuşma asistanlarının çalışmasını sağlayan talimat izleme araştırmasının geliştirilmesine yardımcı oldu ve şimdi bu yaklaşımın otomasyon için yanlış arayüz olduğunu savunuyor.
Çerçevelediği soru iyi olan kısım: Modeller yıllardır sohbette insanüstü performans gösteriyor, peki tüm otomasyon nerede?
TypeSafe'in yanıtı, darboğazın hiçbir zaman zekâ olmadığı yönünde. Sorun, düzyazıyla yanıt veren bir modelin üzerine yazılım inşa etmenin zahmetli olması. Bir soru sorarsınız, bir dize alırsınız, onu ayrıştırır, doğrular, reddettiği durumu ele alır, önce üç paragraf gerekçe yazdığı durumu ele alır ve ancak bundan sonra dallanırsınız. Yapılandırılmış çıktılar bunu daha az zahmetli hâle getirdi. Ancak alttaki arayüzün hâlâ üretimsel olduğu gerçeğini değiştirmedi.
Jev bunun yerine karar alanından başlıyor. İsimlendirme her iki uçta da bilinçli: "System One", Kahneman'ın hızlı ve sezgisel System 1 düşüncesine bir gönderme; Jev ise maliyetlerin düşmesinin tüketimin artmasına yol açtığını söyleyen paradoksuyla tanınan William Stanley Jevons'ın adından geliyor. TypeSafe, çağrı hacmine ne olmasını beklediğini söylüyor.
Üç temel yapı ve API'nin tamamı bu
Program durumunu ve türlendirilmiş soruları gönderirsiniz. Her biri kalibre edilmiş bir olasılık taşıyan türlendirilmiş yanıtlar alırsınız. Tam olarak üç soru türü vardır.
Choice, Score ve Noul
Choice, bildirilmiş bir kümeden, en fazla 255 seçenek arasından birini seçer ve tüm seçenekler için bir olasılık dağılımının yanı sıra bir güven değeri döndürür.
Score, girdiyi kelimelerle tanımladığınız iki ila on sıralı seviyeden oluşan bir spektrum üzerine yerleştirir. Seviyeler arasında bir noktaya denk gelebilen sürekli bir konum döndürür; dolayısıyla 1,035 geçerli bir yanıttır.
Noul, ikili bir önermeyi değerlendirir ve 0 ile 1 arasında tek bir sayı döndürür: önermenin doğru olma olasılığı. Ayrı bir güven alanı yoktur, çünkü sayı zaten inancı ifade eder.
Gerçek bir çağrı nasıl görünür?
TypeSafe'in Python SDK belgelerinde gösterdiği yapı şöyledir:
python from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
client = TypeSafeClient()
response = client.system_one( state={ "ticket": {"subject": "Duplicate charge", "body": "I was charged twice for order A-104."}, "order": {"id": "A-104", "charges": [{"amount_usd": 49}, {"amount_usd": 49}]}, "refund_policy": "Duplicate charges are eligible for a refund.", }, questions={ "department": Choice( instructions="Which team should handle this", criteria={ "billing": "Payment or subscription issues", "technical": "Bugs or integration problems", "other": "Anything else", }, ), "frustration": Score( instructions="How frustrated the customer appears", criteria=["Calm, just stating facts", "Frustrated but civil", "Very angry"], ), "refund_requested": Noul(instructions="The customer is explicitly asking for a refund"), "policy_supports": Noul(instructions="The stated refund policy covers this situation"), }, )
if response.answers["refund_requested"].noul > 0.7 and response.answers["policy_supports"].noul > 0.8: start_refund_flow("A-104")
Dört yargı, tek istek, tek gidiş-dönüş. Model anlamsal anlayışı sağlar. Politika ise okuyabildiğim, farklarını görebildiğim ve test edebildiğim kodda kalır.
Son kısım mimari argümanın özü ve fiyatlandırmadan daha ilginç. Bir modelden "bu müşteriyi ele almasını" istemek yerine, anlaşılması gerekenleri belirtir ve sonrasında ne olacağını sıradan sürüm kontrolünde tutarsınız.
TypeSafe Jev ne kadar tutuyor?
İnsanların dikkatini çeken sayı bu.
| Boyut | Jev | Frontier LLM'ler |
|---|---|---|
| --- | --- | --- |
| Input fiyatı | 0,042 $ / MTok | 0,20 - 10 $ / MTok |
| Output fiyatı | Ücretsiz | Input'un yaklaşık 5 katı |
| Gecikme (sağlayıcı) | 70 - 500 ms | 3 - 329 sn |
| Bağlam | 64k state + sorular | Yüz binlerce |
| Çıktı biçimi | Türlendirilmiş, sabit şema | Ayrıştırmanız gereken dizeler |
| Güven | Her alan için kalibre edilmiş | Prompt verildiğinde tutarsız |
Output'un ücretsiz olması bir promosyon değil. Otoregresif bir decode döngüsü yok; dolayısıyla ölçülecek bir şey de yok. 0,042 $'ın sürdürülebilir mi yoksa girişim sermayesiyle sübvanse mi edildiği şu anda bilinemez ve TypeSafe bunu kendi lansman yazısında doğrudan söylüyor. Fiyatın yükselmek yerine düşmesini bekliyor; bunun doğru olup olmadığını yalnızca zaman gösterebilir.
Bağlam sınırları bir LLM'den farklı çalışıyor, çünkü state bir kez alınır ve sorular bunun üzerinde paralel olarak çalıştırılır: state ve tüm sorular için toplamda yaklaşık 64k token; state ile en uzun tek soru için yaklaşık 32k. Yalnızca metin ve yapılandırılmış JSON. Görsel, ses veya video yok.
Gecikme iddiası ve birinin gerçekte ölçtüğü şey
TypeSafe uçtan uca 70-500 ms yayınladı. Lansman yazısı, bu çalışmaların ekibin ABD'nin Batı Yakası'ndaki kendi dizüstü bilgisayarlarında yapıldığını dürüstçe belirtiyor; bu, ABD'de barındırılan bir API için en iyi durum.
Classmethod Malaysia'da bir mühendis, bunu gerçek bir yönlendirme göreviyle test etti. Bekleme listesinden çıktı, doğrudan POST https://api.typesafe.ai/v1/systemone çağrısı yaptı ve NVIDIA'nın NeMo Switchyard yönlendirme kurulumundaki sınıflandırıcıyı taklit etmek için Choice kullandı; konuşmaları dört seviyeye ayırdı. Her seviye için on olmak üzere kırk çağrı.
40 çağrının tamamı başarılı oldu. 40'ının tamamı beklenen seviyeyi eşleştirdi. Medyan gecikme 0,64-0,67 saniye oldu. Çağrı başına maliyet: 0,000025-0,000027 $.
Bu, manşetteki 70 ms'den yaklaşık on kat daha yavaş; yine de tüm lansman döngüsündeki en ilginç sonuç. Çünkü yerine geçtiği şey, medyan 2,1 saniyede çalışan bir Gemini 3.5 Flash sınıflandırıcısı veya medyan 7,2 saniyede çalışan bir DeepSeek V4 Flash sınıflandırıcısıydı. Jev, hızlı ve pahalı seçeneğe göre yaklaşık 3 kat, ucuz ve yavaş seçeneğe göre 10 kat daha hızlıydı; üstelik çağrı başına sentin küçük bir kısmına mal oluyordu.
Bu testteki bir ayrıntı hız sayılarından daha değerli. Belirsiz olmayan üç seviyede güven 1,0 olarak döndü. Gerçekten sınırda olan "orta" seviyede ise 0,57-0,67'ye düştü. Model hangi çağrının zor olduğunu biliyordu. Bir sohbet modelinden güvenilir biçimde elde edemeyeceğiniz ve çevresindeki kodu yazma biçiminizi gerçekten değiştiren özellik bu.
Diğer insanlar TypeSafe Jev hakkında ne söylüyor?
Lansman, Hacker News'te 256 yorumluk bir başlık oluşturdu. Bunun yararlı tarafı, neredeyse hiç kimsenin teknolojinin sahte olduğunu savunmaması. Birkaç yorumcu bunu üretime alacağını söyledi. İtirazlar doğrudan pazarlamaya yönelmişti ve herhangi biri bunun üzerine bir yol haritası oluşturmadan önce okunmaya değer.
"Frontier model" çok fazla anlam taşıyor
Jev kod yazamaz, sohbet sürdüremez veya bir cümle üretemez. Onu GPT ya da Claude ile aynı ifadede kullanmak, bağımsız olarak kazanmadığı bir güvenilirliği ödünç alıyor. Bir yorumcu daha dürüst bir başlık önerdi: yapılandırılmış kararlar için hız ve maliyet sınırını ilerletti. Bu gerçek bir başarı. Aynı cümle değil.
"Halüsinasyon yapamaz" ifadesi duyulduğundan daha dar
Hiçbir zaman serbest metin üretmeyen bir modelin bir alıntı veya araç adı uyduramayacağı doğru; TypeSafe'in %0 tür hatası iddiası da ölçümden ziyade yapının sonucu. Ancak üç izin verilen kategoriyle sınırlı bir model yine de yanlış olanı kendinden emin biçimde seçebilir. Ortadan kaldırılan şey hatalı biçimlendirilmiş yanıt; hatalı yargı değil. TypeSafe'in CEO'su da başlıkta bu ayrımı doğrudan kabul etti.
Hız karşılaştırması birebir olmayabilir
70 ms değeri, eşdeğer kısa kararı üretmek üzere kısıtlanmış bir LLM'e karşı değil; şema adları ve biçimlendirme dâhil, yapılandırılmış yanıtın tamamını otoregresif olarak üreten LLM'lere karşı ölçülüyor. Bu metodoloji sorusu henüz çözülmüş değil.
Evals şirket tarafından tasarlanmış
TypeSafe, herkese açık benchmark'ları çalıştırmak yerine yeni bir "workflow eval" biçimi oluşturdu ve modelleri ground truth'a göre değil, GPT-6 Astra ile Fable 5.1'in ortalama tahminine göre puanladı. Şirket kendi sınırlamalarını da belirtiyor: workflow'lar kendi ekibi tarafından oluşturuldu, referans modeller sonuçları OpenAI ve Anthropic yönünde yanlı hâle getiriyor ve rakip LLM'ler TypeSafe'in kendi adaptörü üzerinden çalıştırılıyor. Ayrıca herkese açık leaderboard'ları atlayacağını söyledi; birçok kişi bunu kullanışlı bir kaçış olarak yorumladı.
Bir mimari makalesi yok. Tüm iddianın dayandığı eğitim yöntemi RLCD, yani Reinforcement Learning for Calibrated Decisions, açıklanıyor ancak ayrıntıları paylaşılmıyor. Ödül fonksiyonu yok, kalibrasyon eğrileri yok, bağımsız olarak yeniden üretilebilecek hiçbir şey yok. Anthony Maio'nun belirttiği gibi, kalibrasyon için reinforcement learning kendi başına yeni değil; "Rewarding Doubt" gibi önceki çalışmalar da aynı alanı inceliyor. Yeni olan yöntem değil, paket olabilir.
Çoğu haberin atladığı sayı
TypeSafe'in kendi değerlendirmesinde, güvenlik olayı müdahalesi, agent-trace gözlemlenebilirliği, fatura işleme ve müşteri hizmetlerini kapsayan dört workflow'un içinde doğruluk tablosu gizli.
| Model | Uyum | Vaka başına maliyet | Gecikme |
|---|---|---|---|
| --- | --- | --- | --- |
| Jev | %67,8 | 0,0004 $ | 0,4 sn |
| GPT-5.6 Terra | %67,9 | 0,0304 $ | 10,1 sn |
| Claude Sonnet 5 | %67,8 | daha yüksek | daha yüksek |
| Claude Opus 5 | %73,1 | yayınlanmadı | yayınlanmadı |
| GPT Sol | %74,1 | yayınlanmadı | yayınlanmadı |
Bunu dikkatle okuyun, çünkü her şeyi yeniden çerçeveliyor. Jev, orta seviye frontier modellerle yaklaşık yetmiş altıda bir maliyet ve yirmi beşte bir gecikmeyle aynı seviyede. En üst seviyeye yetişemiyor. Özellikle fatura işlemede fark en büyüktü: Jev %61,8, Sol %79,1.
Dolayısıyla dürüst konumlandırma "frontier zekâ, daha ucuz" değil. "Sonnet sınıfı yargı, her istekte değil bazı isteklerde çağırabileceğiniz bir fiyatla" demek. Bir router, sınıflandırıcı veya ön filtre için bu mükemmel bir takas. Yanlış olmanın pahalı olduğu bir karar içinse Sol'a karşı on iki puanlık fark hikâyenin tamamı.
TypeSafe Jev stack'imde nereye oturuyor?
Bunu hâlihazırda işlettiğim sistemlere karşı çalıştırdığımda üç yer uygun, iki yer uygun değil.
İçerik hattındaki makale kontrolleri
Bu sitenin çok ajanlı pipeline'ını çalıştıran koordinatör, her çalıştırmada bir düzine sınırlı karar veriyor. Teknoloji ve müzik arasındaki kategori ataması şu anda tag dağılımı sezgilerine dayanıyor. Editör, polish ve humanizer geçişlerinin her biri "bu hazır mı?" sorusunun bir versiyonunu yanıtlıyor. Bunlar LLM kostümü giymiş Choice ve Noul soruları. Burada fiyatlandırmadan daha önemli olan kalibrasyon: bir güven puanı, net durumları otomatik olarak geçirmemi ve yalnızca belirsiz olanları daha büyük bir modele yönlendirmemi sağlıyor.
Apify actor'ları
Bunlardan biri mevcut makaleleri SEO kalitesi açısından puanlıyor; burada başa baş noktaya karşı çalışan tek şey API içindeki model harcaması. Frontier modelin aynı işi yapmasına karşı çağrı başına 0,000026 $'lık bir Score primitive'i optimizasyon değil, marj değişimi. Önce bunu ölçer, sonra inanırım.
E-ticaret tarafında müşteri sorusu yönlendirme
Gelen FAQ sorularının bir kategoriye, aciliyet değerlendirmesine ve "insan gerekiyor mu?" bayrağına ihtiyacı var. Üç paralel soru, tek istek, saniyenin altında. Bu, temel kullanım alanı ve lansman demosunun üzerine kurulduğu örnek.
Uymadığı yerler
İki yer var ve ikisi de yargıya değil, katı sınırlara dayanıyor. Mixanalytic ses analizi yapıyor; Jev ise yalnızca metin ve JSON alıyor. Dolayısıyla önce transkripsiyon veya özellik çıkarımı yapılması gerekiyor ve o noktaya gelindiğinde ilginç iş zaten tamamlanmış oluyor. Bir de yazı yazan her şey: makale taslakları, tweet üretimi, çeviriler. Jev tasarım gereği dizeler döndürmüyor. Daha ucuz bir Claude değil, farklı bir bileşen.
Benim koruyacağım ayrım bu. Bu bir model değişimi değil. LLM çağrılarının altında duran, bu çağrıların şu anda gereğinden fazla yetkin olduğu kararları ele alan yeni bir katman.
İlgili okumalar: çok ajanlı code review workflow'um→, bağımsız ajan yargılarını nasıl yapılandırdığımı anlatıyor; Claude Fable 5.1 incelemesi→, bunun karşılaştırıldığı frontier-model fiyatlandırmasını içeriyor; bu actor'ların yayınlandığı build log→ ise ne yaptıkları hakkında bağlam sağlıyor.
TypeSafe Jev ile nasıl başlanır?
Erişim console.typesafe.ai üzerinden veya Vercel AI Gateway aracılığıyla bekleme listesinde. Classmethod mühendisi, kayıt olduktan hemen sonra erişim aldığını bildirdi; dolayısıyla pratikte sıra kısa olabilir.
bash export TYPESAFE_API_KEY="sk-..."
pip install typesafe-sdk # Python 3.10+ npm install @typesafe-ai/sdk # Node 20+
Her iki SDK da TYPESAFE_API_KEY değerini ortamdan okur ve varsayılan olarak jev-latest kullanır. SDK'yı tamamen atlamak isterseniz tek endpoint POST https://api.typesafe.ai/v1/systemone. Console, ticket yönlendirme, özgeçmiş taraması ve destek ajanı denetimleri için hazırlanmış örneklerin bulunduğu bir playground içeriyor.
İlk çağrıdan önce bilinmesi gereken iki şey var; ikisi de ilk 48 saatte yayınlanan pratik rehberden geliyor. Ucuz bir çağrı yapıp ardından devam etmek yerine tüm soruları baştan sorun; çünkü sorular paralel olarak değerlendiriliyor, dolayısıyla onuncu soru token'a mal oluyor ama neredeyse hiç zaman eklemiyor. Ayrıca TypeSafe'in cookbook'u, toplu işlemenin tek tek sormaya göre yaklaşık 12 kat daha ucuz ve 10 kat daha hızlı olduğunu bildiriyor. Bir Choice içine her zaman açık bir other seçeneği ekleyin; böylece model en yakın yanlış seçeneği seçmek yerine hiçbir şeyin uymadığını söyleyebilir.
TypeSafe Jev hakkında karar
Manşet fiyatlandırma, asıl argüman ise mimari. "Frontier model" çerçevesini ve kendi tasarladığı eval'lere dayanan 200 katlık sayıları çıkarınca geriye hâlâ bu çeyrekte AI altyapısı hakkında okuduğum en ilginç şey kalıyor: yazılım içinde sınırlı kararlar veren, buna dürüst belirsizlik ekleyen ve yürütmenin kontrolünü deterministik kodda tutan bir bileşen.
Yapmayacağım şey, kalibrasyonu kanıtlanmış kabul etmek. Önemli olan her iddia — olasılıkların dürüst olduğu, doğruluğun başka birinin alanında da korunduğu, bunların üretim yükünden sağ çıktığı — şu anda erken erişimin ilk haftasındaki bir şirket tarafından, makale veya üçüncü taraf tekrarı olmadan kendi kendine raporlanıyor. Hız ve fiyatı ilk günden doğrulayabilirsiniz. Kalibrasyon için binlerce etiketli sonuç gerekir ve henüz kimse bunları yayınlamadı.
Dolayısıyla: bekleme listesine kayıt, hâlihazırda yüksek hacimde çalıştırdığım bir puanlama görevi ve herhangi bir şey taşınmadan önce kendim yapacağım bir ölçüm. Gerçekten iyi bir fikre sahip, ancak şirket dışından hiç kimsenin kontrol ettiği kanıtları bulunmayan bir haftalık model için doğru heyecan seviyesi bu.
Kaynaklar
Açıklama: 19 Eylül 2026'da kişisel site MCP'im üzerinden Claude Opus 5 ile, TypeSafe lansman yazısı ve biri uygulamalı API ölçümü olmak üzere altı bağımsız yazı temel alınarak araştırıldı ve taslak hâline getirildi. Jev'e erken erişimim yok ve onu ilk elden test ettiğimi iddia etmiyorum. Sağlayıcı tarafından bildirilen rakamlar metin boyunca bu şekilde etiketlendi; buradaki her sayı yukarıdaki kaynaklardan birine dayandırılabilir.
