Anthropic dün, 1 Eylül 2026'da Claude Fable 5.1'i yayınladı ve ben de hakkında okumak yerine akşamı kendi stack'imde çalıştırarak geçirdim. Kısa versiyon: Fable 5 ile aynı fiyat, cache okumalarında %75 düşüş, daha az hatalı ret ve üç saatlik sıradan altyapı çalışması boyunca tutarlılığını koruyan bir model.
Fable 5, kullandığım en iyi modeldi ve aynı zamanda insanların en çok şikâyet ettiği modeldi. Eski bir CRM üzerinde yaptığı lansman günü yeniden kurulumunu→ ve ihracat kontrolü arasından verilen arayı ve geri dönüşünü→ yazmıştım. Bir point release, Anthropic'in şikâyet listesine verdiği yanıttır. Dolayısıyla 5.1 için soru dar kapsamlı: Can acıtan şeyleri düzelttiler mi ve fiyat değişti mi?
Claude Fable 5.1'de neler değişti
Anthropic'in duyurusuna göre token başına fiyat değişmedi: bir milyon input token için $10 ve bir milyon output token için $50. Değişen şey cache okumaları: bir milyon başına $0.25, yani %75 düşüş. Anthropic bunun tipik iş yüklerini yaklaşık %25, yoğun agentic iş yüklerini ise yaklaşık %45 daha ucuz hâle getireceğini tahmin ediyor; çünkü agent döngüleri her turda aynı bağlamı yeniden gönderiyor.
İkinci kaldıraç effort. Anthropic, düşük veya orta effort seviyesinde Fable 5.1'in çok daha düşük maliyetle Fable 5'e yetiştiğini veya onu geçtiğini söylüyor. Bir operatör için asıl önemli nokta bu. Bir agent'ın gün içinde yaptığı işlerin çoğu rutin ve rutin işler için `xhigh` fiyatları ödemek, Fable 5 faturalarının kontrolden çıkmasının başlıca nedeniydi.
Safeguards da değişti. Cybersecurity safeguards, oturum başına %60 daha az hatalı pozitif engelliyor; biology safeguards, zararsız biyoloji ve tıp sorularında %85 daha az tetikleniyor; Fable 5.1 artık savunma amaçlı çalışmalar için yazılım açıklarını tespit edebiliyor, ancak exploit yazamıyor. Mythos 5.1, daha az safeguard içeren aynı model ve şimdilik yalnızca bir grup ABD kuruluşuyla sınırlı: Life Sciences Verification Program bunun etrafında kurulmuş durumda; Cyber Verification Program ise hâlâ Opus- ve Sonnet-class modellerle çalışıyor ve "yakın gelecekte" Mythos-class modelleri eklemesi planlanıyor.
Benim önemsediğim davranışsal notlar bunlar. Anthropic, 5.1'in daha düşük kaliteli iş üreten kestirme yollarından kaçındığını, kök neden analizini daha iyi yaptığını ve uzun, çok adımlı görevlerde tutarlılığını koruduğunu iddia ediyor. Öne çıkardıkları örnek Millennium: yaklaşık milyonda bir çalıştırmayı etkileyen ve yıllardır açıklanamayan bir crash. Fable 5.1 bir vendor library'yi parçalara ayırdı, onu bir core dump ile eşleştirdi ve hatayı bu library'nin içine kadar izledi.
Kullanıma sunulması hemen gerçekleşti: API'de `claude-fable-5-1`, claude.ai, Amazon Bedrock, Google Cloud's Agent Platform ve Microsoft Foundry.
Fable 5.1'in Fable 5, Opus 5 ve GPT-5.6 Sol karşısındaki benchmark'ları
Anthropic'in kendi tablosu. Vendor tarafından raporlandığı için bağımsız leaderboard'lar yetişene kadar farkları yön gösterici olarak değerlendirin.
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| --- | --- | --- | --- | --- |
| Terminal-Bench 4.0 (agentic coding) | 55.8% | 42.0% | 52.3% | 37.3% |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| AutomationBench (business workflows) | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| GDPval-AA v2 (knowledge work) | 1853 | 1723 | 1824 | 1711 |
| Humanity's Last Exam (no tools) | 60.9% | 57.8% | 56.6% | – |
| OSWorld 2.0 (strict) | 41.7% | 36.1% | 39.6% | – |
İki şey öne çıkıyor. Terminal-Bench-Science, Terminal-Bench 4.0 ve AutomationBench uzun vadeli agent testleri ve en büyük hareket bu testlerde görüldü: science benchmark'ı %24.7'den %52.6'ya çıkarak iki kattan fazla arttı, diğer ikisi de yaklaşık 14 puan kazandı. Fable 5 pahalılaştığında veya inatçılaştığında birçok kişinin yöneldiği Opus 5 ise artık aynı görevlerde belirgin biçimde geride. Cognition, lansman günü Devin'in Opus 5 trafiğini Fable 5.1'e taşıdığını söyledi ve cache fiyatlandırmasını, Fable-class bir modelin artık kendileri için karşılanabilir olmasının nedeni olarak gösterdi.
Diğer taraftan bir uyarı: OpenAI's Agents' Last Exam'de GPT-5.6 Sol→, Fable 5'i 13.1 puanla geçti; medium reasoning seviyesinde de tahmini maliyetin yaklaşık dörtte birinde 11.4 puanlık üstünlüğünü korudu. Anthropic bu benchmark için 5.1 sonucu yayımlamadı. Sol, token başına hâlâ yarı fiyatında: input için $5, output için $30. Dolayısıyla 5.1'in fiyat argümanı liste fiyatına değil, cache okumalarına ve düşük effort seviyesine dayanıyor.
5.1'in çözmek için tasarlandığı şikâyet listesi
Fable 5 tepkisinin şekli tutarlıydı. Web app'te beş saatlik kullanım sınırı. Konuşmanızı sessizce Opus 4.8'e yönlendiren safety classifier'lar. Ağır token tüketimi; bir günde $110 harcandığını bildiren ve geniş çapta paylaşılan bir rapor vardı. Uzun görevlerin ilerleyen bölümlerinde tembellik, gereksiz ayrıntı, yavaşlamalar ve zor prompt'larda bir dakikayı aşan time-to-first-token. Akılda kalan ifade "30 mph sınırlayıcısı olan bir Ferrari" idi. Opus 5 de kendi şikâyetlerini aldı ve Anthropic'te Claude Code üzerinde çalışan Thariq, X'te bunun "gerçekten sivri uçlu bir model" olduğunu ve düzeltmenin "bizim için büyük bir öncelik" olduğunu kabul etti.
Ağustos'un son haftasındaki grayscale rollout sırasında yeni checkpoint'e yönlendirilen tester'lar daha iyi long-chain reasoning, görevin ortasında precondition'ları unutmama ve daha iyi tool kullanımı ile adım planlaması bildirdi. Bazı tester'lar legal work'te %10 ila %20 daha iyi sonuçlar tahmin etti. Daha katılaştığı tek alan: copyrighted material içeren görseller üretmeyi reddediyor.
Bu, resmi çerçevelemeyle örtüşüyor. Daha az hatalı ret, daha az tembellik, tamamlanan görev başına daha düşük maliyet. Consumer app'teki kullanım sınırı ise ele alındığını görmediğim madde.
Builder'ların değiştirmesi gerekenler
API'yi doğrudan çağırıyorsanız, Anthropic'in migration guide'ına göre Fable 5.1'in Fable 5'te bulunmayan birkaç keskin kenarı var:
Bunların hiçbiri Claude Code'da beni etkilemedi; çünkü bunları sizin için yönetiyor. Tool çağrılarını zorlayan, elle yazılmış bir agent loop kullanan herkes için sorun çıkarabilirler.
Kendi stack'imde Fable 5.1 ile geçirdiğim bir akşam
Benchmark'lar modeli başkasının problemleri üzerinde ölçer. Benim dün geceki problemlerim ise bir operatörün akşamını dolduran türdendi: bozuk bir tool, iki database migration, iki deploy ve hiç Spotify'a bağlanmamış bir widget. Claude Code'daki Fable 5.1 bunların hepsini yaptı ve ben ilerledikçe gözden geçirdim.
Bozuk tool. Sitemin MCP server'ında haftalardır Unauthorized döndüren bir `search_console` tool'u var. Neden iki katman derindeydi. Tool çağrılarımı sunan process, repo'nun MCP config'inde tanımlanan process değildi; Claude Desktop, doğru key'i hiç almayan bir shell script üzerinden ikinci bir process başlatmıştı. Ayrıca production hâlâ daha eski bir auth rule çalıştırıyordu; çünkü yenisini içeren 48 dosyalık working tree hiç commit edilmemişti. Process table, key'in olması gereken yerde açılmamış bir placeholder gösterdi ve model tahminde bulunmayı reddetti. Bir tool çağrısı sırasında domain'ime yapılan TCP bağlantılarını örnekleyerek çağrılarımı sunan process'i buldu, ardından repo config'in başlattığı process'e Node's inspector bağladı ve placeholder'ın gerçek olduğunu doğruladı. Çözüm, iki dosyada tek bir Node flag'iydi.
Migration'lar. Supabase MCP connector, DDL için permission denied döndürdü. Supabase CLI, `.env.local` dosyamda takıldı. Bir Vercel env pull, connection string'ler yerine `[SENSITIVE]` placeholder'ları döndürdü ve model bunları fark edip geri almadan önce kısa süreliğine env dosyama yazdı. Symlink'li bir directory'den yapılan linked-project çalıştırması project ref'i bulamadı. Dört çıkmaz ve yine de migration'ları tamamladı. Önceki modellerin ilk başarısız rotada döngüye girdiğini gördüm; bu model yaklaşımını değiştirmeye devam etti.
Deploy. Yetmiş dosya, iki migration, üç yeni Vercel variable, bir build, bir push, bir production deploy ve deployment state ile etkilenen endpoint'lerin doğrulanması; buna negative case de dâhil: legacy key artık owner-only route'ta doğru şekilde 401 döndürüyor.
Widget. Bir Spotify now-playing footer widget'ı tree'de vardı, ancak OAuth adımı hiç çalıştırılmamıştı; redirect URI Spotify dashboard'unda bile kayıtlı değildi. Fable 5.1 OAuth kurulumunda bana yol gösterdi, route'u local olarak test etti ve ardından feature için 18-agent adversarial review çalıştırdı: farklı bakış açılarına sahip üç reviewer ve her bulgunun onu çürütmekle görevli ayrı bir agent'a verilmesi. 15 bulgu uygulandı, 5'i ayakta kaldı. Hayatta kalanlar gerçekti: artist text'in 4.5:1 gereksinimine karşı 2.04:1 contrast oranı, Arabic route'umda pill'i bozan physical padding, eksik fetch timeout'ları, uncached 500 olarak görünecek yakalanmamış bir upstream error ve altı ay içinde süresi dolacak, sessizce kaybolacak bir refresh token. Beşini de düzeltti, contrast oranını ve RTL padding'i browser'da ölçtü ve deploy etti. Refresh token'ı production'a bilerek koymadım; bu yüzden widget orada gizli kalıyor. Sorduğumda state'i logladı; böylece bir sonraki session neyin live olduğunu biliyor. Review dokuz dakika sürdü; 18 agent boyunca yaklaşık 1.65 milyon token kullanıldı.
Şimdi aleyhindeki kayıtlar. O akşam iki kez bir secret'ı tool output'a yazdırdı: bir kez Spotify client secret'ımı, bir kez de variable'ların ayarlanıp ayarlanmadığını kontrol ederken yapılan bir shell expansion hatası üzerinden kısa ömürlü bir access token'ı. İkisini de fark etti, bana söyledi ve secret'ı rotate etmemi önerdi. Ayrıca MCP çağrılarımı hangi process'in sunduğu sorusuna, iki satırlık bir düzeltmeye ulaşmadan önce yaklaşık bir saat harcadı. Bu bir saat, modelin kendisiyle çelişen kanıtları kabul etmeyi reddetmesiydi; istediğim davranış bu, ancak yine de bir saat.
Hangi modelle karşılaştırmalı
Önce Fable 5 ile karşılaştırın. Point release bir onarımdır; dolayısıyla test, onarımların yerine ulaşıp ulaşmadığıdır. O akşam: session'ın ilerleyen saatlerinde tembellik yoktu ve üç saat, iki deploy ve 18-agent review boyunca konuyu korudu. Retleri saymadım ve tek akşam bir örneklem değil. Maliyet düşüşünü de ölçmedim; bu, Anthropic'in cache fiyatına ve effort ayarına dayanıyor ve ikisini de takip etmedim.
İkinci olarak GPT-5.6 Sol ile karşılaştırın. Sol, liste fiyatının yarısında ve OpenAI'nin kendi benchmark'ında long-horizon agentic skorunu hâlâ elinde tutuyor. İş yükünüz yüksek hacimli ve hatalara toleranslıysa Sol daha ucuz seçenek olmaya devam ediyor. Bir yanlış kestirmenin size bir güne mal olabileceği türden bir işse, Fable 5.1'i tercih ederim.
Henüz Gemini ile karşılaştırmayın. Google'ın flagship modeli hâlâ Gemini 3.1 Pro ve yeni sayıları yok. Ayrıca söylentilere göre Eylül'ün ilk yarısında çıkacak OpenAI's Astra'yı takip edin. Gelirse bu yazıyı güncelleyeceğim.
Bu blogun ruhuna uygun açıklama: Fable 5.1, bu yazının anlattığı aynı session içinde, günün kaynaklarından ve kendi tool log'undan yararlanarak ilk taslağı hazırladı. Her iddiayı ve her sayıyı gözden geçirdim.
