Anthropic lanserade Claude Fable 5.1 i går, den 1 september 2026, och jag tillbringade kvällen med att köra det på min egen stack i stället för att läsa om det. Den korta versionen: samma pris som Fable 5, cache-läsningar sänkta med 75 %, färre felaktiga vägran och en modell som förblir sammanhängande under en tre timmar lång session med oglamoröst infrastrukturarbete.
Fable 5 var den bästa modellen jag hade använt och samtidigt den som folk klagade mest på. Jag skrev om ombyggnaden av ett äldre CRM-system som den genomförde på lanseringsdagen→ och om pausen kring exportkontrollerna och dess återkomst→. En punktversion är Anthropics svar på klagolistan. Frågan för 5.1 är därför avgränsad: fixade de det som gjorde ont, och ändrades priset?
Vad som ändrades i Claude Fable 5.1
Enligt Anthropics tillkännagivande är priset per token oförändrat: 10 dollar per miljon input-tokens och 50 dollar per miljon output-tokens. Förändringen gäller cache-läsningar: 0,25 dollar per miljon, en sänkning med 75 %. Anthropic uppskattar att det gör typiska arbetsbelastningar omkring 25 % billigare och mycket agentiska arbetsbelastningar upp till omkring 45 % billigare, eftersom agentloopar skickar samma kontext igen vid varje tur.
Den andra spaken är effort. Anthropic säger att Fable 5.1 vid låg eller medelhög effort matchar eller överträffar Fable 5 till en mycket lägre kostnad. För en operatör är det den större nyheten. Det mesta en agent gör under en dag är rutin, och att betala `xhigh`-priser för rutinarbete var huvudorsaken till att Fable 5-fakturorna skenade.
Skyddsmekanismerna har också ändrats. Cybersäkerhetsskydd blockerar 60 % färre falska positiva per session, biologiska skydd aktiveras 85 % mer sällan vid ofarliga biologiska och medicinska frågor, och Fable 5.1 kan nu identifiera programvarusårbarheter för defensivt arbete, men inte skriva exploits. Mythos 5.1 är samma modell med färre skyddsmekanismer, för närvarande begränsad till ett antal amerikanska organisationer: Life Sciences Verification Program bygger på den, medan Cyber Verification Program fortfarande kör Opus- och Sonnet-modeller och ska lägga till modeller i Mythos-klassen "inom en nära framtid".
De beteendemässiga noteringarna är de jag bryr mig om. Anthropic hävdar att 5.1 undviker genvägar som leder till sämre arbete, gör bättre grundorsaksanalyser och behåller sammanhanget under långa uppgifter i flera steg. Deras främsta exempel är Millennium: en krasch som drabbade ungefär en körning på en miljon och som förblivit oförklarad i flera år. Fable 5.1 monterade ned ett leverantörsbibliotek, matchade det mot en core dump och spårade buggen till biblioteket.
Tillgängligheten är omedelbar: `claude-fable-5-1` i API:t, claude.ai, Amazon Bedrock, Google Cloud's Agent Platform och Microsoft Foundry.
Benchmarktester för Fable 5.1 jämfört med Fable 5, Opus 5 och GPT-5.6 Sol
Anthropics egen tabell. Leverantörsrapporterad, så se skillnaderna som riktningar tills oberoende topplistor hinner ikapp.
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| --- | --- | --- | --- | --- |
| Terminal-Bench 4.0 (agentisk kodning) | 55.8% | 42.0% | 52.3% | 37.3% |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| AutomationBench (affärsarbetsflöden) | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| GDPval-AA v2 (kunskapsarbete) | 1853 | 1723 | 1824 | 1711 |
| Humanity's Last Exam (utan verktyg) | 60.9% | 57.8% | 56.6% | – |
| OSWorld 2.0 (strikt) | 41.7% | 36.1% | 39.6% | – |
Två saker sticker ut. Terminal-Bench-Science, Terminal-Bench 4.0 och AutomationBench är tester av agentiskt arbete över lång tid, och där skedde de största förändringarna: vetenskapsbenchmarken mer än fördubblades, från 24.7 % till 52.6 %, och de två andra ökade vardera med omkring 14 procentenheter. Och Opus 5, som många gick tillbaka till när Fable 5 blev dyr eller envis, ligger nu tydligt efter på samma uppgifter. Cognition sade att de flyttar Devins Opus 5-trafik till Fable 5.1 på lanseringsdagen och angav cache-prissättningen som orsaken till att en modell i Fable-klassen nu är överkomlig för dem.
En brasklapp från andra sidan staketet: på OpenAI's Agents' Last Exam slog GPT-5.6 Sol→ Fable 5 med 13,1 poäng, och vid medelhög reasoning ledde den fortfarande med 11,4 poäng till ungefär en fjärdedel av den uppskattade kostnaden. Anthropic publicerade ingen 5.1-siffra för den benchmarken. Sol kostar fortfarande hälften så mycket per token, 5 dollar in och 30 dollar ut, så prisargumentet för 5.1 bygger på cache-läsningar och låg effort, inte listpriset.
Klagolistan som 5.1 byggdes för
Motreaktionen mot Fable 5 hade en konsekvent form. En användningsgräns på fem timmar i webbappen. Säkerhetsklassificerare som i tysthet skickade din konversation till Opus 4.8. Hög tokenförbrukning, med en vitt spridd rapport om att 110 dollar förbrukades på en dag. Lathet långt in i långa uppgifter, ordrikedom, avmattningar mitt i körningen och en tid till första token på över en minut vid svåra prompts. "En Ferrari med en begränsare på 30 mph" var formuleringen som fastnade. Opus 5 fick sina egna klagomål, och Thariq, som arbetar med Claude Code på Anthropic, höll med på X om att det är "en riktigt spikig modell" och att det är "en enorm prioritet för oss" att åtgärda det.
Under utrullningen i gråskala under den sista veckan i augusti rapporterade testare som dirigerades till den nya checkpointen bättre resonemang i långa kedjor, att den inte längre glömde förutsättningar halvvägs genom en uppgift samt bättre verktygsanvändning och stegplanering. Vissa testare uppskattade 10 till 20 % bättre resultat i juridiskt arbete. Det enda område där den blev striktare: den vägrar generera bilder som innehåller upphovsrättsskyddat material.
Det stämmer överens med den officiella inramningen. Färre felaktiga vägran, mindre lathet och lägre kostnad per slutförd uppgift. Användningsgränsen i konsumentappen är den punkt som jag inte har sett behandlas.
Vad utvecklare behöver ändra
Om du anropar API:t direkt har Fable 5.1 några vassa kanter som Fable 5 inte hade, enligt Anthropics migrationsguide:
Inget av detta ställde till problem för mig i Claude Code, som hanterar det åt dig. Det kommer att ställa till problem för alla som har en egen agentloop som tvingar fram verktygsanrop.
En kväll med Fable 5.1 på min egen stack
Benchmarktester mäter modellen på någon annans problem. Mina problem i går kväll var tre timmar av den typ av arbete som fyller en operatörs kväll: ett trasigt verktyg, två databas-migreringar, två deployer och en widget som aldrig hade kopplats till Spotify. Fable 5.1 i Claude Code gjorde alltihop, och jag granskade medan den arbetade.
Det trasiga verktyget. Min MCP-server för webbplatsen har ett `search_console`-verktyg som hade returnerat Unauthorized i flera veckor. Orsaken låg två lager ner. Processen som hanterade mina verktygsanrop var inte den som definierades i repots MCP-konfiguration; Claude Desktop startade en andra process via ett shellskript som aldrig fick rätt nyckel. Och produktion körde fortfarande en äldre auth-regel, eftersom ett arbets-träd med 48 filer och den nya regeln aldrig hade committats. Processtabellen visade en outvecklad platshållare där en nyckel skulle finnas, och modellen vägrade gissa. Den hittade processen som hanterade mina anrop genom att läsa av TCP-anslutningar till min domän under ett verktygsanrop, anslöt sedan Node's inspector till processen som repots konfiguration hade startat och bekräftade att platshållaren var verklig. Lösningen var en Node-flagga i två filer.
Migreringarna. Supabase MCP-anslutningen returnerade permission denied för DDL. Supabase CLI kunde inte hantera min `.env.local`. En Vercel env pull kom tillbaka med `[SENSITIVE]`-platshållare i stället för anslutningssträngar, och modellen skrev kortvarigt dessa platshållare till min env-fil innan den upptäckte det och återställde ändringen. En körning från ett länkad katalog via en symlink kunde inte hitta projektets ref. Fyra återvändsgränder, och ändå fick den igenom migreringarna. Jag har sett tidigare modeller fastna i loopar efter den första misslyckade vägen; den här fortsatte att byta angreppssätt.
Deployen. Sjuttio filer, två migreringar, tre nya Vercel-variabler, en build, en push, en produktions-deploy och verifiering av deploymentens status och de berörda endpoints, inklusive det negativa fallet: den äldre nyckeln ger nu korrekt 401 på den ägarbegränsade routen.
Widgeten. En Spotify-widget för vad som spelas nu fanns i trädet, men OAuth-steget hade aldrig körts; redirect-URI:n var inte ens registrerad i Spotify-dashboarden. Fable 5.1 guidade mig genom OAuth-konfigurationen, testade routen lokalt och körde sedan en adversarial granskning av funktionen med 18 agenter: tre granskare med olika perspektiv, där varje fynd överlämnades till en separat agent vars uppgift var att vederlägga det. 15 fynd lades in, 5 överlevde. De överlevande var verkliga: artisttext med kontrasten 2.04:1 mot ett krav på 4.5:1, fysisk padding som förstörde pill-formen på min arabiska route, saknade fetch-timeouts, ett ohanterat upstream-fel som skulle visas som en ocachad 500:a och en refresh token som skulle löpa ut om sex månader och försvinna tyst. Den fixade alla fem, mätte kontrasten och RTL-paddingen i en webbläsare och deployade. Jag lämnade medvetet refresh token utanför produktion, så widgeten förblir dold där. När jag frågade efter den loggade den tillståndet så att nästa session vet vad som är live. Nio minuter för granskningen, omkring 1,65 miljoner tokens över de 18 agenterna.
Nu till invändningarna. Två gånger den kvällen skrev den ut en hemlighet i verktygsutdata, en gång min Spotify client secret och en gång en kortlivad access token, genom ett misstag med shell-expansion när den kontrollerade om variabler var satta. Den upptäckte båda, berättade det för mig och sade åt mig att rotera hemligheten. Den lade också nära en timme på frågan om vilken process som hanterade mina MCP-anrop innan den landade i en lösning på två rader. Den timmen var modellen som vägrade acceptera bevis som motsade sig själva, vilket är det beteende jag vill ha, men det är fortfarande en timme.
Vilken modell ska man jämföra med?
Jämför den först med Fable 5. En punktversion är en reparation, så testet är om reparationerna faktiskt kom på plats. Den kvällen: ingen lathet sent i sessionen, och den höll tråden genom tre timmar, två deployer och en granskning med 18 agenter. Vägran räknade jag inte, och en kväll är inget urval. Kostnadssänkningen mätte jag inte heller; den bygger på Anthropics cache-pris och effort-inställningen, och jag följde inte upp någon av dem.
Jämför den därefter med GPT-5.6 Sol. Sol har halva listpriset och äger fortfarande poängen för agentiskt arbete över lång tid i OpenAI's egen benchmark. Om din arbetsbelastning är stor och förlåtande är Sol fortfarande den billigare platsen. Om det är den typ av arbete där en felaktig genväg kostar dig en dag är Fable 5.1 modellen jag skulle lämna över det till.
Jämför den inte med Gemini ännu. Googles flaggskepp är fortfarande Gemini 3.1 Pro och har inga färska siffror. Håll också ett öga på OpenAI's Astra, som ryktas komma under första halvan av september. Om den lanseras uppdateras det här inlägget.
Transparens, i den här bloggens anda: Fable 5.1 skrev ett utkast till det här inlägget i samma session som det beskriver, utifrån dagens källor och sin egen verktygslogg. Jag granskade varje påstående och varje siffra.
