مراجعة Claude Fable 5.1: الاختبارات المعيارية، التسعير، ومقارنته بـ GPT-5.6 Sol
تقنية
Claude Fable 5.1
Anthropic
AI Models
Claude Code

مراجعة Claude Fable 5.1: الاختبارات المعيارية، التسعير، ومقارنته بـ GPT-5.6 Sol

يحافظ Claude Fable 5.1 على سعر Fable 5، ويخفض قراءات الذاكرة المؤقتة بنسبة 75%، ويستهدف شكاوى الكسل. اختبارات معيارية مقارنةً بـ Opus 5 وGPT-5.6 Sol، بالإضافة إلى تجربة مسائية على حزمة أدواتي.

Uygar DuzgunUUygar Duzgun
Sep 2, 2026
تم التحديث 4 سبتمبر 2026
11 min read

أطلقت Anthropic نموذج Claude Fable 5.1 أمس، في 1 سبتمبر 2026، وقضيت المساء في تشغيله على حزمة أدواتي الخاصة بدلًا من الاكتفاء بالقراءة عنه. الخلاصة المختصرة: السعر نفسه مثل Fable 5، وخفض قراءات الذاكرة المؤقتة بنسبة 75%، ورفضات خاطئة أقل، ونموذج يحافظ على اتساقه خلال جلسة مدتها ثلاث ساعات من أعمال البنية التحتية غير المثيرة.

قراءة مقترحة

كان Fable 5 أفضل نموذج استخدمته، وكان أيضًا النموذج الذي اشتكى منه الناس أكثر من غيره. كتبت عن إعادة البناء التي نفذها في يوم الإطلاق لنظام CRM قديم، وعن توقف ضوابط التصدير وعودته. الإصدار الفرعي هو إجابة Anthropic عن قائمة الشكاوى. لذلك فإن السؤال حول 5.1 ضيق النطاق: هل أصلحوا الأمور المؤذية، وهل تغير السعر؟

ما الذي تغير في Claude Fable 5.1

وفقًا لإعلان Anthropic، لم يتغير السعر لكل token، إذ يبلغ 10 دولارات لكل مليون token إدخال و50 دولارًا لكل مليون token إخراج. التغيير يتعلق بقراءات الذاكرة المؤقتة: 0.25 دولار لكل مليون، بانخفاض قدره 75%. وتقدر Anthropic أن هذا يجعل أعباء العمل المعتادة أرخص بنحو 25%، وتلك التي تعتمد بكثافة على الوكلاء أرخص بنسبة تصل إلى نحو 45%، لأن حلقات الوكلاء تعيد إرسال السياق نفسه في كل دور.

الأداة الثانية هي مستوى الجهد. تقول Anthropic إن Fable 5.1 عند مستوى جهد منخفض أو متوسط يضاهي Fable 5 أو يتفوق عليه بتكلفة أقل بكثير. وبالنسبة إلى المشغل، فهذا هو الأمر الأهم. معظم ما يفعله الوكيل خلال اليوم روتيني، وكان دفع أسعار `xhigh` مقابل الأعمال الروتينية السبب الرئيسي وراء ارتفاع فواتير Fable 5.

تغيرت إجراءات الحماية أيضًا. إذ تحظر إجراءات الحماية الخاصة بالأمن السيبراني 60% أقل من الإيجابيات الكاذبة في كل جلسة، وتعمل إجراءات الحماية الخاصة بالبيولوجيا بنسبة أقل 85% في الأسئلة البيولوجية والطبية السليمة، وقد يحدد Fable 5.1 الآن ثغرات البرمجيات لأغراض دفاعية، لكنه لا يكتب برمجيات استغلالية. أما Mythos 5.1 فهو النموذج نفسه مع إجراءات حماية أقل، ومتاح حاليًا لمجموعة من المؤسسات الأمريكية: إذ يعتمد برنامج التحقق من علوم الحياة عليه، بينما لا يزال برنامج التحقق السيبراني يشغل نماذج من فئتي Opus وSonnet، ومن المقرر أن يضيف نماذج من فئة Mythos «في المستقبل القريب».

الملاحظات السلوكية هي ما يهمني. تدعي Anthropic أن 5.1 يتجنب الاختصارات التي تؤدي إلى عمل أقل جودة، ويجري تحليلًا أفضل للسبب الجذري، ويحافظ على الاتساق خلال المهام الطويلة متعددة الخطوات. ومثالها الأبرز هو Millennium: عطل كان يصيب نحو تشغيل واحد من كل مليون، وظل بلا تفسير لسنوات. فكك Fable 5.1 مكتبة مورّد، وطابقها مع تفريغ الذاكرة، وتتبع الخطأ إلى تلك المكتبة.

التوفر فوري: `claude-fable-5-1` على API، وclaude.ai، وAmazon Bedrock، وGoogle Cloud's Agent Platform، وMicrosoft Foundry.

اختبارات Fable 5.1 المعيارية مقارنةً بـ Fable 5 وOpus 5 وGPT-5.6 Sol

جدول Anthropic نفسه. الأرقام مقدمة من المورّد، لذا تعامل مع الفروقات باعتبارها اتجاهية إلى أن تلحق بها لوحات المتصدرين المستقلة.

الاختبار المعياريFable 5.1Fable 5Opus 5GPT-5.6 Sol
---------------
Terminal-Bench 4.0 (البرمجة المعتمدة على الوكلاء)55.8%42.0%52.3%37.3%
Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%
AutomationBench (سير العمل التجاري)31.4%17.1%26.9%19.6%
CursorBench 3.2.073.4%70.5%70.0%67.2%
GDPval-AA v2 (العمل المعرفي)1853172318241711
Humanity's Last Exam (من دون أدوات)60.9%57.8%56.6%
OSWorld 2.0 (الصارم)41.7%36.1%39.6%

تبرز نقطتان. إن Terminal-Bench-Science وTerminal-Bench 4.0 وAutomationBench هي اختبارات الوكلاء طويلة الأفق، وقد تحركت أكثر من غيرها: فقد تضاعفت نتيجة الاختبار العلمي أكثر من مرة، من 24.7% إلى 52.6%، وحقق الاختباران الآخران مكاسب بنحو 14 نقطة لكل منهما. كما أن Opus 5، الذي لجأ إليه كثيرون عندما أصبح Fable 5 مكلفًا أو عنيدًا، أصبح الآن متأخرًا بوضوح في المهام نفسها. وقالت Cognition إنها ستنقل حركة مرور Devin الخاصة بـ Opus 5 إلى Fable 5.1 في يوم الإطلاق، وذكرت أن تسعير قراءات الذاكرة المؤقتة هو السبب في أن نموذجًا من فئة Fable أصبح ميسور التكلفة بالنسبة إليها.

قراءة مقترحة

هناك ملاحظة من الجانب الآخر: في اختبار OpenAI's Agents' Last Exam، تفوق GPT-5.6 Sol على Fable 5 بفارق 13.1 نقطة، وحتى عند الاستدلال المتوسط ظل متقدمًا بفارق 11.4 نقطة، بتكلفة تقديرية تبلغ نحو ربع التكلفة. لم تنشر Anthropic رقم 5.1 لهذا الاختبار المعياري. ولا يزال Sol يكلف نصف السعر لكل token، أي 5 دولارات للإدخال و30 دولارًا للإخراج، لذا فإن حجة السعر لصالح 5.1 تعتمد على قراءات الذاكرة المؤقتة ومستوى الجهد المنخفض، لا على السعر المعلن.

قائمة الشكاوى التي صُمم 5.1 لمعالجتها

كان رد الفعل العنيف على Fable 5 متسقًا في ملامحه. حد استخدام مدته خمس ساعات في تطبيق الويب. مصنفات أمان كانت تنقل محادثتك بهدوء إلى Opus 4.8. استهلاك مرتفع للـ token، مع تقرير واسع الانتشار عن إنفاق 110 دولارات في يوم واحد. كسل في مراحل متقدمة من المهام الطويلة، وإسهاب، وتباطؤ في منتصف التشغيل، ووقت يتجاوز دقيقة قبل ظهور أول token في المطالبات الصعبة. وكانت عبارة «سيارة Ferrari مع محدد سرعة عند 30 ميلًا في الساعة» هي التي علقت في الأذهان. تلقى Opus 5 شكاوى خاصة به أيضًا، ووافق Thariq، الذي يعمل على Claude Code في Anthropic، على X على أنه «نموذج متقلب جدًا»، وأن إصلاحه «أولوية ضخمة بالنسبة إلينا».

خلال الإطلاق التدريجي الرمادي في الأسبوع الأخير من أغسطس، أفاد المختبرون الذين وُجهوا إلى نقطة التحقق الجديدة بتحسن الاستدلال طويل السلسلة، وعدم نسيان الشروط المسبقة في منتصف المهمة، وتحسن استخدام الأدوات وتخطيط الخطوات. وقدر بعض المختبرين نتائج أفضل بنسبة 10 إلى 20% في الأعمال القانونية. أما الموضع الوحيد الذي أصبح فيه أكثر تشددًا فهو رفضه إنشاء صور تتضمن مواد محمية بحقوق الطبع والنشر.

وهذا يتوافق مع الإطار الرسمي: رفضات خاطئة أقل، وكسل أقل، وتكلفة أقل لكل مهمة مكتملة. أما حد الاستخدام في تطبيق المستهلك فهو العنصر الذي لم أرَ أنه عولج.

ما الذي يحتاج المطورون إلى تغييره

إذا كنت تستدعي API مباشرة، فإن لدى Fable 5.1 بعض الحواف الحادة التي لم تكن موجودة في Fable 5، وفقًا لـ دليل الترحيل الخاص بـ Anthropic:

التفكير مفعّل دائمًا. لا يمكنك تعطيله؛ بل تتحكم في العمق باستخدام إعداد `effort`، من `low` إلى `max`.
لم يعد اختيار الأداة إجباريًا. يؤدي `tool_choice: any` أو اختيار أداة مسماة إلى إرجاع 400. استخدم `auto` مع تعليمات، أو المخرجات المنظمة عندما تكون تريد فقط استلام JSON.
ترتبط كتل التفكير بالنموذج الذي أنتجها، ويؤدي تعديل الأدوار السابقة إلى إبطالها. اجعل أداة التشغيل الخاصة بك تعمل بنمط الإضافة فقط.
نفس tokenizer المستخدم في Fable 5، وسياق بحجم 1M، وإخراج بحجم 128K.

لم يسبب أي من هذه الأمور مشكلة لي في Claude Code، الذي يتولى التعامل معها نيابة عنك. لكنها ستسبب مشكلات لأي شخص لديه حلقة وكيل مكتوبة يدويًا تفرض استدعاءات الأدوات.

أمسية في تشغيل Fable 5.1 على حزمة أدواتي الخاصة

تقيس الاختبارات المعيارية النموذج على مشكلات شخص آخر. أما مشكلاتي في الليلة الماضية فكانت ثلاث ساعات من النوع الذي يملأ مساء المشغل: أداة معطلة، وترحيلان لقاعدة البيانات، وعمليتا نشر، وعنصر واجهة لم يكن قد رُبط بـ Spotify قط. أنجز Fable 5.1 في Claude Code كل ذلك، وراجعت العمل أثناء تنفيذه.

الأداة المعطلة. يحتوي خادم MCP لموقعي على أداة `search_console` كانت تعيد Unauthorized لأسابيع. وكان السبب على مستويين. فالعملية التي كانت تخدم استدعاءات أدواتي لم تكن العملية المعرفة في إعداد MCP للمستودع؛ إذ كان Claude Desktop يشغل عملية ثانية عبر shell script لم تتلقَ المفتاح الصحيح. كما أن الإنتاج كان لا يزال يشغل قاعدة مصادقة أقدم، لأن شجرة عمل تضم 48 ملفًا مع القاعدة الجديدة لم تكن قد أُرسلت إلى المستودع. أظهر جدول العمليات عنصرًا نائبًا غير موسع حيث ينبغي أن يكون المفتاح، ورفض النموذج التخمين. عثر على العملية التي تخدم استدعاءاتي عبر أخذ عينات من اتصالات TCP بنطاقي أثناء استدعاء أداة، ثم أرفق Node's inspector بالعملية التي أنشأها إعداد المستودع، وأكد أن العنصر النائب حقيقي. كان الإصلاح عبارة عن خيار Node واحد في ملفين.

عمليات الترحيل. أعاد موصل Supabase MCP رسالة permission denied عند تنفيذ DDL. وتعثر Supabase CLI في ملف `.env.local` الخاص بي. أعاد سحب متغيرات Vercel البيئية عناصر نائبة من نوع `[SENSITIVE]` بدلًا من سلاسل الاتصال، وكتب النموذج هذه العناصر النائبة لفترة وجيزة في ملف البيئة لدي قبل أن يكتشف الأمر ويتراجع عنه. كما أن تشغيل مشروع مرتبط من مجلد يحتوي على symlink لم يتمكن من العثور على مرجع المشروع. أربع طرق مسدودة، ومع ذلك نجح في تنفيذ عمليات الترحيل. لقد شاهدت نماذج سابقة تدور في حلقة حول المسار الفاشل الأول؛ أما هذا النموذج فواصل تغيير النهج.

النشر. سبعون ملفًا، وترحيلان، وثلاثة متغيرات جديدة في Vercel، وعملية build، وpush، ونشر في الإنتاج، والتحقق من حالة النشر ونقاط النهاية المتأثرة، بما في ذلك الحالة السلبية: أصبح المفتاح القديم الآن يحصل بشكل صحيح على 401 في المسار المخصص للمالك فقط.

عنصر الواجهة. كان عنصر تذييل يعرض ما يُشغّل حاليًا على Spotify موجودًا في شجرة الملفات، لكن خطوة OAuth لم تُنفذ قط؛ بل إن URI إعادة التوجيه لم يكن مسجلًا حتى في لوحة تحكم Spotify. أرشدني Fable 5.1 خلال إعداد OAuth، واختبر المسار محليًا، ثم أجرى مراجعة خصمية للميزة بواسطة 18 وكيلًا: ثلاثة مراجعين بعدسات مختلفة، وكل نتيجة تُسلّم إلى وكيل منفصل مهمته دحضها. أُدخلت 15 نتيجة، وصمدت 5. وكانت النتائج الباقية حقيقية: نص الفنان بتباين 2.04:1 مقابل متطلب 4.5:1، وحشو مادي كسر العنصر ذي الشكل البيضاوي في مساري العربي، ومهل fetch مفقودة، وخطأ غير ملتقط من upstream كان سيظهر كاستجابة 500 غير مخزنة مؤقتًا، وrefresh token سينتهي بعد ستة أشهر ويختفي بصمت. أصلح الخمسة جميعًا، وقاس التباين وحشو RTL في متصفح، ونشر التغييرات. تعمدت عدم وضع refresh token في الإنتاج، لذلك يظل العنصر مخفيًا هناك. وعندما طلبت منه ذلك، سجل الحالة حتى تعرف الجلسة التالية ما هو فعال. استغرقت المراجعة تسع دقائق، واستخدمت نحو 1.65 مليون token عبر الوكلاء الـ18.

والآن الإيصالات ضده. طبع سرًا في مخرجات الأدوات مرتين في ذلك المساء، مرة سر Spotify الخاص بي ومرة access token قصير الأجل، بسبب خطأ في توسيع shell أثناء التحقق من ضبط المتغيرات. اكتشف الأمرين، وأخبرني بهما، وطلب مني تدوير السر. كما أمضى قرابة ساعة في تحديد العملية التي تخدم استدعاءات MCP الخاصة بي قبل أن يصل إلى إصلاح من سطرين. كانت تلك الساعة نتيجة رفض النموذج قبول أدلة تناقض بعضها بعضًا، وهو سلوك أريده، لكنها تظل ساعة كاملة.

مع أي نموذج ينبغي مقارنته

قارنه أولًا بـ Fable 5. الإصدار الفرعي هو إصلاح، لذا فإن الاختبار هو ما إذا كانت الإصلاحات قد وصلت. في تلك الأمسية: لم يظهر كسل في وقت متأخر من الجلسة، وحافظ على الخيط عبر ثلاث ساعات، وعمليتي نشر، ومراجعة بواسطة 18 وكيلًا. لم أحسب الرفضات، وليلة واحدة ليست عينة. كما أنني لم أقس خفض التكلفة؛ فهو يعتمد على سعر قراءات الذاكرة المؤقتة لدى Anthropic وإعداد مستوى الجهد، ولم أتابع أيًا منهما.

قارنه ثانيًا بـ GPT-5.6 Sol. فسعر Sol المعلن نصف السعر، ولا يزال يتصدر نتيجة الوكلاء طويلة الأفق في الاختبار الخاص بـ OpenAI. إذا كان عبء عملك عالي الحجم ومتسامحًا مع الأخطاء، يظل Sol الخيار الأرخص. أما إذا كان من النوع الذي قد يكلفك فيه اختصار خاطئ يومًا كاملًا، فـ Fable 5.1 هو النموذج الذي سأوكل إليه المهمة.

لا تقارنه بـ Gemini بعد. لا يزال النموذج الرائد لدى Google هو Gemini 3.1 Pro، ولا توجد أرقام حديثة. وراقب Astra من OpenAI، الذي يُشاع إطلاقه في النصف الأول من سبتمبر. إذا وصل، فسيحصل هذا المنشور على تحديث.

إفصاح، انسجامًا مع روح هذه المدونة: صاغ Fable 5.1 هذا المنشور داخل الجلسة نفسها التي يصفها، اعتمادًا على مصادر اليوم وسجل أدواته الخاص. راجعت كل ادعاء وكل رقم.

المصادر