GPT-5.6 Sol رسمي: ما الذي تغيّر مقارنةً بـ Claude Fable 5
تقنية
OpenAI
GPT-5.6
GPT-5.6 Sol
GPT-5.6 Sol Ultra

GPT-5.6 Sol رسمي: ما الذي تغيّر مقارنةً بـ Claude Fable 5

أصبح OpenAI GPT-5.6 Sol رسميًا. إليك ما الذي تغيّر، وما الذي يعنيه Sol Ultra، وما هي المعايير المتاحة، وكيف يقارن مع Claude Fable 5.

Uygar DuzgunUUygar Duzgun
Jun 26, 2026
تم التحديث 22 أغسطس 2026
7 min read

لم يعد GPT-5.6 مجرد شائعة. نشرت OpenAI بطاقة نظام GPT-5.6 Preview في 26 يونيو 2026، والتفصيل المهم هو شكل الإطلاق: عائلة من النماذج، وضوابط معاينة محدودة، واهتمام كبير بسلامة الوكلاء.

قراءة مقترحة

قبل أسبوعين كتبت تحققًا سابقًا من شائعة GPT-5.6. كان ذلك المقال صحيحًا في حينه: لم يكن GPT-5.6 متاحًا للعامة بعد. لكن الوضع تغيّر اليوم.

قراءتي بسيطة. GPT-5.6 هو رد OpenAI على الضغط نفسه الذي أحدثته Anthropic مع Claude Fable 5: يجري تقييم النماذج بناءً على قدرتها على تنفيذ أعمال حقيقية، واستخدام الأدوات بأمان، والحفاظ على الموثوقية عندما تصبح المهمة طويلة ومعقدة.

ما الذي أعلنته OpenAI

تصف OpenAI GPT-5.6 بأنه عائلة جديدة تضم ثلاثة نماذج: Sol وTerra وLuna. يُعد Sol النموذج الرائد، بينما Terra هو الخيار القادر الأقل تكلفة، وLuna هو الأسرع والأكثر كفاءة من حيث التكلفة ضمن العائلة.

لا تتعامل OpenAI مع هذا الإصدار على أنه مجرد ترقية عادية لنموذج محادثة. تشير الشركة إلى الاستدلال المعقد، والبرمجة، واستخدام الكمبيوتر، واستخدام الأدوات، والدقة الواقعية، وسلوك الوكلاء الأكثر أمانًا. وهذه هي المجموعة الصحيحة من الادعاءات التي ينبغي مراقبتها، لأنها المجالات التي تتحول فيها النماذج المتقدمة إما إلى أدوات تشغيل مفيدة أو إلى إكمال تلقائي مكلف.

تقدم بطاقة النظام أيضًا إشارات مفيدة. تقول OpenAI إن GPT-5.6 يقلل الأخطاء الواقعية الكبيرة مقارنةً بـ GPT-5.5 في LongFact، ويخفض معدلات الهلوسة في تحليل لحركة الإنتاج. كما تخصص مساحة كبيرة لحقن التعليمات، والإجراءات العرضية المدمرة للبيانات، وتأكيدات المستخدم أثناء استخدام الكمبيوتر، والمواءمة، وفئات الاستعداد مثل المخاطر السيبرانية ومخاطر الأحياء والكيمياء.

وهذا يخبرني بأن OpenAI تريد تقييم GPT-5.6 باعتباره منصة للوكلاء، وليس مجرد مربع إجابات أكثر ذكاءً.

Sol Ultra وإشارات المعايير

هناك أيضًا جانب يتعلق بـ Sol Ultra، لكنني سأصوغه بحذر. تصف OpenAI جهد استدلال جديدًا باسم `max` لـ Sol، ووضعًا جديدًا باسم `ultra` يستخدم وكلاء فرعيين لتسريع الأعمال المعقدة. أقرأ ذلك باعتباره وضعًا لـ Sol يعتمد على قدرة حوسبية أعلى، وليس نموذجًا أساسيًا رابعًا. فما زالت العائلة الأساسية في بطاقة النظام تتكون من Sol وTerra وLuna.

تقول OpenAI إنها ستشارك مجموعة تقييم أوسع عندما تصبح النماذج متاحة عمومًا. في الوقت الحالي، هذه هي إشارات المعايير التي تستحق العرض:

المعيار أو التقييمالإشارة المنشورة لـ GPT-5.6
------
Terminal-Bench 2.1تقول OpenAI إن GPT-5.6 Sol يحقق مستوى جديدًا من التفوق في سير العمل عبر سطر الأوامر، والذي يتطلب التخطيط والتكرار وتنسيق الأدوات.
GeneBench v1تقول OpenAI إن Sol يتفوق على GPT-5.5 في سير عمل علم الجينوم والبيولوجيا الكمية طويل الأمد، مع استخدام عدد أقل من الرموز.
ExploitBenchتقول OpenAI إن Sol ينافس Mythos Preview مع استخدام نحو ثلث عدد رموز الإخراج.
ExploitGymتقول OpenAI إن Sol وTerra وLuna تتحسن مع زيادة الاستدلال.
مهام CTF الداخليةتقول بطاقة النظام إن GPT-5.6 Sol يصل إلى تشبع التقييم بنسبة 96.7%.
Irregular FrontierCyberحل GPT-5.6 Sol 19 تحديًا من أصل 197؛ وبلغ النجاح المبلغ عنه 11% في المستوى السهل، و12% في المتوسط، و5% في الصعب، و0% في النخبة.
CyScenarioBench وAtomic Challengesأبلغت Irregular عن نسبة 28% في CyScenarioBench. وفي Atomic Challenges، سجل Sol نسبة 98% في محاكاة هجمات الشبكات، و91% في أبحاث الثغرات واستغلالها، و56% في التهرب.

هذا مفيد، لكنه ليس احتفالًا نهائيًا بالنصر. معظم الأرقام العامة الملموسة تتركز في المجال السيبراني. أما ادعاءات البرمجة العامة والوكلاء فهي قوية، لكننا ما زلنا بحاجة إلى اختبارات أوسع من جهات خارجية قبل القول إن Sol Ultra أفضل من Claude Fable 5 في أعمال البرمجيات المعتادة.

ما الذي يبدو مشابهًا لـ Claude Fable 5

دفع Claude Fable 5 الحدود نفسها بأسلوب مختلف. أطلقته Anthropic في 9 يونيو باعتباره نموذجًا من فئة Mythos، وأتاحته للاستخدام العام. وقدمت Anthropic Fable 5 على أنه مناسب للمهام الطويلة والمعقدة: هندسة البرمجيات، والعمل المعرفي، والرؤية، والبحث العلمي، وعمل الوكلاء طويل الأمد.

التداخل واضح.

المجالGPT-5.6 SolClaude Fable 5
---------
العرض الرئيسينموذج رائد للوكلاء والاستدلالنموذج متقدم من فئة Mythos للاستخدام العام
أقوى حالات الاستخدامالبرمجة، واستخدام الأدوات، واستخدام الكمبيوتر، والدقة الواقعية، والوكلاءهندسة البرمجيات، والمهام الطويلة، والعمل المعرفي، والرؤية
إطار السلامةبطاقة نظام للمعاينة، وفئات الاستعداد، والعمل على حقن التعليمات والمواءمةضمانات Fable، وتقسيم Mythos، والتوجيه الاحتياطي للمجالات الحساسة
سؤال المشتريهل يمكنني الوثوق به ليتصرف عبر الأدوات؟هل يمكنني الحصول على الوصول إليه والحفاظ على استقراره باعتباره اعتمادًا؟

تتقارب الشركتان حول الحقيقة نفسها المتعلقة بالمنتج: يجب أن يعمل النموذج داخل نظام. عليه اتباع التعليمات، والتعامل مع الأدوات، وتجنب الإجراءات المدمرة، ومنح الفرق أدلة كافية للثقة في النتيجة.

قراءة مقترحة

وهذا هو الجزء الذي يهمني في وكلاء البرمجة. لا أحتاج إلى نموذج آخر يكتب نثرًا واثقًا. أحتاج إلى نموذج يستطيع فحص مستودع، وفهم القيود، وتشغيل الاختبارات، والتوقف قبل لمس عمل غير ذي صلة. كتبت المزيد عن أسلوب التشغيل هذا في سير عمل هدف وحلقة وكيل AI.

أين يختلف GPT-5.6 عن Fable 5

الاختلاف الأول هو الوصول.

تبدأ OpenAI طرح GPT-5.6 بضوابط معاينة. وهذا نهج محافظ، لكنه واضح. أطلقت Anthropic Fable 5 على نطاق أوسع، ثم نشرت في 12 يونيو بيانًا قالت فيه إنها اضطرت إلى تعليق الوصول إلى Fable 5 وMythos 5 بعد توجيه من الحكومة الأمريكية بشأن ضوابط التصدير. وقالت Anthropic إن الوصول إلى نماذج Claude الأخرى لم يتأثر، لكن Fable 5 أصبح فجأة اعتمادًا صعبًا في الإنتاج.

وهذا يغير المقارنة. فقد يكون النموذج مذهلًا، ومع ذلك يصعب بناء الأنظمة حوله إذا تغير الوصول إليه دون فترة ترحيل عادية.

الاختلاف الثاني هو تركيز المنتج.

كانت قصة Fable 5 لدى Anthropic تتمحور أولًا حول القدرات: عمل أقوى طويل الأمد، وسياق ضخم جدًا، وتقسيم بين Fable 5 للاستخدام العام وMythos 5 للوصول الموثوق إلى الدفاع السيبراني. أما قصة GPT-5.6 لدى OpenAI فهي تتمحور أكثر حول النشر: عائلة من النماذج، وضوابط معاينة، وبطاقة نظام للسلامة، والعمل على حقن التعليمات، واهتمام صريح بأنماط فشل الوكلاء.

الاختلاف الثالث هو النبرة.

جعلت Anthropic من Fable 5 يبدو كقفزة تتجاوز خط Claude السابق. أما OpenAI فتضع GPT-5.6 باعتباره طبقة تشغيل أكثر أمانًا وموثوقية للأعمال الصعبة. قد يبدو ذلك أقل إثارة، لكنه بالضبط المكان الذي تتعطل فيه وكلاء AI في الإنتاج: أذونات الأدوات، والتحكم في السياق، والدقة الواقعية، والآثار الجانبية الخفية، وما إذا كان النموذج يعترف بعدم اليقين.

اختباري العملي لـ GPT-5.6

لن أحكم على GPT-5.6 Sol من مخططات الإطلاق وحدها. أول اختبار أريده هو مهمة هندسية حقيقية:

شجرة git غير مرتبة
مستندات قديمة
اختبارات فاشلة
خطأ موزع على عدة ملفات
سطح أدوات MCP
خطوة نشر أو إصدار تتطلب ضبط النفس
قراءة مقترحة

ينبغي للنموذج الجيد أن يقرأ قبل التعديل، ويجري أصغر تغيير آمن، ويتحقق من النتيجة، ويبلغ عن العوائق بدلًا من التظاهر بأن كل شيء اكتمل. حسّن GPT-5.5 هذا النمط بالفعل في Codex، وهو ما تناولته في اختبار GPT-5.5 Codex. يجب أن يكون GPT-5.6 أفضل في الأجزاء المملة: افتراضات خاطئة أقل، واستدعاءات أدوات أنظف، وشروط توقف أكثر موثوقية.

قراءة مقترحة

لا يزال Fable 5 مهمًا لأنه وضع معيارًا للعمل الطويل والمعقد. وكانت مراجعتي لإطلاق Claude Fable 5 في يومه الأول إيجابية لهذا السبب. مشكلة الوصول لا تمحو قصة القدرات، لكنها تضيف درسًا في الشراء: أصبحت اختيارات AI المتقدمة تشمل الآن مخاطر السياسات، وليس مخاطر المعايير فقط.

الخلاصة

يبدو GPT-5.6 Sol كأنه رد OpenAI الجاد على لحظة Fable 5. تتشابه النماذج في طموحها: المهام الطويلة، والبرمجة، والوكلاء، والاستخدام الآمن للقدرات العالية. لكنها تختلف في استراتيجية الطرح. أظهرت Anthropic كيف يمكن أن تبدو قفزة في القدرات. وتحاول OpenAI أن تجعل القفزة التالية قابلة للنشر.

يجعل Sol Ultra الإطلاق أكثر إثارة للاهتمام لأنه يشير إلى التنفيذ متعدد الوكلاء، وليس فقط إلى استدلال أعمق لنموذج واحد. لكنني سأحكم عليه من خلال العمل الذي ينجزه: فحص المستودع، واستخدام الأدوات، والتعافي من الأخطاء، وما إذا كان يترك سجلًا واضحًا للإنسان المسؤول عن النظام.

بالنسبة إلى المطورين، الفائز ليس النموذج صاحب الإطلاق الأعلى ضجيجًا. الفائز هو النموذج الذي يستطيع إنجاز عمل حقيقي، واستخدام الأدوات بأمان، وترك سجل تدقيق واضح.

وهذا ما سأختبره أولًا.

المصادر التي جرى التحقق منها في 26 يونيو 2026

منشور إطلاق OpenAI: معاينة GPT-5.6 Sol، جرى التحقق منه في المتصفح في 26 يونيو 2026