لم يعد GPT-5.6 مجرد شائعة. نشرت OpenAI بطاقة نظام GPT-5.6 Preview في 26 يونيو 2026، والتفصيل المهم هو شكل الإطلاق: عائلة من النماذج، وضوابط معاينة محدودة، واهتمام كبير بسلامة الوكلاء.
قبل أسبوعين كتبت تحققًا سابقًا من شائعة GPT-5.6→. كان ذلك المقال صحيحًا في حينه: لم يكن GPT-5.6 متاحًا للعامة بعد. لكن الوضع تغيّر اليوم.
قراءتي بسيطة. GPT-5.6 هو رد OpenAI على الضغط نفسه الذي أحدثته Anthropic مع Claude Fable 5: يجري تقييم النماذج بناءً على قدرتها على تنفيذ أعمال حقيقية، واستخدام الأدوات بأمان، والحفاظ على الموثوقية عندما تصبح المهمة طويلة ومعقدة.
ما الذي أعلنته OpenAI
تصف OpenAI GPT-5.6 بأنه عائلة جديدة تضم ثلاثة نماذج: Sol وTerra وLuna. يُعد Sol النموذج الرائد، بينما Terra هو الخيار القادر الأقل تكلفة، وLuna هو الأسرع والأكثر كفاءة من حيث التكلفة ضمن العائلة.
لا تتعامل OpenAI مع هذا الإصدار على أنه مجرد ترقية عادية لنموذج محادثة. تشير الشركة إلى الاستدلال المعقد، والبرمجة، واستخدام الكمبيوتر، واستخدام الأدوات، والدقة الواقعية، وسلوك الوكلاء الأكثر أمانًا. وهذه هي المجموعة الصحيحة من الادعاءات التي ينبغي مراقبتها، لأنها المجالات التي تتحول فيها النماذج المتقدمة إما إلى أدوات تشغيل مفيدة أو إلى إكمال تلقائي مكلف.
تقدم بطاقة النظام أيضًا إشارات مفيدة. تقول OpenAI إن GPT-5.6 يقلل الأخطاء الواقعية الكبيرة مقارنةً بـ GPT-5.5 في LongFact، ويخفض معدلات الهلوسة في تحليل لحركة الإنتاج. كما تخصص مساحة كبيرة لحقن التعليمات، والإجراءات العرضية المدمرة للبيانات، وتأكيدات المستخدم أثناء استخدام الكمبيوتر، والمواءمة، وفئات الاستعداد مثل المخاطر السيبرانية ومخاطر الأحياء والكيمياء.
وهذا يخبرني بأن OpenAI تريد تقييم GPT-5.6 باعتباره منصة للوكلاء، وليس مجرد مربع إجابات أكثر ذكاءً.
Sol Ultra وإشارات المعايير
هناك أيضًا جانب يتعلق بـ Sol Ultra، لكنني سأصوغه بحذر. تصف OpenAI جهد استدلال جديدًا باسم `max` لـ Sol، ووضعًا جديدًا باسم `ultra` يستخدم وكلاء فرعيين لتسريع الأعمال المعقدة. أقرأ ذلك باعتباره وضعًا لـ Sol يعتمد على قدرة حوسبية أعلى، وليس نموذجًا أساسيًا رابعًا. فما زالت العائلة الأساسية في بطاقة النظام تتكون من Sol وTerra وLuna.
تقول OpenAI إنها ستشارك مجموعة تقييم أوسع عندما تصبح النماذج متاحة عمومًا. في الوقت الحالي، هذه هي إشارات المعايير التي تستحق العرض:
| المعيار أو التقييم | الإشارة المنشورة لـ GPT-5.6 |
|---|---|
| --- | --- |
| Terminal-Bench 2.1 | تقول OpenAI إن GPT-5.6 Sol يحقق مستوى جديدًا من التفوق في سير العمل عبر سطر الأوامر، والذي يتطلب التخطيط والتكرار وتنسيق الأدوات. |
| GeneBench v1 | تقول OpenAI إن Sol يتفوق على GPT-5.5 في سير عمل علم الجينوم والبيولوجيا الكمية طويل الأمد، مع استخدام عدد أقل من الرموز. |
| ExploitBench | تقول OpenAI إن Sol ينافس Mythos Preview مع استخدام نحو ثلث عدد رموز الإخراج. |
| ExploitGym | تقول OpenAI إن Sol وTerra وLuna تتحسن مع زيادة الاستدلال. |
| مهام CTF الداخلية | تقول بطاقة النظام إن GPT-5.6 Sol يصل إلى تشبع التقييم بنسبة 96.7%. |
| Irregular FrontierCyber | حل GPT-5.6 Sol 19 تحديًا من أصل 197؛ وبلغ النجاح المبلغ عنه 11% في المستوى السهل، و12% في المتوسط، و5% في الصعب، و0% في النخبة. |
| CyScenarioBench وAtomic Challenges | أبلغت Irregular عن نسبة 28% في CyScenarioBench. وفي Atomic Challenges، سجل Sol نسبة 98% في محاكاة هجمات الشبكات، و91% في أبحاث الثغرات واستغلالها، و56% في التهرب. |
هذا مفيد، لكنه ليس احتفالًا نهائيًا بالنصر. معظم الأرقام العامة الملموسة تتركز في المجال السيبراني. أما ادعاءات البرمجة العامة والوكلاء فهي قوية، لكننا ما زلنا بحاجة إلى اختبارات أوسع من جهات خارجية قبل القول إن Sol Ultra أفضل من Claude Fable 5 في أعمال البرمجيات المعتادة.
ما الذي يبدو مشابهًا لـ Claude Fable 5
دفع Claude Fable 5 الحدود نفسها بأسلوب مختلف. أطلقته Anthropic في 9 يونيو باعتباره نموذجًا من فئة Mythos، وأتاحته للاستخدام العام. وقدمت Anthropic Fable 5 على أنه مناسب للمهام الطويلة والمعقدة: هندسة البرمجيات، والعمل المعرفي، والرؤية، والبحث العلمي، وعمل الوكلاء طويل الأمد.
التداخل واضح.
| المجال | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|
| --- | --- | --- |
| العرض الرئيسي | نموذج رائد للوكلاء والاستدلال | نموذج متقدم من فئة Mythos للاستخدام العام |
| أقوى حالات الاستخدام | البرمجة، واستخدام الأدوات، واستخدام الكمبيوتر، والدقة الواقعية، والوكلاء | هندسة البرمجيات، والمهام الطويلة، والعمل المعرفي، والرؤية |
| إطار السلامة | بطاقة نظام للمعاينة، وفئات الاستعداد، والعمل على حقن التعليمات والمواءمة | ضمانات Fable، وتقسيم Mythos، والتوجيه الاحتياطي للمجالات الحساسة |
| سؤال المشتري | هل يمكنني الوثوق به ليتصرف عبر الأدوات؟ | هل يمكنني الحصول على الوصول إليه والحفاظ على استقراره باعتباره اعتمادًا؟ |
تتقارب الشركتان حول الحقيقة نفسها المتعلقة بالمنتج: يجب أن يعمل النموذج داخل نظام. عليه اتباع التعليمات، والتعامل مع الأدوات، وتجنب الإجراءات المدمرة، ومنح الفرق أدلة كافية للثقة في النتيجة.
وهذا هو الجزء الذي يهمني في وكلاء البرمجة. لا أحتاج إلى نموذج آخر يكتب نثرًا واثقًا. أحتاج إلى نموذج يستطيع فحص مستودع، وفهم القيود، وتشغيل الاختبارات، والتوقف قبل لمس عمل غير ذي صلة. كتبت المزيد عن أسلوب التشغيل هذا في سير عمل هدف وحلقة وكيل AI→.
أين يختلف GPT-5.6 عن Fable 5
الاختلاف الأول هو الوصول.
تبدأ OpenAI طرح GPT-5.6 بضوابط معاينة. وهذا نهج محافظ، لكنه واضح. أطلقت Anthropic Fable 5 على نطاق أوسع، ثم نشرت في 12 يونيو بيانًا قالت فيه إنها اضطرت إلى تعليق الوصول إلى Fable 5 وMythos 5 بعد توجيه من الحكومة الأمريكية بشأن ضوابط التصدير. وقالت Anthropic إن الوصول إلى نماذج Claude الأخرى لم يتأثر، لكن Fable 5 أصبح فجأة اعتمادًا صعبًا في الإنتاج.
وهذا يغير المقارنة. فقد يكون النموذج مذهلًا، ومع ذلك يصعب بناء الأنظمة حوله إذا تغير الوصول إليه دون فترة ترحيل عادية.
الاختلاف الثاني هو تركيز المنتج.
كانت قصة Fable 5 لدى Anthropic تتمحور أولًا حول القدرات: عمل أقوى طويل الأمد، وسياق ضخم جدًا، وتقسيم بين Fable 5 للاستخدام العام وMythos 5 للوصول الموثوق إلى الدفاع السيبراني. أما قصة GPT-5.6 لدى OpenAI فهي تتمحور أكثر حول النشر: عائلة من النماذج، وضوابط معاينة، وبطاقة نظام للسلامة، والعمل على حقن التعليمات، واهتمام صريح بأنماط فشل الوكلاء.
الاختلاف الثالث هو النبرة.
جعلت Anthropic من Fable 5 يبدو كقفزة تتجاوز خط Claude السابق. أما OpenAI فتضع GPT-5.6 باعتباره طبقة تشغيل أكثر أمانًا وموثوقية للأعمال الصعبة. قد يبدو ذلك أقل إثارة، لكنه بالضبط المكان الذي تتعطل فيه وكلاء AI في الإنتاج: أذونات الأدوات، والتحكم في السياق، والدقة الواقعية، والآثار الجانبية الخفية، وما إذا كان النموذج يعترف بعدم اليقين.
اختباري العملي لـ GPT-5.6
لن أحكم على GPT-5.6 Sol من مخططات الإطلاق وحدها. أول اختبار أريده هو مهمة هندسية حقيقية:
ينبغي للنموذج الجيد أن يقرأ قبل التعديل، ويجري أصغر تغيير آمن، ويتحقق من النتيجة، ويبلغ عن العوائق بدلًا من التظاهر بأن كل شيء اكتمل. حسّن GPT-5.5 هذا النمط بالفعل في Codex، وهو ما تناولته في اختبار GPT-5.5 Codex→. يجب أن يكون GPT-5.6 أفضل في الأجزاء المملة: افتراضات خاطئة أقل، واستدعاءات أدوات أنظف، وشروط توقف أكثر موثوقية.
لا يزال Fable 5 مهمًا لأنه وضع معيارًا للعمل الطويل والمعقد. وكانت مراجعتي لإطلاق Claude Fable 5 في يومه الأول→ إيجابية لهذا السبب. مشكلة الوصول لا تمحو قصة القدرات، لكنها تضيف درسًا في الشراء: أصبحت اختيارات AI المتقدمة تشمل الآن مخاطر السياسات، وليس مخاطر المعايير فقط.
الخلاصة
يبدو GPT-5.6 Sol كأنه رد OpenAI الجاد على لحظة Fable 5. تتشابه النماذج في طموحها: المهام الطويلة، والبرمجة، والوكلاء، والاستخدام الآمن للقدرات العالية. لكنها تختلف في استراتيجية الطرح. أظهرت Anthropic كيف يمكن أن تبدو قفزة في القدرات. وتحاول OpenAI أن تجعل القفزة التالية قابلة للنشر.
يجعل Sol Ultra الإطلاق أكثر إثارة للاهتمام لأنه يشير إلى التنفيذ متعدد الوكلاء، وليس فقط إلى استدلال أعمق لنموذج واحد. لكنني سأحكم عليه من خلال العمل الذي ينجزه: فحص المستودع، واستخدام الأدوات، والتعافي من الأخطاء، وما إذا كان يترك سجلًا واضحًا للإنسان المسؤول عن النظام.
بالنسبة إلى المطورين، الفائز ليس النموذج صاحب الإطلاق الأعلى ضجيجًا. الفائز هو النموذج الذي يستطيع إنجاز عمل حقيقي، واستخدام الأدوات بأمان، وترك سجل تدقيق واضح.
وهذا ما سأختبره أولًا.
