Grok 4.5 مقابل GPT-5.6 Sol و Claude Fable 5: حكم المقارنة
تقنية
Grok 4.5
SpaceXAI
xAI
GPT-5.6 Sol

Grok 4.5 مقابل GPT-5.6 Sol و Claude Fable 5: حكم المقارنة

يصل Grok 4.5 إلى الحدود بتكلفة أقل. انظر أين يتفوق على GPT-5.6 Sol و Claude Fable 5—ولماذا سأبقي على مجموعتي الحالية.

Uygar DuzgunUUygar Duzgun
Jul 18, 2026
تم التحديث 24 يوليو 2026
9 min read

Grok 4.5 مقابل GPT-5.6 Sol هو أول مقارنة في هذه الدورة الإصدار التي تجعل التكلفة سببًا جادًا لاختبار مزود آخر. لا يزال لا يجعلني أستبدل OpenAI أو Anthropic.

يصل النموذج الأخير من SpaceXAI إلى الحدود، يعمل بسرعة، ويتقاضى 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج. تضع الاختبارات المستقلة النموذج قريبًا من الوكلاء الرائدين في البرمجة. تضع نفس الاختبارات Grok 4.5 خمس نقاط خلف Sol وست نقاط خلف Claude Fable 5 من حيث الذكاء العام.

اعتبارًا من 18 يوليو 2026، تظل طريقتي OpenAI أولاً وAnthropic ثانيًا. يدخل Grok 4.5 في مسار اختبار محكوم لوكلاء البرمجة، والأتمتة، وأحمال العمل عالية الحجم. لم أستخدمه في الإنتاج بعد، لذا تفصل هذه المقارنة القياسات المنشورة عن قراري الخاص بالتوجيه.

الحكم القصير

أفضل ذكاء عام: سجل Claude Fable 5 60 على مؤشر الذكاء التحليلي الاصطناعي. سجل GPT-5.6 Sol 59، بينما سجل Grok 4.5 54.
أفضل نتيجة لوكيل البرمجة: يتصدر Sol في Codex بـ 80. سجل Fable 5 مع الاحتياطي 77، وسجل Grok 4.5 في Grok Build 76.
أفضل تكلفة: يكلف Grok 4.5 0.31 دولار لكل مهمة على مؤشر الذكاء التحليلي الاصطناعي، مقارنة بـ 1.04 دولار لـ Sol و2.75 دولار لـ Fable 5.
اختياري: سأبقي OpenAI كمنصة البرمجة والوكلاء الأساسية، وأستخدم Anthropic لأصعب الأعمال التحليلية، وأختبر Grok حيث يمكن أن تغير سرعته وتكلفته المنخفضة الاقتصاديات.

لـ Grok 4.5 دور واضح. إنه نموذج حدودي فعال من حيث التكلفة، وليس قائد الجودة الجديد.

ما هو Grok 4.5؟

أصدرت SpaceXAI Grok 4.5 في 8 يوليو كنموذجها الرائد للبرمجة، والمهام الوكيلة، وأعمال المعرفة. قامت الشركة بتدريبه جنبًا إلى جنب مع Cursor وجعلته متاحًا من خلال واجهة برمجة التطبيقات xAI، Grok Build، وCursor.

يقبل النموذج النصوص والصور، ويعيد النصوص، ويدعم استدعاء الوظائف، والمخرجات المنظمة، والتفكير القابل للتكوين. نافذة السياق الخاصة به هي 500,000 رمز. تاريخ المعرفة المنشور هو 1 فبراير 2026، لذا تتطلب المعلومات الحالية أدوات البحث على الويب أو X الخاصة بـ xAI.

Grok Build مفتوح المصدر، مما يمنح الفرق وسيلة لفحص حلقة الوكيل، وتجميع السياق، وإرسال الأدوات، والربط، والمهارات، والإضافات، ودمج MCP. يظل نموذج Grok 4.5 نفسه ملكية خاصة؛ لم تصدر SpaceXAI أوزانه.

Grok 4.5 مقابل GPT-5.6 Sol مقابل Claude Fable 5

تفضل المقارنة العامة Anthropic وOpenAI من حيث الجودة، ثم Grok من حيث التكلفة. تجمع هذه القيم بين اختبارات الذكاء التحليلي المستقلة مع الوثائق الحالية لواجهة برمجة التطبيقات لكل مزود.

المقياسGrok 4.5GPT-5.6 SolClaude Fable 5
------:---:---:
مؤشر الذكاء التحليلي الاصطناعي545960
مؤشر وكيل البرمجة76 في Grok Build80 في Codex77 في Claude Code مع الاحتياطي
التكلفة لكل مهمة على مؤشر الذكاء0.31 دولار1.04 دولار2.75 دولار
نافذة السياق500k رمز1.05M رمز1M رمز
واجهة برمجة التطبيقات الإدخال/الإخراج لكل 1M رمز2 دولار / 6 دولارات5 دولارات / 30 دولارًا10 دولارات / 50 دولارًا
الأوزانمغلقةمغلقةمغلقة
Grok 4.5 و GPT-5.6 Sol و Claude Fable 5 ونماذج الحدود الأخرى على مؤشر الذكاء التحليلي الاصطناعي
Grok 4.5 و GPT-5.6 Sol و Claude Fable 5 ونماذج الحدود الأخرى على مؤشر الذكاء التحليلي الاصطناعي

*المصدر: التحليل الاصطناعي، 17 يوليو 2026. يجمع مؤشره v4.1 بين تسع تقييمات وكيلة، برمجية، تحليلية، معرفية، وطويلة السياق.*

تفصل خمس نقاط بين Grok وSol، وست نقاط تفصل بينه وبين Fable. هذه الفجوة كبيرة بما يكفي لتظهر في المهام الصعبة، ولكن صغيرة بما يكفي أن التكلفة، والكمون، وموثوقية الأدوات يمكن أن تعكس النتيجة العملية في العمل عالي الحجم.

أين يتفوق Grok 4.5؟

وكلاء البرمجة وأعمال المحطة الطرفية

يسجل Grok 4.5 76 في Grok Build على مؤشر وكيل البرمجة التحليلي الاصطناعي. يتصدر Sol بـ 80 في Codex. سجل Fable 5 77 في Claude Code، على الرغم من أن هذا التكوين يمكن أن يعود إلى Opus 4.8.

تفصل نقطة واحدة بين Grok وتكوين Fable المختبر. تفصل أربع نقاط بينه وبين Sol. هذا قريب بما يكفي لتبرير التجارب على مستوى المستودع، خاصة عندما يقوم الوكيل بإجراء مئات من استدعاءات الأدوات وتكاليف رموز الإخراج تتراكم.

Grok 4.5 في Grok Build مقارنة مع GPT-5.6 Sol في Codex وClaude Fable 5 في Claude Code على مؤشر وكيل البرمجة
Grok 4.5 في Grok Build مقارنة مع GPT-5.6 Sol في Codex وClaude Fable 5 في Claude Code على مؤشر وكيل البرمجة

*المصدر: التحليل الاصطناعي. يتوسط المؤشر بين DeepSWE وTerminal-Bench v2 وSWE-Atlas-QnA. تختلف أدوات القياس، لذا يقيس الرسم البياني مجموعة النموذج والوكيل.*

تخبرنا جدول إطلاق SpaceXAI قصة مشابهة ولكن أقل حداثة. يتصدر Grok SWE Marathon بنسبة 29.0%، ويسجل 83.3% على Terminal-Bench 2.1، ويصل إلى 64.7% على SWE-Bench Pro. يتصدر Fable 5 أربعة من اختبارات البرمجة الخمسة المعروضة. قارن SpaceXAI Grok مع GPT-5.5 بدلاً من GPT-5.6 Sol، لذا لن أستخدم جدول ذلك المورد للحكم المباشر على Sol.

السرعة وكفاءة الرموز

قاس التحليل الاصطناعي Grok 4.5 بحوالي 112 رمز إخراج في الثانية. تفيد SpaceXAI أن النموذج استخدم 15,954 رمز إخراج لكل مهمة تم حلها على SWE-Bench Pro، وهو أقل بـ 4.2 مرات من Claude Opus 4.8 في مقارنته.

تصف هذه الأرقام إعدادات اختبار مختلفة، لكنها تشير في نفس الاتجاه: تم تصميم Grok لإنهاء الأعمال الوكيلة مع إخراج أقل. تعتبر التوفير مهمًا عندما يقرأ وكيل البرمجة الملفات، ويشغل الأوامر، ويصلح الفشل، ويكرر الحلقة.

هل Grok 4.5 هو الفائز من حيث التكلفة؟

بالنسبة للمطالبات التي تقل عن 200,000 رمز، تتقاضى xAI 2 دولار لكل مليون رمز إدخال، و0.50 دولار للإدخال المخزن، و6 دولارات للإخراج. بمجرد أن تتجاوز المطالبة 200,000 رمز، تتضاعف الأسعار إلى 4 دولارات، و1 دولار، و12 دولارًا عبر الطلب بالكامل.

سعر القائمة للسياق القصير أقل بنسبة 60% من Sol على الإدخال وأقل بنسبة 80% منه على الإخراج. يكلف Fable 5 خمسة أضعاف تكلفة الإدخال وأكثر من ثمانية أضعاف تكلفة الإخراج.

رسم بياني للتحليل الاصطناعي يقارن ذكاء النموذج مع التكلفة لكل مهمة معيارية، بما في ذلك Grok 4.5 وGPT-5.6 Sol وClaude Fable 5
رسم بياني للتحليل الاصطناعي يقارن ذكاء النموذج مع التكلفة لكل مهمة معيارية، بما في ذلك Grok 4.5 وGPT-5.6 Sol وClaude Fable 5

*المصدر: التحليل الاصطناعي. تشمل التكلفة لكل مهمة الرموز التي استخدمها كل نموذج، بدلاً من مقارنة بطاقات الأسعار فقط.*

التكلفة المستقلة للمهمة أكثر فائدة من بطاقة السعر: 0.31 دولار لـ Grok، و1.04 دولار لـ Sol، و2.75 دولار لـ Fable. يتخلى Grok عن خمس نقاط ذكاء لـ Sol بينما يقلل تكلفة الاختبار تلك بحوالي 70%.

لا تزال تكلفة الإنتاج تشمل استدعاءات الأدوات الفاشلة، والتصحيحات المتكررة، ووقت المراجعة، والانحدارات. يمكن أن تكلف عملية رخيصة تحتاج إلى مطور كبير لإصلاح النتيجة أكثر من عملية نظيفة باهظة الثمن.

أين يتخلف Grok 4.5؟

الجودة العامة والسياق الطويل

يتصدر Sol وFable المؤشر المستقل العام. كلاهما يقدم أيضًا تقريبًا ضعف نافذة السياق الخاصة بـ Grok. تؤثر هذه الفجوة على المستودعات الكبيرة، وحزم البحث الطويلة، وجلسات الوكلاء التي لا يمكنها ضغط تاريخها دون فقدان أدلة مفيدة.

تعزز معايير إطلاق Grok الفجوة. يتصدر Fable DeepSWE 1.0 وDeepSWE 1.1 وTerminal-Bench 2.1 وSWE-Bench Pro في الرسم البياني الخاص بـ SpaceXAI. يفوز Grok في SWE Marathon، الذي يختبر مهام هندسة البرمجيات الأطول، لكن فوزًا واحدًا لا يثبت القيادة المستمرة.

موثوقية المعرفة

حسن Grok 4.5 دقة AA-Omniscience من 35% لـ Grok 4.3 إلى 52%. ارتفعت نسبة الهلوسة من 25% إلى 54%. زادت درجة Omniscience المجمعة من 18 إلى 26 لأن Grok أجاب على المزيد من الأسئلة بشكل صحيح، لكنه أيضًا قدم المزيد من الإجابات غير المدعومة بدلاً من الانخفاض.

دقة معرفة Grok 4.5، ونسبة الهلوسة، ودرجة AA-Omniscience مقارنة بالنماذج الرائدة في الذكاء الاصطناعي
دقة معرفة Grok 4.5، ونسبة الهلوسة، ودرجة AA-Omniscience مقارنة بالنماذج الرائدة في الذكاء الاصطناعي

*المصدر: تقييم Grok 4.5 من التحليل الاصطناعي. تنتمي نسبة الهلوسة إلى AA-Omniscience ولا ينبغي تعميمها على كل نوع من المطالبات.*

سأحتاج إلى استرجاع، وأدلة مقتبسة، والتحقق الخارجي للنشر الواقعي مع Grok. تنطبق نفس القاعدة على Sol وFable، لكن تحول دقة Grok مقابل الهلوسة يستحق اختبارًا مخصصًا.

ما الذي يمنع Grok 4.5 من مجموعتي الحالية؟

أحتاج إلى وصول متوافق مع الاتحاد الأوروبي لهذه النشر. لا تزال وثائق Grok 4.5 الخاصة بـ xAI تقول إن الوصول إلى واجهة برمجة التطبيقات غير متاح لمستخدمي الاتحاد الأوروبي ومن المتوقع لاحقًا في يوليو. قد يتغير ذلك قريبًا، لكنه يمنع مسار إنتاج مستقر اليوم.

تخزن xAI مدخلات ومخرجات واجهة برمجة التطبيقات لمدة 30 يومًا بشكل افتراضي وتقول إنها لا تدرب عليها دون إذن صريح. تتوفر Zero Data Retention للفرق المؤهلة، على الرغم من أن تمكينها يزيل ميزات واجهة برمجة التطبيقات الاستجابة ذات الحالة، والملفات والمجموعات، ودعم واجهة برمجة التطبيقات الدفعة. تحتاج أي تجربة إنتاج إلى مراجعة معالجة البيانات قبل أن تصل المواد البرمجية أو مواد العملاء إلى الخدمة.

قراءة مقترحة

تظل OpenAI هي الافتراضية الخاصة بي لأن Sol يتصدر مؤشر وكيل البرمجة الحالي، ولديه نافذة سياق تبلغ 1.05 مليون رمز، ويتناسب مع سير العمل الخاص بـ Codex وResponses API التي أستخدمها بالفعل. مقارنة GPT-5.6 Sol وFable 5 الخاصة بي تشرح ذلك المسار بمزيد من التفصيل.

تظل Anthropic هي طريقتي الثانية للتحليل الطويل والغامض حيث يمكن أن تغطي ميزة جودة Fable سعره الأعلى. يحتاج Grok إلى التفوق على أحد تلك المسارات من حيث تكلفة المهمة المنجزة، وليس سعر الرموز فقط.

قراءة مقترحة

معياري يأتي من بناء وكلاء ذكاء اصطناعي يعملون فعليًا: قياس العمل المنجز، وفشل الأدوات، ووقت المراجعة، والتعافي بعد إجراء سيء.

كيف سأختبر Grok 4.5

تشغيل نفس مشكلة المستودع في Grok Build وCodex وClaude Code. تسجيل التغييرات المقبولة، والرموز، والأوامر، والاختبارات الفاشلة، ودقائق المراجعة.
إعطاء كل نموذج حزمة بحث طويلة مع مصادر متضاربة. قياس تغطية الاقتباس، والمطالبات غير المدعومة، والتصحيحات بعد التعليقات.
تكرار سير عمل المتصفح وجداول البيانات عشر مرات. مقارنة معدل الإنجاز، والكمون، والتكلفة الإجمالية لواجهة برمجة التطبيقات بدلاً من أفضل تشغيل فردي.

سأعيد النظر في التوجيه بعد فتح الوصول إلى الاتحاد الأوروبي ونجاح Grok في تلك الاختبارات. حتى ذلك الحين، Grok 4.5 هو مرشح يستحق المقارنة بدلاً من الاعتماد على الإنتاج.

اختيار نموذج عملي

اختر Grok 4.5 عندما تهيمن الأعمال الوكيلة عالية الحجم، والإخراج السريع، والتكلفة لكل مهمة مكتملة على القرار—وعندما تناسب نافذته السياقية البالغة 500,000 رمز وتوافره الإقليمي نشراتك.

اختر GPT-5.6 Sol عندما تريد أقوى نتيجة لوكيل البرمجة الحالي، وسطح أدوات ناضج، ونافذة سياق أكبر داخل نظام OpenAI البيئي.

اختر Claude Fable 5 عندما تكون المهمة صعبة تحليليًا بما يكفي لتبرير أعلى سعر للرموز وتقدر ميزته على المعيار الذكاء العام.

تظل طريقتي OpenAI بالإضافة إلى Anthropic، مع Grok في الاختبار. يجعل Grok 4.5 ذلك الاختبار مثيرًا من الناحية الاقتصادية. لا تبرر النتائج المنشورة بعد الانتقال.

المصادر والمنهجية

تحققت من إعلان Grok 4.5 من SpaceXAI، وثائق النموذج، جدول الأسعار المباشر، أسئلة شائعة حول الأمان، وإعلان Grok Build مفتوح المصدر. تأتي النتائج المستقلة من تقييم Grok 4.5 من التحليل الاصطناعي ومقارنة الحدود في 17 يوليو. استخدمت GPT-5.6 Sol من OpenAI ووثائق Claude Fable 5 من Anthropic للمواصفات والأسعار المتنافسة.

تظل الدرجات والأسعار وملاحظات الوصول وسلوك المنتج سارية اعتبارًا من 18 يوليو 2026. يمكن أن تغير المزودات سلوك الخدمة، والأسعار، والوصول الإقليمي، وأسماء النماذج دون تغيير المقالة.