Grok 4.5 مقابل GPT-5.6 Sol هو أول مقارنة في هذه الدورة الإصدار التي تجعل التكلفة سببًا جادًا لاختبار مزود آخر. لا يزال لا يجعلني أستبدل OpenAI أو Anthropic.
يصل النموذج الأخير من SpaceXAI إلى الحدود، يعمل بسرعة، ويتقاضى 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج. تضع الاختبارات المستقلة النموذج قريبًا من الوكلاء الرائدين في البرمجة. تضع نفس الاختبارات Grok 4.5 خمس نقاط خلف Sol وست نقاط خلف Claude Fable 5 من حيث الذكاء العام.
اعتبارًا من 18 يوليو 2026، تظل طريقتي OpenAI أولاً وAnthropic ثانيًا. يدخل Grok 4.5 في مسار اختبار محكوم لوكلاء البرمجة، والأتمتة، وأحمال العمل عالية الحجم. لم أستخدمه في الإنتاج بعد، لذا تفصل هذه المقارنة القياسات المنشورة عن قراري الخاص بالتوجيه.
الحكم القصير
لـ Grok 4.5 دور واضح. إنه نموذج حدودي فعال من حيث التكلفة، وليس قائد الجودة الجديد.
ما هو Grok 4.5؟
أصدرت SpaceXAI Grok 4.5 في 8 يوليو كنموذجها الرائد للبرمجة، والمهام الوكيلة، وأعمال المعرفة. قامت الشركة بتدريبه جنبًا إلى جنب مع Cursor وجعلته متاحًا من خلال واجهة برمجة التطبيقات xAI، Grok Build، وCursor.
يقبل النموذج النصوص والصور، ويعيد النصوص، ويدعم استدعاء الوظائف، والمخرجات المنظمة، والتفكير القابل للتكوين. نافذة السياق الخاصة به هي 500,000 رمز. تاريخ المعرفة المنشور هو 1 فبراير 2026، لذا تتطلب المعلومات الحالية أدوات البحث على الويب أو X الخاصة بـ xAI.
Grok Build مفتوح المصدر، مما يمنح الفرق وسيلة لفحص حلقة الوكيل، وتجميع السياق، وإرسال الأدوات، والربط، والمهارات، والإضافات، ودمج MCP. يظل نموذج Grok 4.5 نفسه ملكية خاصة؛ لم تصدر SpaceXAI أوزانه.
Grok 4.5 مقابل GPT-5.6 Sol مقابل Claude Fable 5
تفضل المقارنة العامة Anthropic وOpenAI من حيث الجودة، ثم Grok من حيث التكلفة. تجمع هذه القيم بين اختبارات الذكاء التحليلي المستقلة مع الوثائق الحالية لواجهة برمجة التطبيقات لكل مزود.
| المقياس | Grok 4.5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| مؤشر الذكاء التحليلي الاصطناعي | 54 | 59 | 60 |
| مؤشر وكيل البرمجة | 76 في Grok Build | 80 في Codex | 77 في Claude Code مع الاحتياطي |
| التكلفة لكل مهمة على مؤشر الذكاء | 0.31 دولار | 1.04 دولار | 2.75 دولار |
| نافذة السياق | 500k رمز | 1.05M رمز | 1M رمز |
| واجهة برمجة التطبيقات الإدخال/الإخراج لكل 1M رمز | 2 دولار / 6 دولارات | 5 دولارات / 30 دولارًا | 10 دولارات / 50 دولارًا |
| الأوزان | مغلقة | مغلقة | مغلقة |

*المصدر: التحليل الاصطناعي، 17 يوليو 2026. يجمع مؤشره v4.1 بين تسع تقييمات وكيلة، برمجية، تحليلية، معرفية، وطويلة السياق.*
تفصل خمس نقاط بين Grok وSol، وست نقاط تفصل بينه وبين Fable. هذه الفجوة كبيرة بما يكفي لتظهر في المهام الصعبة، ولكن صغيرة بما يكفي أن التكلفة، والكمون، وموثوقية الأدوات يمكن أن تعكس النتيجة العملية في العمل عالي الحجم.
أين يتفوق Grok 4.5؟
وكلاء البرمجة وأعمال المحطة الطرفية
يسجل Grok 4.5 76 في Grok Build على مؤشر وكيل البرمجة التحليلي الاصطناعي. يتصدر Sol بـ 80 في Codex. سجل Fable 5 77 في Claude Code، على الرغم من أن هذا التكوين يمكن أن يعود إلى Opus 4.8.
تفصل نقطة واحدة بين Grok وتكوين Fable المختبر. تفصل أربع نقاط بينه وبين Sol. هذا قريب بما يكفي لتبرير التجارب على مستوى المستودع، خاصة عندما يقوم الوكيل بإجراء مئات من استدعاءات الأدوات وتكاليف رموز الإخراج تتراكم.

*المصدر: التحليل الاصطناعي. يتوسط المؤشر بين DeepSWE وTerminal-Bench v2 وSWE-Atlas-QnA. تختلف أدوات القياس، لذا يقيس الرسم البياني مجموعة النموذج والوكيل.*
تخبرنا جدول إطلاق SpaceXAI قصة مشابهة ولكن أقل حداثة. يتصدر Grok SWE Marathon بنسبة 29.0%، ويسجل 83.3% على Terminal-Bench 2.1، ويصل إلى 64.7% على SWE-Bench Pro. يتصدر Fable 5 أربعة من اختبارات البرمجة الخمسة المعروضة. قارن SpaceXAI Grok مع GPT-5.5 بدلاً من GPT-5.6 Sol، لذا لن أستخدم جدول ذلك المورد للحكم المباشر على Sol.
السرعة وكفاءة الرموز
قاس التحليل الاصطناعي Grok 4.5 بحوالي 112 رمز إخراج في الثانية. تفيد SpaceXAI أن النموذج استخدم 15,954 رمز إخراج لكل مهمة تم حلها على SWE-Bench Pro، وهو أقل بـ 4.2 مرات من Claude Opus 4.8 في مقارنته.
تصف هذه الأرقام إعدادات اختبار مختلفة، لكنها تشير في نفس الاتجاه: تم تصميم Grok لإنهاء الأعمال الوكيلة مع إخراج أقل. تعتبر التوفير مهمًا عندما يقرأ وكيل البرمجة الملفات، ويشغل الأوامر، ويصلح الفشل، ويكرر الحلقة.
هل Grok 4.5 هو الفائز من حيث التكلفة؟
بالنسبة للمطالبات التي تقل عن 200,000 رمز، تتقاضى xAI 2 دولار لكل مليون رمز إدخال، و0.50 دولار للإدخال المخزن، و6 دولارات للإخراج. بمجرد أن تتجاوز المطالبة 200,000 رمز، تتضاعف الأسعار إلى 4 دولارات، و1 دولار، و12 دولارًا عبر الطلب بالكامل.
سعر القائمة للسياق القصير أقل بنسبة 60% من Sol على الإدخال وأقل بنسبة 80% منه على الإخراج. يكلف Fable 5 خمسة أضعاف تكلفة الإدخال وأكثر من ثمانية أضعاف تكلفة الإخراج.

*المصدر: التحليل الاصطناعي. تشمل التكلفة لكل مهمة الرموز التي استخدمها كل نموذج، بدلاً من مقارنة بطاقات الأسعار فقط.*
التكلفة المستقلة للمهمة أكثر فائدة من بطاقة السعر: 0.31 دولار لـ Grok، و1.04 دولار لـ Sol، و2.75 دولار لـ Fable. يتخلى Grok عن خمس نقاط ذكاء لـ Sol بينما يقلل تكلفة الاختبار تلك بحوالي 70%.
لا تزال تكلفة الإنتاج تشمل استدعاءات الأدوات الفاشلة، والتصحيحات المتكررة، ووقت المراجعة، والانحدارات. يمكن أن تكلف عملية رخيصة تحتاج إلى مطور كبير لإصلاح النتيجة أكثر من عملية نظيفة باهظة الثمن.
أين يتخلف Grok 4.5؟
الجودة العامة والسياق الطويل
يتصدر Sol وFable المؤشر المستقل العام. كلاهما يقدم أيضًا تقريبًا ضعف نافذة السياق الخاصة بـ Grok. تؤثر هذه الفجوة على المستودعات الكبيرة، وحزم البحث الطويلة، وجلسات الوكلاء التي لا يمكنها ضغط تاريخها دون فقدان أدلة مفيدة.
تعزز معايير إطلاق Grok الفجوة. يتصدر Fable DeepSWE 1.0 وDeepSWE 1.1 وTerminal-Bench 2.1 وSWE-Bench Pro في الرسم البياني الخاص بـ SpaceXAI. يفوز Grok في SWE Marathon، الذي يختبر مهام هندسة البرمجيات الأطول، لكن فوزًا واحدًا لا يثبت القيادة المستمرة.
موثوقية المعرفة
حسن Grok 4.5 دقة AA-Omniscience من 35% لـ Grok 4.3 إلى 52%. ارتفعت نسبة الهلوسة من 25% إلى 54%. زادت درجة Omniscience المجمعة من 18 إلى 26 لأن Grok أجاب على المزيد من الأسئلة بشكل صحيح، لكنه أيضًا قدم المزيد من الإجابات غير المدعومة بدلاً من الانخفاض.

*المصدر: تقييم Grok 4.5 من التحليل الاصطناعي. تنتمي نسبة الهلوسة إلى AA-Omniscience ولا ينبغي تعميمها على كل نوع من المطالبات.*
سأحتاج إلى استرجاع، وأدلة مقتبسة، والتحقق الخارجي للنشر الواقعي مع Grok. تنطبق نفس القاعدة على Sol وFable، لكن تحول دقة Grok مقابل الهلوسة يستحق اختبارًا مخصصًا.
ما الذي يمنع Grok 4.5 من مجموعتي الحالية؟
أحتاج إلى وصول متوافق مع الاتحاد الأوروبي لهذه النشر. لا تزال وثائق Grok 4.5 الخاصة بـ xAI تقول إن الوصول إلى واجهة برمجة التطبيقات غير متاح لمستخدمي الاتحاد الأوروبي ومن المتوقع لاحقًا في يوليو. قد يتغير ذلك قريبًا، لكنه يمنع مسار إنتاج مستقر اليوم.
تخزن xAI مدخلات ومخرجات واجهة برمجة التطبيقات لمدة 30 يومًا بشكل افتراضي وتقول إنها لا تدرب عليها دون إذن صريح. تتوفر Zero Data Retention للفرق المؤهلة، على الرغم من أن تمكينها يزيل ميزات واجهة برمجة التطبيقات الاستجابة ذات الحالة، والملفات والمجموعات، ودعم واجهة برمجة التطبيقات الدفعة. تحتاج أي تجربة إنتاج إلى مراجعة معالجة البيانات قبل أن تصل المواد البرمجية أو مواد العملاء إلى الخدمة.
تظل OpenAI هي الافتراضية الخاصة بي لأن Sol يتصدر مؤشر وكيل البرمجة الحالي، ولديه نافذة سياق تبلغ 1.05 مليون رمز، ويتناسب مع سير العمل الخاص بـ Codex وResponses API التي أستخدمها بالفعل. مقارنة GPT-5.6 Sol وFable 5 الخاصة بي→ تشرح ذلك المسار بمزيد من التفصيل.
تظل Anthropic هي طريقتي الثانية للتحليل الطويل والغامض حيث يمكن أن تغطي ميزة جودة Fable سعره الأعلى. يحتاج Grok إلى التفوق على أحد تلك المسارات من حيث تكلفة المهمة المنجزة، وليس سعر الرموز فقط.
معياري يأتي من بناء وكلاء ذكاء اصطناعي يعملون فعليًا→: قياس العمل المنجز، وفشل الأدوات، ووقت المراجعة، والتعافي بعد إجراء سيء.
كيف سأختبر Grok 4.5
سأعيد النظر في التوجيه بعد فتح الوصول إلى الاتحاد الأوروبي ونجاح Grok في تلك الاختبارات. حتى ذلك الحين، Grok 4.5 هو مرشح يستحق المقارنة بدلاً من الاعتماد على الإنتاج.
اختيار نموذج عملي
اختر Grok 4.5 عندما تهيمن الأعمال الوكيلة عالية الحجم، والإخراج السريع، والتكلفة لكل مهمة مكتملة على القرار—وعندما تناسب نافذته السياقية البالغة 500,000 رمز وتوافره الإقليمي نشراتك.
اختر GPT-5.6 Sol عندما تريد أقوى نتيجة لوكيل البرمجة الحالي، وسطح أدوات ناضج، ونافذة سياق أكبر داخل نظام OpenAI البيئي.
اختر Claude Fable 5 عندما تكون المهمة صعبة تحليليًا بما يكفي لتبرير أعلى سعر للرموز وتقدر ميزته على المعيار الذكاء العام.
تظل طريقتي OpenAI بالإضافة إلى Anthropic، مع Grok في الاختبار. يجعل Grok 4.5 ذلك الاختبار مثيرًا من الناحية الاقتصادية. لا تبرر النتائج المنشورة بعد الانتقال.
المصادر والمنهجية
تحققت من إعلان Grok 4.5 من SpaceXAI، وثائق النموذج، جدول الأسعار المباشر، أسئلة شائعة حول الأمان، وإعلان Grok Build مفتوح المصدر. تأتي النتائج المستقلة من تقييم Grok 4.5 من التحليل الاصطناعي ومقارنة الحدود في 17 يوليو. استخدمت GPT-5.6 Sol من OpenAI ووثائق Claude Fable 5 من Anthropic للمواصفات والأسعار المتنافسة.
تظل الدرجات والأسعار وملاحظات الوصول وسلوك المنتج سارية اعتبارًا من 18 يوليو 2026. يمكن أن تغير المزودات سلوك الخدمة، والأسعار، والوصول الإقليمي، وأسماء النماذج دون تغيير المقالة.