كيمي K3 مقابل GPT-5.6 سول وكلود فابل 5: حكم الاختبار
تقنية
Kimi K3
Moonshot AI
GPT-5.6 Sol
Claude Fable 5

كيمي K3 مقابل GPT-5.6 سول وكلود فابل 5: حكم الاختبار

كيمي K3 تصل إلى الحدود وتفوز في اختبارات الترميز الرئيسية. حكمي المستند إلى الاختبارات: اختبره، لكن احتفظ بـ OpenAI و Anthropic في الإنتاج.

Uygar DuzgunUUygar Duzgun
Jul 18, 2026
تم التحديث 23 يوليو 2026
9 min read

كيمي K3 مقابل GPT-5.6 سول قريب بما يكفي لجعلي أعيد إجراء اختبارات التوجيه الخاصة بي. نموذج Moonshot لا يزال لا يحل محل OpenAI أو Anthropic في مجموعتي.

هذا الاستنتاج أقل دراماتيكية من عناوين الإطلاق، لكن الأرقام تدعمه. يحتل نموذج Moonshot AI الجديد المرتبة الثالثة في مؤشر الذكاء المستقل، ويتصدر ساحة الترميز الأمامية العمياء، ويتفوق على GPT-5.6 سول في اختبار واحد للعمل المعرفي على المدى الطويل. كما أنه لا يزال متأخراً عن كلود فابل 5 وسول في أوسع المقاييس، ولا تزال أوزانه القابلة للتنزيل وعداً لموعد مستقبلي.

اعتبارًا من 18 يوليو 2026، أرى كيمي K3 كمرشح تقييم جاد بدلاً من سبب للانتقال إلى العمل الإنتاجي. لم أضع K3 في اختباري الإنتاجي الخاص بعد، لذا أفصل نتائج الأطراف الثالثة عن قراري بالتوجيه أدناه.

الحكم القصير

أفضل درجة إجمالية: يتصدر كلود فابل 5 مؤشر الذكاء التحليلي الاصطناعي عند 60. تسجل GPT-5.6 سول 59، وكيمي K3 تسجل 57.
أفضل نتيجة أمامية عمياء: يتصدر كيمي K3 تصنيف كود الواجهة في Arena عند 1,679 إلو، متقدماً على فابل 5 عند 1,631 وسول عند 1,618.
أفضل سعر API: يكلف K3 3 دولارات لكل مليون رمز إدخال و15 دولارًا لكل مليون رمز إخراج. يكلف سول 5 دولارات / 30 دولارًا، بينما يكلف فابل 5 10 دولارات / 50 دولارًا.
اختياري: سأحتفظ بـ OpenAI كمنصتي الأساسية للترميز والوكيل، مع Anthropic لأصعب التحليلات على المدى الطويل. سأختبر K3 في واجهة المستخدم، والأتمتة، وأعباء البحث قبل منحها حركة مرور الإنتاج.

النتيجة هي سباق بين ثلاثة نماذج مع فائزين مختلفين حسب المهمة. لا يمكن أن تخبرك لوحة المتصدرين الواحدة أي نموذج سينهي عملك بأقل عدد من المحاولات.

ما هو كيمي K3؟

قدمت Moonshot AI كيمي K3 في 16 يوليو كنموذج مكون من 2.8 تريليون معلمة من نوع Mixture-of-Experts. يقوم جهاز التوجيه الخاص به باختيار 16 من 896 خبيرًا لكل رمز. كما أن K3 يحتوي أيضًا على إدخال صورة أصلي، ونافذة سياق مكونة من مليون رمز، وإخراج نصي.

تنسب Moonshot القفزة من K2 إلى تغييرين معماريين: كيمي دلتا انتباه واهتمام متبقي. تفيد الشركة بأن كيمي K3 يتمتع بكفاءة توسيع أفضل بحوالي 2.5 مرة من K2، لكن لم يتم نشر تقرير فني بعد. لا يزال هذا الرقم ادعاءً من البائع.

الـ API متاحة الآن. تقول Moonshot إن الأوزان الكاملة ستصل بحلول 27 يوليو. حتى وصول تلك الملفات، فإن K3 هو نموذج مفتوح الوزن تم الإعلان عنه، وليس نموذجًا يمكنك تنزيله والتحقق منه بالفعل على بنيتك التحتية الخاصة.

كيمي K3 مقابل GPT-5.6 سول مقابل كلود فابل 5

أكثر المقارنات وضوحًا تجمع بين الاختبارات المستقلة مع المواصفات الرسمية للمنتج. تأتي الصفوف الأربعة الأولى أدناه من التحليل الاصطناعي وArena؛ تأتي السياق والأسعار من وثائق كل مزود.

المقياسكيمي K3GPT-5.6 سولكلود فابل 5
------:---:---:
مؤشر الذكاء التحليلي الاصطناعي575960
GDPval-AA v21,668 إلو1,748 إلو1,760 إلو
AA-Briefcase العمل المعرفي1,547 إلو1,495 إلو1,583 إلو
ساحة كود الواجهة1,679 إلو1,618 إلو1,631 إلو
نافذة السياق1M رموز1.05M رموز1M رموز
إدخال/إخراج API لكل 1M رموز3 دولارات / 15 دولارًا5 دولارات / 30 دولارًا10 دولارات / 50 دولارًا
الأوزانوعدت في 27 يوليومغلقةمغلقة
مؤشر الذكاء التحليلي الاصطناعي يقارن كيمي K3، كلود فابل 5، GPT-5.6 سول، ونماذج أخرى
مؤشر الذكاء التحليلي الاصطناعي يقارن كيمي K3، كلود فابل 5، GPT-5.6 سول، ونماذج أخرى

*المصدر: التحليل الاصطناعي، 17 يوليو 2026. يجمع مؤشر v4.1 الخاص به بين تسع تقييمات للترميز، والتفكير، والمعرفة، والوكالة.*

الفجوة ذات النقطتين بين K3 وسول صغيرة بما يكفي لتكون أقل أهمية من جودة الحزمة، والكمون، واستخدام الرموز، واستعادة الفشل. لا تزال الفجوة ذات الثلاث نقاط إلى فابل 5 حقيقية. لقد وصلت K3 إلى مجموعة الحدود؛ لكنها لم تفز بالمجموعة.

أين تفوز كيمي K3؟

الترميز الأمامي والتكرار البصري

أقوى نتيجة مستقلة لـ K3 هي ساحة كود الواجهة. يقارن المقيمون البشريون المخرجات الأمامية القابلة للتشغيل المجهولة ويصوتون للنتيجة الأفضل. وصلت K3 إلى 1,679 إلو، 48 نقطة فوق فابل 5 و61 فوق سول. كما وضعتها Arena في المرتبة الأولى في ست من سبع فئات أمامية.

تلك النتيجة مهمة للفرق التي تبني صفحات الهبوط، ولوحات المعلومات، وإعادة إنشاء التصميمات، والأدوات البصرية. تقيس التفضيل للإنتاج العملي، وليس فقط ما إذا كانت وحدة الاختبار قد نجحت.

جدول الترميز الأوسع لـ Moonshot مختلط. يتصدر K3 برنامج Bench عند 77.8 وSWE Marathon عند 42.0. يتصدر سول DeepSWE عند 73.0 وTerminal-Bench 2.1 عند 88.8. يتصدر فابل 5 FrontierSWE عند 86.6 ومقارنة Kimi Code Bench الداخلية لـ Moonshot عند 76.9.

مقارنة معيار الترميز لـ Moonshot AI لكيمي K3، GPT-5.6 سول، كلود فابل 5، ونماذج أخرى
مقارنة معيار الترميز لـ Moonshot AI لكيمي K3، GPT-5.6 سول، كلود فابل 5، ونماذج أخرى

*المصدر: منشور إطلاق كيمي K3 من Moonshot AI. هذه هي النتائج التي جمعها البائع، وغالبًا ما تستخدم النماذج حزم وكيل مختلفة.*

اختيار الحزمة يغير النتيجة. غالبًا ما تعمل K3 في Kimi Code، وسول في Codex، وفابل في Claude Code. يمكن أن يقيس المعيار النموذج، أو الحزمة، أو التفاعل بين الاثنين. سأعيد تشغيل مهمة مستودع تمثيلية داخل الأداة التي أخطط لنشرها.

الأتمتة والعمل المعرفي

يعطي التحليل الاصطناعي K3 درجة 53% والمركز الأول في AutomationBench-AA. في AA-Briefcase، وهو تقييم خاص للعمل المعرفي على المدى الطويل، تسجل K3 1,547 إلو. يتفوق ذلك على 1,495 لسول ويتخلف عن 1,583 لفابل 5.

تقييم Moonshot يضع K3 أيضًا في المقدمة بشكل ضيق في BrowseComp وSpreadsheetBench 2. يتصدر فابل GDPval-AA وJobBench ودرجة AA-Briefcase العامة. يبقى سول الأقوى من حيث جودة العرض ضمن تحليل AA-Briefcase.

مقارنة معيار الوكيل والرؤية لـ Moonshot AI لكيمي K3، GPT-5.6 سول، وكلود فابل 5
مقارنة معيار الوكيل والرؤية لـ Moonshot AI لكيمي K3، GPT-5.6 سول، وكلود فابل 5

*المصدر: Moonshot AI. يتضمن الرسم البياني درجات مستقلة، ولوحات متصدرين عامة، واختبارات أجرتها Moonshot؛ اقرأ الحواشي السفلية قبل اعتبار الأعمدة تجربة واحدة خاضعة للتحكم.*

يبدو أن K3 مفيدة لوكلاء البحث، وأعمال جداول البيانات، وأتمتة المتصفح. يبقى فابل الخيار الأكثر أمانًا عندما تكون جودة التحليل أكثر أهمية من السعر. يناسب سول الفرق التي تستخدم بالفعل Codex، وAPI الاستجابات، والأدوات المستضافة، واستدعاء الأدوات البرمجية.

أين تتخلف كيمي K3؟

التفكير الواسع والمعرفة الخبيرة

يحافظ فابل 5 على تقدم واضح في آخر امتحان للبشرية. تفيد Moonshot بأن فابل سجل 53.3، وسول 44.5، وكيمي K3 43.5 بدون أدوات. مع الأدوات، ترتفع الدرجات إلى 63 و58 و56. هذه فجوة أكبر مما يقترحه المؤشر العام.

تسجل سول أقوى الدرجات المنشورة في عدة اختبارات علمية، واستخدام الكمبيوتر، والاختبارات ذات السياق الطويل في جدول إطلاق OpenAI. يتصدر فابل GDPval-AA وAA-Briefcase بشكل عام. تفوز K3 في مهام مختارة، لكنها لا تظهر نفس الاتساق عبر الفئات.

موثوقية المعرفة

حسنت K3 دقة AA-Omniscience من 33% إلى 46% مقارنة بـ K2.6. كما ارتفعت نسبة الهلوسة من 39% إلى 51%. تحسن مجموع درجة Omniscience من 6 إلى 18 لأن K3 تجيب على المزيد من الأسئلة بشكل صحيح، لكن التراجع في الإجابات غير المدعومة يستحق الاختبار في الأعمال التي تعتمد على الاقتباسات.

اختبارات دقة المعرفة والهلوسة للتحليل الاصطناعي لكيمي K3 ونماذج الذكاء الرائدة
اختبارات دقة المعرفة والهلوسة للتحليل الاصطناعي لكيمي K3 ونماذج الذكاء الرائدة

*المصدر: التحليل الاصطناعي. تنتمي نسبة الهلوسة إلى AA-Omniscience ولا ينبغي تعميمها على كل نوع من المطالبات.*

سأحتاج إلى استرجاع المصدر، والأدلة المقتبسة، والتحقق الحتمي قبل استخدام أي من هذه النماذج للنشر الواقعي. نتيجة K3 لا تغير هذه القاعدة.

هل كيمي K3 أرخص في الممارسة؟

تجعل الأسعار المدرجة K3 تبدو حاسمة:

كيمي K3: 3 دولارات إدخال، 15 دولارًا إخراج، و0.30 دولار إدخال مخزن لكل مليون رمز.
GPT-5.6 سول: 5 دولارات إدخال، 30 دولارًا إخراج، و0.50 دولار إدخال مخزن.
كلود فابل 5: 10 دولارات إدخال و50 دولارًا إخراج، مع خصم 90% على تخزين المطالبات.

يقدر التحليل الاصطناعي 0.94 دولار لكل مهمة في مؤشر الذكاء لـ K3، و1.04 دولار لسول، و2.75 دولار لفابل 5. يضيق استخدام الرموز لـ K3 ميزة سعر القائمة الخاصة به على سول إلى عشرة سنتات في تلك الأعباء. يكلف فابل أكثر بكثير، لكنه أيضًا ينهي في المرتبة الأولى في المؤشر العام وأصعب اختبارات العمل المعرفي.

السعر لكل رمز هو ميزانية غير مكتملة. تشمل تكلفة الإنتاج المحاولات المتكررة، واستدعاءات الأدوات، ووقت المراجعة، والكمون، والعمل المطلوب للتعافي من إجابة خاطئة. النموذج الذي يتقاضى نصف المبلغ ويحتاج إلى ضعف عدد حلقات الإصلاح لم يوفر المال.

لماذا تبقى مجموعتي OpenAI وAnthropic

أستخدم بالفعل OpenAI وAnthropic للترميز، والبحث، وأعمال الوكلاء. لم تقدم لي K3 أدلة كافية لاستيعاب مزود إنتاج ثالث بعد.

قراءة مقترحة

تظل OpenAI هي الافتراضية الخاصة بي للترميز الوكالي لأن سول يتصدر مؤشر الوكلاء المستقل عند 80، ويتكامل مع Codex وAPI الاستجابات، ولديه أوسع سطح أداة لعملي. مقارنة GPT-5.6 سول وفابل 5 الخاصة بي تغطي قرار التوجيه هذا بمزيد من التفاصيل.

تظل Anthropic هي طريقي الثاني للتحليل الطويل والصعب وأعمال قاعدة الشيفرة المعقدة. يتصدر فابل 5 المؤشر العام للذكاء، وGDPval-AA، وAA-Briefcase، وآخر امتحان للبشرية. تعني سعره البالغ 10 دولارات / 50 دولارًا ومتطلبات الاحتفاظ بالبيانات لمدة 30 يومًا أنني سأحتفظ به للعمل حيث تغطي زيادة الجودة تلك القيود.

قراءة مقترحة

معياري يأتي من بناء وكلاء الذكاء الاصطناعي الذين يعملون فعليًا: المهام المنجزة، وفشل الأدوات الملحوظة، وتكلفة المراجعة تهم أكثر من درجة العنوان.

يدخل K3 حارة اختبار مع ثلاث مهام:

إعادة بناء واجهة حقيقية من صورة مرجعية ومقارنة العيوب البصرية بعد واحدة وثلاث تكرارات.
تشغيل نفس مهمة المستودع في Kimi Code وCodex وClaude Code، ثم حساب التغييرات المقبولة، والرموز، وفشل الأدوات، ووقت المراجعة.
إعطاء كل نموذج نفس ملخص البحث وتسجيل المطالبات غير المدعومة، وتغطية الاقتباسات، والتصحيحات بعد الملاحظات.

سأعيد النظر في توجيه الإنتاج بعد أن تطلق Moonshot الأوزان والتقرير الفني، وبعد أن أراجع الترخيص النهائي، وبعد أن ينجو K3 من تلك الاختبارات. قد تصل الفرق التي لديها أعباء ثقيلة في الواجهة أو الأتمتة إلى تلك النقطة في وقت أقرب.

اختيار نموذج عملي

اختر كيمي K3 لتقييم خاضع للرقابة عندما تهيمن جودة الواجهة، أو أتمتة المتصفح، أو أسعار API الأقل على عبء العمل.

اختر GPT-5.6 سول عندما تحتاج إلى بيئة وكيل ترميز ناضجة، ودعم أدوات واسع، وجودة عرض قوية، ونتائج متسقة عبر المهام التقنية.

اختر كلود فابل 5 عندما تكون المهمة طويلة، وغامضة، وصعبة تحليليًا بما يكفي لتبرير التكلفة الأعلى وقيود الاحتفاظ بالبيانات.

إجابتي اليوم هي OpenAI بالإضافة إلى Anthropic، مع K3 تحت الاختبار. لقد كسبت Moonshot ذلك الاختبار. لم تكسب ترحيلًا تلقائيًا.

المصادر والمنهجية

تحققت من منشور إطلاق كيمي K3 من Moonshot وأسعار API، وتقييم التحليل المستقل لـ K3 من التحليل الاصطناعي، وتصنيف الواجهة العمياء لـ Arena كما أبلغت عنه AP، وإصدار GPT-5.6 من OpenAI ووثائق نموذج سول، بالإضافة إلى إطلاق فابل 5 من Anthropic ودليل API لكلود فابل 5.

جميع الدرجات والأسعار سارية اعتبارًا من 18 يوليو 2026. يمكن لمزودي النماذج تغيير الأسعار، والتوجيه، والضمانات، وسلوك الخدمة دون تغيير اسم النموذج.