كيمي K3 مقابل GPT-5.6 سول قريب بما يكفي لجعلي أعيد إجراء اختبارات التوجيه الخاصة بي. نموذج Moonshot لا يزال لا يحل محل OpenAI أو Anthropic في مجموعتي.
هذا الاستنتاج أقل دراماتيكية من عناوين الإطلاق، لكن الأرقام تدعمه. يحتل نموذج Moonshot AI الجديد المرتبة الثالثة في مؤشر الذكاء المستقل، ويتصدر ساحة الترميز الأمامية العمياء، ويتفوق على GPT-5.6 سول في اختبار واحد للعمل المعرفي على المدى الطويل. كما أنه لا يزال متأخراً عن كلود فابل 5 وسول في أوسع المقاييس، ولا تزال أوزانه القابلة للتنزيل وعداً لموعد مستقبلي.
اعتبارًا من 18 يوليو 2026، أرى كيمي K3 كمرشح تقييم جاد بدلاً من سبب للانتقال إلى العمل الإنتاجي. لم أضع K3 في اختباري الإنتاجي الخاص بعد، لذا أفصل نتائج الأطراف الثالثة عن قراري بالتوجيه أدناه.
الحكم القصير
النتيجة هي سباق بين ثلاثة نماذج مع فائزين مختلفين حسب المهمة. لا يمكن أن تخبرك لوحة المتصدرين الواحدة أي نموذج سينهي عملك بأقل عدد من المحاولات.
ما هو كيمي K3؟
قدمت Moonshot AI كيمي K3 في 16 يوليو كنموذج مكون من 2.8 تريليون معلمة من نوع Mixture-of-Experts. يقوم جهاز التوجيه الخاص به باختيار 16 من 896 خبيرًا لكل رمز. كما أن K3 يحتوي أيضًا على إدخال صورة أصلي، ونافذة سياق مكونة من مليون رمز، وإخراج نصي.
تنسب Moonshot القفزة من K2 إلى تغييرين معماريين: كيمي دلتا انتباه واهتمام متبقي. تفيد الشركة بأن كيمي K3 يتمتع بكفاءة توسيع أفضل بحوالي 2.5 مرة من K2، لكن لم يتم نشر تقرير فني بعد. لا يزال هذا الرقم ادعاءً من البائع.
الـ API متاحة الآن. تقول Moonshot إن الأوزان الكاملة ستصل بحلول 27 يوليو. حتى وصول تلك الملفات، فإن K3 هو نموذج مفتوح الوزن تم الإعلان عنه، وليس نموذجًا يمكنك تنزيله والتحقق منه بالفعل على بنيتك التحتية الخاصة.
كيمي K3 مقابل GPT-5.6 سول مقابل كلود فابل 5
أكثر المقارنات وضوحًا تجمع بين الاختبارات المستقلة مع المواصفات الرسمية للمنتج. تأتي الصفوف الأربعة الأولى أدناه من التحليل الاصطناعي وArena؛ تأتي السياق والأسعار من وثائق كل مزود.
| المقياس | كيمي K3 | GPT-5.6 سول | كلود فابل 5 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| مؤشر الذكاء التحليلي الاصطناعي | 57 | 59 | 60 |
| GDPval-AA v2 | 1,668 إلو | 1,748 إلو | 1,760 إلو |
| AA-Briefcase العمل المعرفي | 1,547 إلو | 1,495 إلو | 1,583 إلو |
| ساحة كود الواجهة | 1,679 إلو | 1,618 إلو | 1,631 إلو |
| نافذة السياق | 1M رموز | 1.05M رموز | 1M رموز |
| إدخال/إخراج API لكل 1M رموز | 3 دولارات / 15 دولارًا | 5 دولارات / 30 دولارًا | 10 دولارات / 50 دولارًا |
| الأوزان | وعدت في 27 يوليو | مغلقة | مغلقة |

*المصدر: التحليل الاصطناعي، 17 يوليو 2026. يجمع مؤشر v4.1 الخاص به بين تسع تقييمات للترميز، والتفكير، والمعرفة، والوكالة.*
الفجوة ذات النقطتين بين K3 وسول صغيرة بما يكفي لتكون أقل أهمية من جودة الحزمة، والكمون، واستخدام الرموز، واستعادة الفشل. لا تزال الفجوة ذات الثلاث نقاط إلى فابل 5 حقيقية. لقد وصلت K3 إلى مجموعة الحدود؛ لكنها لم تفز بالمجموعة.
أين تفوز كيمي K3؟
الترميز الأمامي والتكرار البصري
أقوى نتيجة مستقلة لـ K3 هي ساحة كود الواجهة. يقارن المقيمون البشريون المخرجات الأمامية القابلة للتشغيل المجهولة ويصوتون للنتيجة الأفضل. وصلت K3 إلى 1,679 إلو، 48 نقطة فوق فابل 5 و61 فوق سول. كما وضعتها Arena في المرتبة الأولى في ست من سبع فئات أمامية.
تلك النتيجة مهمة للفرق التي تبني صفحات الهبوط، ولوحات المعلومات، وإعادة إنشاء التصميمات، والأدوات البصرية. تقيس التفضيل للإنتاج العملي، وليس فقط ما إذا كانت وحدة الاختبار قد نجحت.
جدول الترميز الأوسع لـ Moonshot مختلط. يتصدر K3 برنامج Bench عند 77.8 وSWE Marathon عند 42.0. يتصدر سول DeepSWE عند 73.0 وTerminal-Bench 2.1 عند 88.8. يتصدر فابل 5 FrontierSWE عند 86.6 ومقارنة Kimi Code Bench الداخلية لـ Moonshot عند 76.9.

*المصدر: منشور إطلاق كيمي K3 من Moonshot AI. هذه هي النتائج التي جمعها البائع، وغالبًا ما تستخدم النماذج حزم وكيل مختلفة.*
اختيار الحزمة يغير النتيجة. غالبًا ما تعمل K3 في Kimi Code، وسول في Codex، وفابل في Claude Code. يمكن أن يقيس المعيار النموذج، أو الحزمة، أو التفاعل بين الاثنين. سأعيد تشغيل مهمة مستودع تمثيلية داخل الأداة التي أخطط لنشرها.
الأتمتة والعمل المعرفي
يعطي التحليل الاصطناعي K3 درجة 53% والمركز الأول في AutomationBench-AA. في AA-Briefcase، وهو تقييم خاص للعمل المعرفي على المدى الطويل، تسجل K3 1,547 إلو. يتفوق ذلك على 1,495 لسول ويتخلف عن 1,583 لفابل 5.
تقييم Moonshot يضع K3 أيضًا في المقدمة بشكل ضيق في BrowseComp وSpreadsheetBench 2. يتصدر فابل GDPval-AA وJobBench ودرجة AA-Briefcase العامة. يبقى سول الأقوى من حيث جودة العرض ضمن تحليل AA-Briefcase.

*المصدر: Moonshot AI. يتضمن الرسم البياني درجات مستقلة، ولوحات متصدرين عامة، واختبارات أجرتها Moonshot؛ اقرأ الحواشي السفلية قبل اعتبار الأعمدة تجربة واحدة خاضعة للتحكم.*
يبدو أن K3 مفيدة لوكلاء البحث، وأعمال جداول البيانات، وأتمتة المتصفح. يبقى فابل الخيار الأكثر أمانًا عندما تكون جودة التحليل أكثر أهمية من السعر. يناسب سول الفرق التي تستخدم بالفعل Codex، وAPI الاستجابات، والأدوات المستضافة، واستدعاء الأدوات البرمجية.
أين تتخلف كيمي K3؟
التفكير الواسع والمعرفة الخبيرة
يحافظ فابل 5 على تقدم واضح في آخر امتحان للبشرية. تفيد Moonshot بأن فابل سجل 53.3، وسول 44.5، وكيمي K3 43.5 بدون أدوات. مع الأدوات، ترتفع الدرجات إلى 63 و58 و56. هذه فجوة أكبر مما يقترحه المؤشر العام.
تسجل سول أقوى الدرجات المنشورة في عدة اختبارات علمية، واستخدام الكمبيوتر، والاختبارات ذات السياق الطويل في جدول إطلاق OpenAI. يتصدر فابل GDPval-AA وAA-Briefcase بشكل عام. تفوز K3 في مهام مختارة، لكنها لا تظهر نفس الاتساق عبر الفئات.
موثوقية المعرفة
حسنت K3 دقة AA-Omniscience من 33% إلى 46% مقارنة بـ K2.6. كما ارتفعت نسبة الهلوسة من 39% إلى 51%. تحسن مجموع درجة Omniscience من 6 إلى 18 لأن K3 تجيب على المزيد من الأسئلة بشكل صحيح، لكن التراجع في الإجابات غير المدعومة يستحق الاختبار في الأعمال التي تعتمد على الاقتباسات.

*المصدر: التحليل الاصطناعي. تنتمي نسبة الهلوسة إلى AA-Omniscience ولا ينبغي تعميمها على كل نوع من المطالبات.*
سأحتاج إلى استرجاع المصدر، والأدلة المقتبسة، والتحقق الحتمي قبل استخدام أي من هذه النماذج للنشر الواقعي. نتيجة K3 لا تغير هذه القاعدة.
هل كيمي K3 أرخص في الممارسة؟
تجعل الأسعار المدرجة K3 تبدو حاسمة:
يقدر التحليل الاصطناعي 0.94 دولار لكل مهمة في مؤشر الذكاء لـ K3، و1.04 دولار لسول، و2.75 دولار لفابل 5. يضيق استخدام الرموز لـ K3 ميزة سعر القائمة الخاصة به على سول إلى عشرة سنتات في تلك الأعباء. يكلف فابل أكثر بكثير، لكنه أيضًا ينهي في المرتبة الأولى في المؤشر العام وأصعب اختبارات العمل المعرفي.
السعر لكل رمز هو ميزانية غير مكتملة. تشمل تكلفة الإنتاج المحاولات المتكررة، واستدعاءات الأدوات، ووقت المراجعة، والكمون، والعمل المطلوب للتعافي من إجابة خاطئة. النموذج الذي يتقاضى نصف المبلغ ويحتاج إلى ضعف عدد حلقات الإصلاح لم يوفر المال.
لماذا تبقى مجموعتي OpenAI وAnthropic
أستخدم بالفعل OpenAI وAnthropic للترميز، والبحث، وأعمال الوكلاء. لم تقدم لي K3 أدلة كافية لاستيعاب مزود إنتاج ثالث بعد.
تظل OpenAI هي الافتراضية الخاصة بي للترميز الوكالي لأن سول يتصدر مؤشر الوكلاء المستقل عند 80، ويتكامل مع Codex وAPI الاستجابات، ولديه أوسع سطح أداة لعملي. مقارنة GPT-5.6 سول وفابل 5 الخاصة بي→ تغطي قرار التوجيه هذا بمزيد من التفاصيل.
تظل Anthropic هي طريقي الثاني للتحليل الطويل والصعب وأعمال قاعدة الشيفرة المعقدة. يتصدر فابل 5 المؤشر العام للذكاء، وGDPval-AA، وAA-Briefcase، وآخر امتحان للبشرية. تعني سعره البالغ 10 دولارات / 50 دولارًا ومتطلبات الاحتفاظ بالبيانات لمدة 30 يومًا أنني سأحتفظ به للعمل حيث تغطي زيادة الجودة تلك القيود.
معياري يأتي من بناء وكلاء الذكاء الاصطناعي الذين يعملون فعليًا→: المهام المنجزة، وفشل الأدوات الملحوظة، وتكلفة المراجعة تهم أكثر من درجة العنوان.
يدخل K3 حارة اختبار مع ثلاث مهام:
سأعيد النظر في توجيه الإنتاج بعد أن تطلق Moonshot الأوزان والتقرير الفني، وبعد أن أراجع الترخيص النهائي، وبعد أن ينجو K3 من تلك الاختبارات. قد تصل الفرق التي لديها أعباء ثقيلة في الواجهة أو الأتمتة إلى تلك النقطة في وقت أقرب.
اختيار نموذج عملي
اختر كيمي K3 لتقييم خاضع للرقابة عندما تهيمن جودة الواجهة، أو أتمتة المتصفح، أو أسعار API الأقل على عبء العمل.
اختر GPT-5.6 سول عندما تحتاج إلى بيئة وكيل ترميز ناضجة، ودعم أدوات واسع، وجودة عرض قوية، ونتائج متسقة عبر المهام التقنية.
اختر كلود فابل 5 عندما تكون المهمة طويلة، وغامضة، وصعبة تحليليًا بما يكفي لتبرير التكلفة الأعلى وقيود الاحتفاظ بالبيانات.
إجابتي اليوم هي OpenAI بالإضافة إلى Anthropic، مع K3 تحت الاختبار. لقد كسبت Moonshot ذلك الاختبار. لم تكسب ترحيلًا تلقائيًا.
المصادر والمنهجية
تحققت من منشور إطلاق كيمي K3 من Moonshot وأسعار API، وتقييم التحليل المستقل لـ K3 من التحليل الاصطناعي، وتصنيف الواجهة العمياء لـ Arena كما أبلغت عنه AP، وإصدار GPT-5.6 من OpenAI ووثائق نموذج سول، بالإضافة إلى إطلاق فابل 5 من Anthropic ودليل API لكلود فابل 5.
جميع الدرجات والأسعار سارية اعتبارًا من 18 يوليو 2026. يمكن لمزودي النماذج تغيير الأسعار، والتوجيه، والضمانات، وسلوك الخدمة دون تغيير اسم النموذج.