كلود سونيت 5 هنا: المعايير، التسعير، وقراءتي الأولى
تقنية
Claude Sonnet 5
Anthropic
AI Models
Claude Code

كلود سونيت 5 هنا: المعايير، التسعير، وقراءتي الأولى

كلود سونيت 5 رسمي. تظهر المعايير نموذج سونيت أرخص يقترب من عمل الوكلاء من فئة أوبوس، مع حدود مهمة.

Uygar DuzgunUUygar Duzgun
Jul 1, 2026
تم التحديث 25 يوليو 2026
7 min read

كلود سونيت 5 هو النموذج الذي كنت أتوقع أن تطلقه أنثروبيك بعد دراما فابل 5: أقل درامية من ميثوس، وأكثر عملية من ترقية صغيرة، وموجه بوضوح نحو العمل اليومي للوكلاء.

أطلقت أنثروبيك كلود سونيت 5 في 30 يونيو 2026. العنوان ليس أن سونيت فجأة يتفوق على كل نموذج من فئة أوبوس. إنه لا يفعل. القصة المفيدة هي تكلفة الأداء. يتحرك سونيت 5 أقرب بكثير إلى أوبوس 4.8 في العمل الوكالي، ويحافظ على تسعير سونيت، ويصبح النموذج الافتراضي الجديد للعديد من مستخدمي كلود.

هذا مهم بالنسبة للطريقة التي أستخدم بها وكلاء الذكاء الاصطناعي. أقل اهتمامًا بالإجابات الفورية للدردشة وأكثر اهتمامًا بما إذا كان النموذج يمكنه فحص مستودع، واستخدام الأدوات، والبقاء على المهمة، وإكمال العمل دون إحداث فوضى.

لمحة عن المعايير

تقوم جدول الإطلاق الخاص بأنثروبيك بمقارنة سونيت 5 مع سونيت 4.6 وأوبوس 4.8. النمط واضح: سونيت 5 هو قفزة حقيقية فوق سونيت 4.6، لكن أوبوس 4.8 لا يزال يتفوق في بعض من أصعب المهام الوكالية.

جدول معايير كلود سونيت 5 من أنثروبيك يقارن سونيت 5، سونيت 4.6، وأوبوس 4.8
جدول معايير كلود سونيت 5 من أنثروبيك يقارن سونيت 5، سونيت 4.6، وأوبوس 4.8
المعيارسونيت 5سونيت 4.6أوبوس 4.8
------:---:---:
SWE-bench Pro63.2%58.1%69.2%
Terminal-Bench 2.180.4%67.0%82.7%
آخر امتحان للبشرية، بدون أدوات43.2%34.6%49.8%
آخر امتحان للبشرية، مع أدوات57.4%46.8%57.9%
OSWorld-Verified81.2%78.5%83.4%
GDPval-AA v2161813951615

أقوى إشارة هي Terminal-Bench 2.1. يقفز سونيت 5 من 67.0% في سونيت 4.6 إلى 80.4%، قريبًا من أوبوس 4.8 عند 82.7%. هذا هو نوع تقليص الفجوة الذي يهم الوكلاء البرمجيين لأن العمل في الطرفية يعاقب النماذج التي لا تستطيع التخطيط، والتعافي، واستخدام الأدوات.

SWE-bench Pro أكثر تحفظًا. يتحسن سونيت 5 عن سونيت 4.6، لكن أوبوس 4.8 لا يزال متقدمًا. سأقرأ ذلك كجواب على الشراء، وليس كجواب ضجة: استخدم سونيت 5 لتشغيل الوكلاء العاديين، احتفظ بأوبوس للحالات التي تكون فيها الموثوقية الإضافية تستحق السعر.

تكلفة الأداء هي القصة الحقيقية للإطلاق

نشرت أنثروبيك أيضًا مخططات تكلفة الأداء لـ BrowseComp و OSWorld-Verified عبر مستويات الجهد. هذه أكثر فائدة من نتيجة خط علوية واحدة لأن سونيت 5 الآن يمنح الفرق مفتاحًا: أنفق أقل للجهد المتوسط، أو ادفع الجهد أعلى عندما يحتاج الأمر.

منحنى تكلفة أداء البحث الوكالي لكلود سونيت 5 على BrowseComp
منحنى تكلفة أداء البحث الوكالي لكلود سونيت 5 على BrowseComp
منحنى تكلفة أداء استخدام الكمبيوتر الوكالي لكلود سونيت 5 على OSWorld-Verified
منحنى تكلفة أداء استخدام الكمبيوتر الوكالي لكلود سونيت 5 على OSWorld-Verified

هذا هو بالضبط المكان الذي يجب أن يفوز فيه نموذج من فئة سونيت. أوبوس موجود لأصعب التفكير، لكن معظم سير العمل تحتاج إلى ذكاء كافٍ بسعر يمكنك من تشغيل الوكيل بشكل متكرر. تصحيح الأخطاء، اختبار المتصفح، فحص المستودع، عمليات المحتوى، ومهام الأتمتة الصغيرة جميعها تستفيد من نموذج أرخص للتشغيل دون إسقاط الخيط في منتصف الطريق.

تقول أنثروبيك إن سونيت 5 متاح بسعر API تمهيدي قدره 2 دولار لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج حتى 31 أغسطس 2026. بعد ذلك، ينتقل إلى 3 دولارات للإدخال و15 دولارًا للإخراج لكل مليون رمز. يتطابق هذا السعر القياسي مع سونيت 4.6 لكل رمز، لكن هناك مشكلة: تقول الوثائق إن سونيت 5 يستخدم مُرمزًا جديدًا ينتج حوالي 30% المزيد من الرموز لنفس النص.

لذا لن أعتبر أن الانتقال محايد من حيث التكلفة تلقائيًا. سأعيد حساب المطالبات قبل نقل الوكلاء الذين يعملون لفترات طويلة من سونيت 4.6 إلى سونيت 5.

ما الذي يتغير للمطورين

معرف النموذج هو `claude-sonnet-5`. تصف أنثروبيك أنه ترقية سهلة من سونيت 4.6، لكن الوثائق تسرد تغييرات سلوكية تهم في التطبيقات الحقيقية.

أولاً، التفكير التكيفي مفعل بشكل افتراضي. إذا لم تمرر حقل التفكير، فإن سونيت 5 لا يزال يعمل مع التفكير التكيفي. يمكنك تعطيله، لكن الافتراضي قد تغير.

ثانيًا، التفكير الممتد اليدوي قد اختفى. نمط `thinking: { type: "enabled", budget_tokens: N }` القديم يعيد 400. تريد أنثروبيك من المطورين استخدام التفكير التكيفي مع معلمة الجهد بدلاً من ذلك.

ثالثًا، يتم رفض معلمات العينة غير الافتراضية. الطلبات التي تحدد `temperature`، `top_p`، أو `top_k` إلى قيم غير افتراضية تعيد 400. هذه مشكلة حقيقية في الانتقال إذا كانت الأغطية الخاصة بك تحدد الافتراضات تلقائيًا.

الجزء الجيد: يدعم سونيت 5 نافذة سياق بحجم 1 مليون رمز بشكل افتراضي وما يصل إلى 128 ألف رمز إخراج. بالنسبة للعمل على نطاق المستودع وسير العمل الطويلة السياق، فإن ذلك يمنح الوكلاء مزيدًا من المساحة للفحص قبل التحرير.

السلامة والمعايير السيبرانية

تقوم أنثروبيك بتوجيه سونيت 5 ليكون أكثر أمانًا للاستخدام العادي للوكلاء مقارنة بسونيت 4.6. تقول منشور الإطلاق إن سونيت 5 لديه معدل أقل من السلوك غير المرغوب فيه مقارنة بسونيت 4.6 وهو أكثر أمانًا في السياقات الوكالية.

الرسم البياني السيبراني هو الحد الأكثر أهمية. تقول أنثروبيك إنها لم تدرب سونيت 5 عمدًا على مهام الأمن السيبراني. في تقييم تطوير استغلال Firefox 147، لم ينتج سونيت 5 أبدًا استغلالًا كاملاً يعمل. حصل على 0.0% في نجاح الاستغلال العامل و13.2% في النجاح الجزئي. أوبوس 4.8 وميثوس 5 أقوى بكثير في ذلك التقييم، وهذا هو السبب بالضبط الذي يجعل أنثروبيك تحافظ على سياسات وصول وحواجز مختلفة حول النماذج ذات المخاطر العالية.

تقييم تطوير استغلال Firefox 147 لكلود سونيت 5 من أنثروبيك
تقييم تطوير استغلال Firefox 147 لكلود سونيت 5 من أنثروبيك

هذا الإطار منطقي. يجب أن يكون سونيت 5 قويًا بما يكفي للعمل العادي في البرمجة والعمل الوكالي، لكنه ليس مُحسنًا للقدرات السيبرانية الخطرة. تقول أنثروبيك أيضًا إن سونيت 5 يتم إطلاقه مع تدابير أمان سيبرانية في الوقت الحقيقي مفعلة بشكل افتراضي.

قراءتي الأولى

سأعتبر كلود سونيت 5 كنموذج العمل الافتراضي الجديد لوكلاء كلود.

ليس النموذج الذي سأختاره لكل مشكلة صعبة في قاعدة الشيفرة. لا يزال أوبوس 4.8 يفوز في بعض معايير البرمجة الوكالية واستخدام الكمبيوتر. لا تزال فابل 5 هي القصة الأكثر درامية على الحدود. لكن سونيت 5 يقع في الجزء من السوق الذي يشعر به معظم البناة فعليًا: السعر، والسياق، واستخدام الأدوات، وما إذا كان الوكيل يستمر.

بالنسبة لكلود كود، ربما تكون هذه هي الزاوية الأكثر إثارة للاهتمام. نموذج أرخص يمكنه العمل لفترة أطول، واستخدام الأدوات بشكل أفضل، والبقاء قريبًا من أوبوس في العديد من المهام يغير اقتصاديات حلقات الوكلاء. يمكنك حجز نماذج من فئة أوبوس للمراجعة، وتصحيح الأخطاء الصعبة، أو التغييرات عالية المخاطر، بينما تستخدم سونيت 5 للتمرير الرئيسي للتنفيذ.

هذه هي الطريقة التي سأختبرها أولاً:

مستودع متسخ
بناء فاشل
مهمة اختبار متصفح
ترحيل طويل السياق
سير عمل محتوى مع روابط وصور حقيقية
خطوة نشر صغيرة تتطلب ضبط النفس
قراءة مقترحة

يجب أن يتصرف النموذج الذي يسجل جيدًا في المعايير داخل سير العمل الحقيقي. يجب أن يقرأ الملفات الحالية، ويتجنب التعديلات غير ذات الصلة، ويجري الفحوصات، ويتوقف عندما تحتاج الخطوة التالية إلى قرار بشري. كتبت عن هذا النمط التشغيلي في مقالي كلود كود /loop و /goal.

الحكم

يبدو أن كلود سونيت 5 هو إجابة أنثروبيك من حيث التكلفة والأداء لعصر الوكلاء. إنه يضيق الفجوة مع أوبوس 4.8 دون التظاهر باستبداله في كل مكان.

تقول المعايير إنه أقوى بكثير من سونيت 4.6 في العمل الطرفي، واستخدام الأدوات، واستخدام الكمبيوتر، والعمل المعرفي، والتفكير. تقول الوثائق إن المطورين بحاجة إلى مراقبة عدد الرموز، والتفكير التكيفي، وتغييرات معلمات العينة. تقول قصة السلامة إن أنثروبيك تريد أن يكون سونيت 5 قويًا للوكلاء اليوميين دون إعطائه نفس الملف الشخصي السيبراني مثل أوبوس أو ميثوس.

هذا هو إطلاق عملي. سأختبره كنموذج عملي.

المصادر التي تم التحقق منها في 1 يوليو 2026