لا تكون درجة ثقة LLM مفيدة إلا بعد أن تحدد ما الذي تتنبأ به، وتحافظ على ثبات بروتوكول القياس، وتختبرها مقابل نتائج موسومة من مهمتك الخاصة. إن قول النموذج عن نفسه «90%»، واحتمال logprob لرمز، وتسع إجابات متطابقة من أصل عشر عينات، هي ثلاث إشارات مختلفة. ولا تمنح أي منها احتمالًا عالميًا قدره 0.9 بأن الإجابة صحيحة.
الجمهور: متوسطو الخبرة — مهندسو المنتجات، وفرق البيانات، والقادة التقنيون الذين يحتاجون إلى أن يجيب LLM أو يصعّد الحالة أو يمتنع عن الإجابة.
تعامل مع الرقم الخام باعتباره ميزة، لا قرارًا. عايره على مجموعة محجوزة، وافحص كيف يتغير الخطأ عندما ترفض الإجابات منخفضة الدرجة، وضع ضوابط حتمية حول أي إجراء يمكن أن يحرك الأموال أو يكشف البيانات أو يغير حالة الإنتاج.
ماذا تقيس درجة ثقة LLM؟
درجة ثقة LLM هي إشارة رقمية تهدف إلى ترتيب موثوقية مخرجات النموذج أو تقديرها. ويعتمد معناها على كيفية إنتاجها.
لكي تتصرف الدرجة مثل احتمال مُعاير، ينبغي أن تكون المخرجات التي تحصل على 0.8 صحيحة نحو 80% من الوقت عند تنفيذ النوع نفسه من العمل. ويتطلب هذا التصريح أربعة تفاصيل:
احذف أي تفصيل من هذه التفاصيل، وستصبح «ثقة 0.8» غامضة. فقد تعني أن النموذج وجد الصياغة مرجحة، أو كرر نفسه باتساق، أو اتبع تعليمات لطباعة رقم، أو رتّب إجابة فوق البدائل. قد ترتبط هذه الخصائص بالصحة، لكنها ليست الصحة نفسها.
تختلف المعايرة أيضًا عن التمييز. تتمتع الدرجة بقدرة تمييز جيدة عندما تُرتب الإجابات الصحيحة عادةً فوق الإجابات غير الصحيحة. وتتمتع بقدرة معايرة جيدة عندما تتطابق القيم الرقمية مع التكرارات المرصودة. يمكن لنظام أن يكون مفيدًا للترتيب بينما تكون نسبه المئوية خاطئة، أو أن يُظهر معايرة متوسطة معقولة بينما يفشل في الفصل بين الإجابات الصحيحة والخاطئة.
ثلاث إشارات تُسمى عادةً ثقة
| الإشارة | ما الذي ترصده فعليًا | الميزة الرئيسية | نمط الفشل الرئيسي |
|---|---|---|---|
| --- | --- | --- | --- |
| الثقة المعبَّر عنها لفظيًا | رقم يولده النموذج في النص | تعمل مع واجهات chat APIs المغلقة | حساسة لـ prompt والتنسيق ومصدر الإجابة |
| احتمالات logprobs للرموز | الاحتمال الشرطي للرموز المولدة | رخيصة عندما تعرض API قيم logprobs | تقيس احتمال التسلسل، لا الحقيقة |
| اتفاق العينات المتكررة | مدى اتفاق الإجابات المأخوذة بالعينات دلاليًا | تعمل دون الوصول إلى الأجزاء الداخلية للنموذج | أعلى تكلفة وقد تكون خاطئة باستمرار |
الاختيار بينها قرار هندسي. وقد يساعد الجمع بينها، لكن حتى المجموعة المدمجة تحتاج إلى تقييم على المهمة المستهدفة.
الثقة المعبَّر عنها لفظيًا هي إجابة مستحثة
أسهل نهج هو أن تسأل:
text Return your answer and the probability that it is correct from 0 to 1.
يعمل هذا مع أي نموذج تقريبًا. لكنه يجعل قيمة الثقة جزءًا من التوليد. ويمكن لصياغة prompt، ومقياس الإجابة، والسياق المقدم، وما إذا كان النموذج قد أنتج الإجابة بنفسه، أن تغير النتيجة.
اختبرت دراسة في 2026 ثلاث عائلات من النماذج الأساسية/المضبوطة بالتعليمات، مفتوحة المصدر بحجم 7–8B، على أربعة معايير للإجابة عن الأسئلة. ثبّت الباحثون prompt الخاص بالثقة اللفظية، مع تغيير الإجابة التي جرى تقييمها، والرموز التي زودت درجة الرمز، والسياق الذي سبق تلك الرموز. أدى تغيير سياق التكييف إلى تحريك مقارنة المعايرة بين الثقة اللفظية وثقة الرموز أكثر من تغيير مقدّر المعايرة، كما قلب الإشارة التي بدت أفضل في 9 من أصل 12 إعدادًا مضبوطًا بالتعليمات، وفقًا لمقارنات ECE وBrier في كلتيهما. وعندما قيّمت النماذج إجابات مقدمة لها، حصلت الإجابات الخاطئة المعقولة على ثقة لفظية تكاد تساوي الثقة الممنوحة للإجابات الصحيحة المقدمة. لذلك يصف المؤلفون الإشارتين بأنهما قياسات سلوكية تعتمد على البروتوكول، وليستا قراءات مباشرة لعدم اليقين (Kim and Kang, 2026).
لا تثبت هذه النتيجة أن كل درجة لفظية عديمة الفائدة. لكنها توضح لماذا لا يمكن لـ prompt مثل «كن صادقًا بشأن ثقتك» أن يحل محل مجموعة معايرة.
تقيس logprobs للرموز احتمال الرمز التالي
يسجل log probability مدى احتمال رمز ما في ظل توزيع التوليد الشرطي للنموذج. وتعرّفه وثائق OpenAI بأنه احتمال رمز في موضع معين بالنظر إلى السياق السابق؛ ويمكن جمع احتمالات log للتسلسل من أجل التقييم أو الترتيب (OpenAI Cookbook). كما تعرض استجابة GenerateContent من Google متوسط احتمالات log للمرشحين ونتائج logprob على مستوى الرموز عندما تدعمها API والنموذج المحددان (Gemini API reference).
يكون هذا مفيدًا لاختيار مغلق مثل `approve` مقابل `reject`. يمكنك جمع كتلة الاحتمال المخصصة للتسميات المسموح بها، ثم معايرة تلك الدرجة. لكن تفسير إجابة طويلة حرة الصياغة أصعب بكثير. إذ يؤثر تقسيم الرموز، وطول الإجابة، وإعادة الصياغة، وprompt التكييف، في احتمال التسلسل.
قد تكون عبارة كاذبة بطلاقة ذات احتمال مرتفع. وقد يكون اسم غير مألوف لكنه صحيح ذا احتمال منخفض. تجيب الدرجة عن سؤال «ما مدى توقع هذا التسلسل من الرموز هنا؟» ولا تجيب تلقائيًا عن سؤال «هل الادعاء صحيح؟»
يقيس أخذ العينات المتكرر الاتفاق
يمنح أخذ عينات من النموذج عدة مرات إشارة إلى الاتساق في نموذج الصندوق الأسود. فإذا عبّرت ثماني إجابات من أصل عشر عن الإجابة نفسها، فإن درجة الاتفاق التجريبية تكون 0.8. وعادةً ما تحتاج الإجابات الحرة إلى تجميع دلالي حتى تُحسب إعادة الصياغة كإجابة واحدة.
غالبًا ما تحمل هذه الإشارة معلومات أكثر من تقرير ذاتي واحد، لكنها تنطوي على تكلفتين. أولًا، تكلف عشرة توليدات نحو عشرة أضعاف عدد استدعاءات الإخراج قبل أن تغير المعالجة الدفعية أو التخزين المؤقت أو prompts الأقصر الحسابات. ثانيًا، قد يكون الاتفاق خاطئًا بثقة عندما يكرر النموذج الاعتقاد الخاطئ نفسه.
تُظهر الأبحاث الحديثة النقطتين معًا. قارنت ورقة بحثية من يوليو 2026 بين الثقة اللفظية، ومتحقق قائم على logits، وطريقة قائمة على أخذ العينات تسمى SliCK، في الإجابة عن أسئلة قصيرة واقعية ومتعددة الخطوات. في ذلك السياق، حققت SliCK خطأ معايرة أقل وترتيبًا أفضل للإجابات الصحيحة مقابل غير الصحيحة من الطريقتين الأخريين. لكنها خالفت اختبار اتساق احتمالي قائم على الاستلزام في 31% من الحالات التي جرى تقييمها. واعتمدت الدراسة على التجميع الدلالي بواسطة محكّم LLM، ومعايير إجابات قصيرة، ونموذج رئيسي واحد مع مجموعات فرعية أصغر متعددة النماذج، وافتراض أن تكرار أخذ العينات يعكس الاعتقاد (Matta, Naphade, and Zou, 2026).
التفسير العملي أضيق من عبارة «أخذ العينات يحل مشكلة الثقة». فالانفاق إشارة خام مفيدة، لكنها تظل إشارة يجب فحصها مقابل النتائج.

*يأتي حد الإنتاج بعد التسميات الخاصة بالمهمة وفحوصات المعايرة، وليس مباشرة بعد مخرجات النموذج.*
لماذا قد يضلل رقم ثقة معقول؟
ينبغي لثلاث نتائج حديثة أن تغير طريقة قراءة الفرق للنسبة المئوية بجانب إجابة LLM.
يمكن أن تتحرك الدقة والمعايرة بشكل منفصل
قيّم ConfidenceBench احتمالات مستحثة عبر prompts من 15 نموذجًا متقدمًا على 200 سؤال إنجليزي خاص متعدد الخيارات، شملت الاستدلال المكاني، والرياضيات عالية الدقة، والبحث عن الكلمات، والأسئلة غير القابلة للمعرفة. أجاب كل نموذج عن المجموعة ثلاث مرات. استخدم المعيار Brier score، الذي يعاقب المسافة التربيعية بين الاحتمال المبلغ عنه والنتيجة الثنائية.
لم يعكس ترتيب النماذج حسب المعايرة ببساطة ترتيبها حسب الدقة. ويذكر المؤلفون أن أفضل Brier score بلغ 0.103، بينما سجلت بعض الأنظمة المقيمة نتيجة أسوأ من خط أساس عشوائي مُعاير لأربعة خيارات، بلغ 0.1875. والمعيار صغير عمدًا، وخاص، وباللغة الإنجليزية فقط، ومتعدد الخيارات. وقد تعكس درجاته اللفظية اتباع التعليمات وتأطير prompt، لذا لا ينبغي تعميم الأرقام على العمل طويل الصياغة أو متعدد الأدوار (ffrench-Constant et al., 2026).
قِس المعايرة مباشرة. لا تستنتجها من دقة النموذج الإجمالية في معيار ما.
يمكن لبروتوكول القياس أن يغير الاستنتاج
ترتبط الدرجة بخط أنابيب محدد. فإذا غيّر فريق ما prompt، أو لقطة النموذج، أو تنسيق الإجابة، أو تسميات المرشحين، أو نافذة السياق، أو temperature، أو تجميع logprob، فقد غيّر أداة القياس.
سجّل هذه الاختيارات مع كل نتيجة تقييم. كما تحتاج مقاييس نشاط وكلاء البرمجة الخام إلى سياق النظام والتقييم قبل أن تقول شيئًا عن الموثوقية. وإذا تغير prompt أو النموذج، تصبح إعادة المعايرة فحصًا من فحوصات الإصدار، وليست تنظيفًا اختياريًا.
قد تفشل درجة معايرة على شريحة معينة
قد يخفي المتوسط فشلًا في لغة أو منتج أو شريحة عملاء أو نوع مستند أو طول إجابة معين. فقد يبدو مصنف الدعم معايرًا إجمالًا لأن أسئلة الفوترة الشائعة تهيمن على مجموعة الاختبار، بينما تظل تذاكر الأمان النادرة مفرطة الثقة.
افحص دائمًا الشرائح التي تحتوي على أمثلة كافية لدعم استنتاج. وعندما تكون العينات قليلة، أبلغ عن عدم اليقين بدلًا من التعامل مع معدل صاخب على أنه حقيقة.
سير عمل قابل لإعادة الإنتاج لمعايرة ثقة LLM
سير العمل التالي صغير عمدًا. ويمكن تشغيله قبل اعتماد إطار أكبر لعدم اليقين.
1. حدّد الحدث والإجراء
اكتب جملة واحدة تكمل هذا القالب:
أمثلة:
تجنب أحداثًا مثل «الإجابة جيدة». فلا يمكن وسمها باتساق.
بالنسبة إلى الإجراءات ذات الآثار غير القابلة للعكس، يجب ألا تحل الثقة محل التفويض. قد يساعد النموذج في اختيار مسار، لكن صلاحيات AI agent ينبغي أن تفرض الموارد المسموح بها، والوسائط، وقواعد الموافقة، والإيصالات.
2. أنشئ مجموعة محجوزة خاصة بالمهمة
اجمع مدخلات ممثلة لم تُستخدم لضبط prompt أو خريطة المعايرة. ضمّن:
وسم الصحة باستخدام متحقق حتمي حيثما أمكن. وبالنسبة إلى المهام الذاتية، استخدم rubric مكتوبًا وتحكيمًا. فلا يمكن لدرجة الثقة أن تكون أكثر قابلية للدفاع من تسميات نتائجها.
ابدأ ببيانات كافية لكشف سوء المعايرة الفادح، ثم وسّع حول الشرائح والعتبات المهمة. يمكن لمعيار صغير أن يوجه الاستكشاف، لكنه لا يستطيع تبرير عتبة إنتاج عالية المخاطر.
3. التقط الإشارة الخام دون تغيير البروتوكول
خزّن:
لا تقرّب قبل التقييم. فالنموذج الذي لا يصدر إلا `0.7` و`0.8` و`0.9` ينبغي تقييمه باعتباره ثلاث مجموعات خشنة، لا تقديمه كقياس دقيق للاحتمال.
4. احسب Brier score وجدول الموثوقية
بالنسبة إلى الصحة الثنائية، يكون Brier score كما يلي:
text mean((confidence - outcome)²)
الأقل أفضل، لكن الرقم يحتاج إلى خط أساس ومجموعة بيانات قابلة للمقارنة. ويجعل جدول الموثوقية الخطأ أسهل رؤية: جمّع الدرجات المتشابهة، ثم قارن متوسط درجة كل مجموعة بدقتها المرصودة.
يقرأ هذا السكربت Python الخالي من التبعيات القيم `id,score,correct` من ملف CSV:
python import csv
with open("predictions.csv", newline="") as source: rows = [ (float(row["score"]), int(row["correct"])) for row in csv.DictReader(source) ]
if not rows: raise SystemExit("predictions.csv has no rows")
brier = sum((score - correct) ** 2 for score, correct in rows) / len(rows) print(f"Brier score: {brier:.4f}")
bin_count = 10 bins = [[] for _ in range(bin_count)]
for score, correct in rows: if not 0 <= score <= 1 or correct not in (0, 1): raise ValueError("score must be 0..1 and correct must be 0 or 1") index = min(int(score * bin_count), bin_count - 1) bins[index].append((score, correct))
print("range,count,mean_score,accuracy,gap") for index, values in enumerate(bins): if not values: continue mean_score = sum(score for score, _ in values) / len(values) accuracy = sum(correct for _, correct in values) / len(values) lower = index / bin_count upper = (index + 1) / bin_count print( f"{lower:.1f}-{upper:.1f},{len(values)}," f"{mean_score:.3f},{accuracy:.3f},{mean_score - accuracy:+.3f}" )
الجدول وصفي. ويمكن لحدود المجموعات أن تغير الملخصات من نمط ECE، خصوصًا في المجموعات الصغيرة. احتفظ بـ Brier score، ومنظور الموثوقية، ومقياس يركز على الإجراء معًا، بدلًا من تحسين مخطط واحد.
5. اختر العتبات من المخاطر والتغطية
لا تحمل عتبة 0.8 معنى عالميًا. قيّم ما يحدث عندما لا يقبل النظام إلا المخرجات التي تساوي العتبة المرشحة أو تتجاوزها:
python print("threshold,coverage,accepted_accuracy") for threshold in (0.5, 0.6, 0.7, 0.8, 0.9): accepted = [ correct for score, correct in rows if score >= threshold ] coverage = len(accepted) / len(rows) accuracy = sum(accepted) / len(accepted) if accepted else float("nan") print(f"{threshold:.1f},{coverage:.3f},{accuracy:.3f}")
ينشئ هذا منظورًا أساسيًا للمخاطر مقابل التغطية. قد يؤدي رفع العتبة إلى تقليل الأخطاء بين الحالات المقبولة، لكنه يرسل أيضًا مزيدًا من العمل إلى المعالجة الاحتياطية. اختر العتبة بناءً على تكلفة القبول الخاطئ، والرفض الخاطئ، والمراجعة، وزمن الاستجابة، وضرر المستخدم.
استخدم ثلاثة مخرجات على الأقل عندما يدعم المنتج ذلك:
6. اختبر الانجراف وتغييرات البروتوكول
شغّل المجموعة المحجوزة بعد:
يضيف أخذ العينات المتكرر والاستدلال الأعمق أيضًا تكلفة حسابية. وينبغي أن تدخل المفاضلة في التقييم: قارن خفض الخطأ بزمن الاستجابة وتكلفة الرموز، بدل افتراض أن المزيد من رموز الاستدلال يستحق الشراء دائمًا.
أي طريقة للثقة ينبغي أن تستخدم؟
| الحالة | ابدأ بـ | تحقّق قبل النشر |
|---|---|---|
| --- | --- | --- |
| تصنيف بتسميات مغلقة مع logprobs | كتلة الاحتمال فوق التسميات المسموح بها | المعايرة، واختلال توازن الفئات، وحساسية prompt وتسميات الرموز |
| QA بإجابة قصيرة عبر صندوق أسود | أخذ عينات متكرر مع اتفاق دلالي | الإجابات الخاطئة باستمرار، وأخطاء التجميع، والتكلفة الإضافية |
| قيد زمن الاستدعاء الواحد | الدرجة الخام مع خريطة معايرة متعلمة | الانجراف، وأداء الشرائح، وإعادة تدريب الخريطة |
| الإجابات الطويلة | فحوصات دعم الادعاءات وعدم اليقين | الاكتمال، وجودة الاستشهادات، والادعاءات الواثقة غير المدعومة |
| إجراء أداة غير قابل للعكس | سياسة حتمية وموافقة بشرية عند الحاجة | لا تفوّض الإجراء اعتمادًا على الثقة وحدها |
يمكن للمكتبات مفتوحة المصدر تقليل جهد التنفيذ. فعلى سبيل المثال، تعرض UQLM أدوات للاتساق في الصندوق الأسود، واحتمالات الرموز في الصندوق الأبيض، وjudge، وensemble، وأدوات للنصوص الطويلة. كما توضح وثائقها صراحةً مفاضلات زمن الاستجابة والوصول: إذ تحتاج طرق الاتساق إلى استدعاءات أكثر، بينما تتطلب طرق الصندوق الأبيض logprobs (UQLM documentation). وكان المستودع لا يزال يتلقى إصدارات في يوليو 2026، بما في ذلك إصلاحات الإصدار v0.6.4، وهي إشارة صيانة أقوى من عدد النجوم التراكمي وحده (UQLM v0.6.4).
توفر المكتبة مقدّرات، لكنها لا توفر التسميات، أو تعريف المهمة، أو تحمل المخاطر، أو مراقبة الإنتاج التي تجعل العتبة قابلة للدفاع.
ما الذي لا تثبته الأبحاث الحالية؟
لا تثبت الدراسات المذكورة أن طريقة واحدة تتفوق في جميع تطبيقات LLM.
يمكن للأبحاث تحديد إشارات مرشحة. لكن عليك التحقق من النظام الكامل على العمل الذي سيؤديه فعليًا.
الأسئلة الشائعة
هل درجات ثقة LLM دقيقة؟
أحيانًا ترتبط بالصحة، لكن الدقة تعتمد على النموذج والمهمة وطريقة التقييم وprompt وتوزيع التقييم. تعامل مع الدرجة غير المعايرة باعتبارها ميزة للترتيب. واختبرها مقابل نتائج موسومة قبل تفسيرها كاحتمال.
هل logprobs للرموز هي نفسها الثقة؟
لا. إن logprob للرمز هو الاحتمال الشرطي لرمز بالنظر إلى سياقه. ويمكن أن يدعم تقديرًا للثقة، خصوصًا في المهام ذات التسميات المغلقة، لكنه ليس تلقائيًا احتمال أن تكون الإجابة الحرة صحيحة واقعيًا.
ما عتبة ثقة LLM التي ينبغي أن أستخدمها؟
لا توجد عتبة عالمية. اخترها من تحليل محجوز للمخاطر مقابل التغطية يعكس تكلفة القبول الخاطئ، والمراجعة اليدوية، والامتناع، والأتمتة الفائتة. وأعد التحقق منها بعد تغييرات النموذج أو prompt أو توزيع البيانات.
فحوصات الادعاءات
| الادعاء | الحالة | الدليل والتأهيل |
|---|---|---|
| --- | --- | --- |
| الثقة اللفظية واحتمال الرمز قياسان يعتمدان على البروتوكول | تم التحقق | غيّر Kim and Kang مصدر الإجابة، وقراءة الرمز، وسياق التكييف، والمقدّر عبر عائلات نماذج مفتوحة ومجموعات بيانات QA. |
| قلب سياق التكييف الإشارة المفضلة في 9 من أصل 12 إعدادًا مضبوطًا بالتعليمات وفق مقارنات ECE وBrier | تم التحقق | ورد ذلك في التحليل متعدد المقاييس في *Asking Is Not Enough*. |
| تقيس logprobs الاحتمال الشرطي للرموز | تم التحقق | تعرّف وثائق API من OpenAI وGoogle حقول الاحتمال اللوغاريتمي للرموز/المرشحين. |
| يمكن لاتفاق أخذ العينات أن يتفوق على التقارير الذاتية المفردة في QA الواقعي القصير | مؤهل | حققت SliCK ذلك في تجارب 2026 المبلغ عنها؛ والنتيجة ليست عالمية وتعتمد على افتراضات التجميع وأخذ العينات. |
| خالفت SliCK اختبار اتساق الاستلزام في 31% من الحالات المقيمة | تم التحقق | أبلغت عن ذلك دراسة *Rethinking Uncertainty Evaluation in Large Language Models*. |
| لا تحدد الدقة المعايرة | تم التحقق | يورد ConfidenceBench ترتيبات ودرجات Brier لا تتبع دقة النموذج ببساطة. |
| أفضل Brier score أبلغ عنه ConfidenceBench كان 0.103 | تم التحقق | النتيجة هي المتوسط عبر ثلاث جولات على معياره الخاص المكون من 200 سؤال، وليست درجة عامة للنموذج. |
| Brier score هو متوسط الخطأ التربيعي بين الاحتمال والنتيجة الثنائية | تم التحقق | يعرّف ConfidenceBench Brier score الثنائي المستخدم في تقييمه. |
| كانت UQLM تحت صيانة نشطة في يوليو 2026 | تم التحقق | نُشر الإصدار v0.6.4 على GitHub في 26 يوليو 2026. |
| يجب أن تكون عتبة الإنتاج خاصة بالمهمة | مؤهل | هذا تفسير عملي لأدلة حساسية البروتوكول والمعايرة، وليس مبرهنة عالمية حول كل تطبيق. |
