درجة ثقة LLM: عايرها قبل أن تثق بها
تقنية
AI
LLM Evaluation
Confidence Calibration
AI Reliability

درجة ثقة LLM: عايرها قبل أن تثق بها

درجة ثقة LLM ليست احتمالًا عالميًا. قارن بين درجات الثقة اللفظية وlogprobs وأخذ العينات، ثم عاير عتبة آمنة.

Uygar DuzgunUUygar Duzgun
Jul 29, 2026
تم التحديث 13 أغسطس 2026
16 min read

لا تكون درجة ثقة LLM مفيدة إلا بعد أن تحدد ما الذي تتنبأ به، وتحافظ على ثبات بروتوكول القياس، وتختبرها مقابل نتائج موسومة من مهمتك الخاصة. إن قول النموذج عن نفسه «90%»، واحتمال logprob لرمز، وتسع إجابات متطابقة من أصل عشر عينات، هي ثلاث إشارات مختلفة. ولا تمنح أي منها احتمالًا عالميًا قدره 0.9 بأن الإجابة صحيحة.

الجمهور: متوسطو الخبرة — مهندسو المنتجات، وفرق البيانات، والقادة التقنيون الذين يحتاجون إلى أن يجيب LLM أو يصعّد الحالة أو يمتنع عن الإجابة.

تعامل مع الرقم الخام باعتباره ميزة، لا قرارًا. عايره على مجموعة محجوزة، وافحص كيف يتغير الخطأ عندما ترفض الإجابات منخفضة الدرجة، وضع ضوابط حتمية حول أي إجراء يمكن أن يحرك الأموال أو يكشف البيانات أو يغير حالة الإنتاج.

ماذا تقيس درجة ثقة LLM؟

درجة ثقة LLM هي إشارة رقمية تهدف إلى ترتيب موثوقية مخرجات النموذج أو تقديرها. ويعتمد معناها على كيفية إنتاجها.

لكي تتصرف الدرجة مثل احتمال مُعاير، ينبغي أن تكون المخرجات التي تحصل على 0.8 صحيحة نحو 80% من الوقت عند تنفيذ النوع نفسه من العمل. ويتطلب هذا التصريح أربعة تفاصيل:

الحدث الذي يجري التنبؤ به، مثل «التصنيف المحدد صحيح»؛
توزيع المهمة، مثل تذاكر الدعم باللغة الإنجليزية من منتج واحد؛
بروتوكول التقييم، بما في ذلك prompt وإصدار النموذج وفك الترميز والتجميع؛
قاعدة الصحة المستخدمة لوَسم النتيجة.

احذف أي تفصيل من هذه التفاصيل، وستصبح «ثقة 0.8» غامضة. فقد تعني أن النموذج وجد الصياغة مرجحة، أو كرر نفسه باتساق، أو اتبع تعليمات لطباعة رقم، أو رتّب إجابة فوق البدائل. قد ترتبط هذه الخصائص بالصحة، لكنها ليست الصحة نفسها.

تختلف المعايرة أيضًا عن التمييز. تتمتع الدرجة بقدرة تمييز جيدة عندما تُرتب الإجابات الصحيحة عادةً فوق الإجابات غير الصحيحة. وتتمتع بقدرة معايرة جيدة عندما تتطابق القيم الرقمية مع التكرارات المرصودة. يمكن لنظام أن يكون مفيدًا للترتيب بينما تكون نسبه المئوية خاطئة، أو أن يُظهر معايرة متوسطة معقولة بينما يفشل في الفصل بين الإجابات الصحيحة والخاطئة.

ثلاث إشارات تُسمى عادةً ثقة

الإشارةما الذي ترصده فعليًاالميزة الرئيسيةنمط الفشل الرئيسي
------------
الثقة المعبَّر عنها لفظيًارقم يولده النموذج في النصتعمل مع واجهات chat APIs المغلقةحساسة لـ prompt والتنسيق ومصدر الإجابة
احتمالات logprobs للرموزالاحتمال الشرطي للرموز المولدةرخيصة عندما تعرض API قيم logprobsتقيس احتمال التسلسل، لا الحقيقة
اتفاق العينات المتكررةمدى اتفاق الإجابات المأخوذة بالعينات دلاليًاتعمل دون الوصول إلى الأجزاء الداخلية للنموذجأعلى تكلفة وقد تكون خاطئة باستمرار

الاختيار بينها قرار هندسي. وقد يساعد الجمع بينها، لكن حتى المجموعة المدمجة تحتاج إلى تقييم على المهمة المستهدفة.

الثقة المعبَّر عنها لفظيًا هي إجابة مستحثة

أسهل نهج هو أن تسأل:

text Return your answer and the probability that it is correct from 0 to 1.

يعمل هذا مع أي نموذج تقريبًا. لكنه يجعل قيمة الثقة جزءًا من التوليد. ويمكن لصياغة prompt، ومقياس الإجابة، والسياق المقدم، وما إذا كان النموذج قد أنتج الإجابة بنفسه، أن تغير النتيجة.

اختبرت دراسة في 2026 ثلاث عائلات من النماذج الأساسية/المضبوطة بالتعليمات، مفتوحة المصدر بحجم 7–8B، على أربعة معايير للإجابة عن الأسئلة. ثبّت الباحثون prompt الخاص بالثقة اللفظية، مع تغيير الإجابة التي جرى تقييمها، والرموز التي زودت درجة الرمز، والسياق الذي سبق تلك الرموز. أدى تغيير سياق التكييف إلى تحريك مقارنة المعايرة بين الثقة اللفظية وثقة الرموز أكثر من تغيير مقدّر المعايرة، كما قلب الإشارة التي بدت أفضل في 9 من أصل 12 إعدادًا مضبوطًا بالتعليمات، وفقًا لمقارنات ECE وBrier في كلتيهما. وعندما قيّمت النماذج إجابات مقدمة لها، حصلت الإجابات الخاطئة المعقولة على ثقة لفظية تكاد تساوي الثقة الممنوحة للإجابات الصحيحة المقدمة. لذلك يصف المؤلفون الإشارتين بأنهما قياسات سلوكية تعتمد على البروتوكول، وليستا قراءات مباشرة لعدم اليقين (Kim and Kang, 2026).

لا تثبت هذه النتيجة أن كل درجة لفظية عديمة الفائدة. لكنها توضح لماذا لا يمكن لـ prompt مثل «كن صادقًا بشأن ثقتك» أن يحل محل مجموعة معايرة.

تقيس logprobs للرموز احتمال الرمز التالي

يسجل log probability مدى احتمال رمز ما في ظل توزيع التوليد الشرطي للنموذج. وتعرّفه وثائق OpenAI بأنه احتمال رمز في موضع معين بالنظر إلى السياق السابق؛ ويمكن جمع احتمالات log للتسلسل من أجل التقييم أو الترتيب (OpenAI Cookbook). كما تعرض استجابة GenerateContent من Google متوسط احتمالات log للمرشحين ونتائج logprob على مستوى الرموز عندما تدعمها API والنموذج المحددان (Gemini API reference).

يكون هذا مفيدًا لاختيار مغلق مثل `approve` مقابل `reject`. يمكنك جمع كتلة الاحتمال المخصصة للتسميات المسموح بها، ثم معايرة تلك الدرجة. لكن تفسير إجابة طويلة حرة الصياغة أصعب بكثير. إذ يؤثر تقسيم الرموز، وطول الإجابة، وإعادة الصياغة، وprompt التكييف، في احتمال التسلسل.

قد تكون عبارة كاذبة بطلاقة ذات احتمال مرتفع. وقد يكون اسم غير مألوف لكنه صحيح ذا احتمال منخفض. تجيب الدرجة عن سؤال «ما مدى توقع هذا التسلسل من الرموز هنا؟» ولا تجيب تلقائيًا عن سؤال «هل الادعاء صحيح؟»

يقيس أخذ العينات المتكرر الاتفاق

يمنح أخذ عينات من النموذج عدة مرات إشارة إلى الاتساق في نموذج الصندوق الأسود. فإذا عبّرت ثماني إجابات من أصل عشر عن الإجابة نفسها، فإن درجة الاتفاق التجريبية تكون 0.8. وعادةً ما تحتاج الإجابات الحرة إلى تجميع دلالي حتى تُحسب إعادة الصياغة كإجابة واحدة.

غالبًا ما تحمل هذه الإشارة معلومات أكثر من تقرير ذاتي واحد، لكنها تنطوي على تكلفتين. أولًا، تكلف عشرة توليدات نحو عشرة أضعاف عدد استدعاءات الإخراج قبل أن تغير المعالجة الدفعية أو التخزين المؤقت أو prompts الأقصر الحسابات. ثانيًا، قد يكون الاتفاق خاطئًا بثقة عندما يكرر النموذج الاعتقاد الخاطئ نفسه.

تُظهر الأبحاث الحديثة النقطتين معًا. قارنت ورقة بحثية من يوليو 2026 بين الثقة اللفظية، ومتحقق قائم على logits، وطريقة قائمة على أخذ العينات تسمى SliCK، في الإجابة عن أسئلة قصيرة واقعية ومتعددة الخطوات. في ذلك السياق، حققت SliCK خطأ معايرة أقل وترتيبًا أفضل للإجابات الصحيحة مقابل غير الصحيحة من الطريقتين الأخريين. لكنها خالفت اختبار اتساق احتمالي قائم على الاستلزام في 31% من الحالات التي جرى تقييمها. واعتمدت الدراسة على التجميع الدلالي بواسطة محكّم LLM، ومعايير إجابات قصيرة، ونموذج رئيسي واحد مع مجموعات فرعية أصغر متعددة النماذج، وافتراض أن تكرار أخذ العينات يعكس الاعتقاد (Matta, Naphade, and Zou, 2026).

التفسير العملي أضيق من عبارة «أخذ العينات يحل مشكلة الثقة». فالانفاق إشارة خام مفيدة، لكنها تظل إشارة يجب فحصها مقابل النتائج.

سير عمل ينتقل من إشارات LLM الخام عبر تسميات المهمة وفحوصات المعايرة إلى قرارات الإجابة أو المراجعة أو الامتناع
سير عمل ينتقل من إشارات LLM الخام عبر تسميات المهمة وفحوصات المعايرة إلى قرارات الإجابة أو المراجعة أو الامتناع

*يأتي حد الإنتاج بعد التسميات الخاصة بالمهمة وفحوصات المعايرة، وليس مباشرة بعد مخرجات النموذج.*

لماذا قد يضلل رقم ثقة معقول؟

ينبغي لثلاث نتائج حديثة أن تغير طريقة قراءة الفرق للنسبة المئوية بجانب إجابة LLM.

يمكن أن تتحرك الدقة والمعايرة بشكل منفصل

قيّم ConfidenceBench احتمالات مستحثة عبر prompts من 15 نموذجًا متقدمًا على 200 سؤال إنجليزي خاص متعدد الخيارات، شملت الاستدلال المكاني، والرياضيات عالية الدقة، والبحث عن الكلمات، والأسئلة غير القابلة للمعرفة. أجاب كل نموذج عن المجموعة ثلاث مرات. استخدم المعيار Brier score، الذي يعاقب المسافة التربيعية بين الاحتمال المبلغ عنه والنتيجة الثنائية.

لم يعكس ترتيب النماذج حسب المعايرة ببساطة ترتيبها حسب الدقة. ويذكر المؤلفون أن أفضل Brier score بلغ 0.103، بينما سجلت بعض الأنظمة المقيمة نتيجة أسوأ من خط أساس عشوائي مُعاير لأربعة خيارات، بلغ 0.1875. والمعيار صغير عمدًا، وخاص، وباللغة الإنجليزية فقط، ومتعدد الخيارات. وقد تعكس درجاته اللفظية اتباع التعليمات وتأطير prompt، لذا لا ينبغي تعميم الأرقام على العمل طويل الصياغة أو متعدد الأدوار (ffrench-Constant et al., 2026).

قِس المعايرة مباشرة. لا تستنتجها من دقة النموذج الإجمالية في معيار ما.

يمكن لبروتوكول القياس أن يغير الاستنتاج

ترتبط الدرجة بخط أنابيب محدد. فإذا غيّر فريق ما prompt، أو لقطة النموذج، أو تنسيق الإجابة، أو تسميات المرشحين، أو نافذة السياق، أو temperature، أو تجميع logprob، فقد غيّر أداة القياس.

سجّل هذه الاختيارات مع كل نتيجة تقييم. كما تحتاج مقاييس نشاط وكلاء البرمجة الخام إلى سياق النظام والتقييم قبل أن تقول شيئًا عن الموثوقية. وإذا تغير prompt أو النموذج، تصبح إعادة المعايرة فحصًا من فحوصات الإصدار، وليست تنظيفًا اختياريًا.

قد تفشل درجة معايرة على شريحة معينة

قد يخفي المتوسط فشلًا في لغة أو منتج أو شريحة عملاء أو نوع مستند أو طول إجابة معين. فقد يبدو مصنف الدعم معايرًا إجمالًا لأن أسئلة الفوترة الشائعة تهيمن على مجموعة الاختبار، بينما تظل تذاكر الأمان النادرة مفرطة الثقة.

افحص دائمًا الشرائح التي تحتوي على أمثلة كافية لدعم استنتاج. وعندما تكون العينات قليلة، أبلغ عن عدم اليقين بدلًا من التعامل مع معدل صاخب على أنه حقيقة.

سير عمل قابل لإعادة الإنتاج لمعايرة ثقة LLM

سير العمل التالي صغير عمدًا. ويمكن تشغيله قبل اعتماد إطار أكبر لعدم اليقين.

1. حدّد الحدث والإجراء

اكتب جملة واحدة تكمل هذا القالب:

Prompt — Copy & Paste
تقدّر الدرجة احتمال أن يكون **[الناتج المحدد]** صحيحًا، ولذلك يجوز للنظام أن **[الإجراء المحدد]**.

أمثلة:

«تطابق تسمية التوجيه المحددة التسمية التي وافق عليها الإنسان، ولذلك يمكن أن تدخل التذكرة إلى قائمة الانتظار الصحيحة.»
«استُخرج كل حقل مطلوب بشكل صحيح، ولذلك يمكن للسجل الانتقال إلى التحقق.»
«الإجابة مدعومة بالكامل بالمستند المقدم، ولذلك يمكن عرضها دون مراجعة يدوية.»

تجنب أحداثًا مثل «الإجابة جيدة». فلا يمكن وسمها باتساق.

بالنسبة إلى الإجراءات ذات الآثار غير القابلة للعكس، يجب ألا تحل الثقة محل التفويض. قد يساعد النموذج في اختيار مسار، لكن صلاحيات AI agent ينبغي أن تفرض الموارد المسموح بها، والوسائط، وقواعد الموافقة، والإيصالات.

2. أنشئ مجموعة محجوزة خاصة بالمهمة

اجمع مدخلات ممثلة لم تُستخدم لضبط prompt أو خريطة المعايرة. ضمّن:

الحالات الروتينية؛
البدائل المعقولة لكنها خاطئة؛
المدخلات الغامضة التي ينبغي أن تؤدي إلى المراجعة؛
أنماط الفشل النادرة والمكلفة؛
الشرائح المتوقعة في الإنتاج؛
أمثلة من أحدث فترة للبيانات.

وسم الصحة باستخدام متحقق حتمي حيثما أمكن. وبالنسبة إلى المهام الذاتية، استخدم rubric مكتوبًا وتحكيمًا. فلا يمكن لدرجة الثقة أن تكون أكثر قابلية للدفاع من تسميات نتائجها.

ابدأ ببيانات كافية لكشف سوء المعايرة الفادح، ثم وسّع حول الشرائح والعتبات المهمة. يمكن لمعيار صغير أن يوجه الاستكشاف، لكنه لا يستطيع تبرير عتبة إنتاج عالية المخاطر.

3. التقط الإشارة الخام دون تغيير البروتوكول

خزّن:

معرّف النموذج ولقطته؛
إصدار قالب prompt الكامل؛
إعدادات فك الترميز؛
الإجابة الخام؛
إشارة الثقة الخام؛
الطريقة: لفظية، أو token، أو sampling، أو judge، أو ensemble؛
عدد العينات وطريقة التجميع عند استخدام sampling؛
تسمية الصحة؛
شريحة المهمة والطابع الزمني.

لا تقرّب قبل التقييم. فالنموذج الذي لا يصدر إلا `0.7` و`0.8` و`0.9` ينبغي تقييمه باعتباره ثلاث مجموعات خشنة، لا تقديمه كقياس دقيق للاحتمال.

4. احسب Brier score وجدول الموثوقية

بالنسبة إلى الصحة الثنائية، يكون Brier score كما يلي:

text mean((confidence - outcome)²)

الأقل أفضل، لكن الرقم يحتاج إلى خط أساس ومجموعة بيانات قابلة للمقارنة. ويجعل جدول الموثوقية الخطأ أسهل رؤية: جمّع الدرجات المتشابهة، ثم قارن متوسط درجة كل مجموعة بدقتها المرصودة.

يقرأ هذا السكربت Python الخالي من التبعيات القيم `id,score,correct` من ملف CSV:

python import csv

with open("predictions.csv", newline="") as source: rows = [ (float(row["score"]), int(row["correct"])) for row in csv.DictReader(source) ]

if not rows: raise SystemExit("predictions.csv has no rows")

brier = sum((score - correct) ** 2 for score, correct in rows) / len(rows) print(f"Brier score: {brier:.4f}")

bin_count = 10 bins = [[] for _ in range(bin_count)]

for score, correct in rows: if not 0 <= score <= 1 or correct not in (0, 1): raise ValueError("score must be 0..1 and correct must be 0 or 1") index = min(int(score * bin_count), bin_count - 1) bins[index].append((score, correct))

print("range,count,mean_score,accuracy,gap") for index, values in enumerate(bins): if not values: continue mean_score = sum(score for score, _ in values) / len(values) accuracy = sum(correct for _, correct in values) / len(values) lower = index / bin_count upper = (index + 1) / bin_count print( f"{lower:.1f}-{upper:.1f},{len(values)}," f"{mean_score:.3f},{accuracy:.3f},{mean_score - accuracy:+.3f}" )

الجدول وصفي. ويمكن لحدود المجموعات أن تغير الملخصات من نمط ECE، خصوصًا في المجموعات الصغيرة. احتفظ بـ Brier score، ومنظور الموثوقية، ومقياس يركز على الإجراء معًا، بدلًا من تحسين مخطط واحد.

5. اختر العتبات من المخاطر والتغطية

لا تحمل عتبة 0.8 معنى عالميًا. قيّم ما يحدث عندما لا يقبل النظام إلا المخرجات التي تساوي العتبة المرشحة أو تتجاوزها:

python print("threshold,coverage,accepted_accuracy") for threshold in (0.5, 0.6, 0.7, 0.8, 0.9): accepted = [ correct for score, correct in rows if score >= threshold ] coverage = len(accepted) / len(rows) accuracy = sum(accepted) / len(accepted) if accepted else float("nan") print(f"{threshold:.1f},{coverage:.3f},{accuracy:.3f}")

ينشئ هذا منظورًا أساسيًا للمخاطر مقابل التغطية. قد يؤدي رفع العتبة إلى تقليل الأخطاء بين الحالات المقبولة، لكنه يرسل أيضًا مزيدًا من العمل إلى المعالجة الاحتياطية. اختر العتبة بناءً على تكلفة القبول الخاطئ، والرفض الخاطئ، والمراجعة، وزمن الاستجابة، وضرر المستخدم.

استخدم ثلاثة مخرجات على الأقل عندما يدعم المنتج ذلك:

أجب أو نفّذ عندما تكون المخاطر المقيمة مقبولة.
صعّد أو تحقّق في المنطقة الوسطى غير المؤكدة.
امتنع عندما تكون المهمة غير مدعومة أو الإشارة غير موثوقة.

6. اختبر الانجراف وتغييرات البروتوكول

شغّل المجموعة المحجوزة بعد:

تحديث النموذج أو المزوّد؛
تغيير prompt أو الأداة؛
إضافة لغة أو شريحة عملاء جديدة؛
تغيير فهرس الاسترجاع؛
حدوث تحول جوهري في طول المدخلات أو موضوعها؛
وقوع حادثة تضمنت خطأً واثقًا.

يضيف أخذ العينات المتكرر والاستدلال الأعمق أيضًا تكلفة حسابية. وينبغي أن تدخل المفاضلة في التقييم: قارن خفض الخطأ بزمن الاستجابة وتكلفة الرموز، بدل افتراض أن المزيد من رموز الاستدلال يستحق الشراء دائمًا.

أي طريقة للثقة ينبغي أن تستخدم؟

الحالةابدأ بـتحقّق قبل النشر
---------
تصنيف بتسميات مغلقة مع logprobsكتلة الاحتمال فوق التسميات المسموح بهاالمعايرة، واختلال توازن الفئات، وحساسية prompt وتسميات الرموز
QA بإجابة قصيرة عبر صندوق أسودأخذ عينات متكرر مع اتفاق دلاليالإجابات الخاطئة باستمرار، وأخطاء التجميع، والتكلفة الإضافية
قيد زمن الاستدعاء الواحدالدرجة الخام مع خريطة معايرة متعلمةالانجراف، وأداء الشرائح، وإعادة تدريب الخريطة
الإجابات الطويلةفحوصات دعم الادعاءات وعدم اليقينالاكتمال، وجودة الاستشهادات، والادعاءات الواثقة غير المدعومة
إجراء أداة غير قابل للعكسسياسة حتمية وموافقة بشرية عند الحاجةلا تفوّض الإجراء اعتمادًا على الثقة وحدها

يمكن للمكتبات مفتوحة المصدر تقليل جهد التنفيذ. فعلى سبيل المثال، تعرض UQLM أدوات للاتساق في الصندوق الأسود، واحتمالات الرموز في الصندوق الأبيض، وjudge، وensemble، وأدوات للنصوص الطويلة. كما توضح وثائقها صراحةً مفاضلات زمن الاستجابة والوصول: إذ تحتاج طرق الاتساق إلى استدعاءات أكثر، بينما تتطلب طرق الصندوق الأبيض logprobs (UQLM documentation). وكان المستودع لا يزال يتلقى إصدارات في يوليو 2026، بما في ذلك إصلاحات الإصدار v0.6.4، وهي إشارة صيانة أقوى من عدد النجوم التراكمي وحده (UQLM v0.6.4).

توفر المكتبة مقدّرات، لكنها لا توفر التسميات، أو تعريف المهمة، أو تحمل المخاطر، أو مراقبة الإنتاج التي تجعل العتبة قابلة للدفاع.

ما الذي لا تثبته الأبحاث الحالية؟

لا تثبت الدراسات المذكورة أن طريقة واحدة تتفوق في جميع تطبيقات LLM.

ConfidenceBench معيار خاص صغير باللغة الإنجليزية فقط، يتكون من 200 سؤال متعدد الخيارات.
تستخدم دراسة حساسية البروتوكول عائلات نماذج مفتوحة ومجموعات بيانات للإجابة عن الأسئلة؛ ولا تغطي كل مزود أو كل مهمة طويلة الصياغة.
تركز دراسة الاتساق على أسئلة واقعية قصيرة ومتعددة الخطوات، وتعتمد على التجميع الدلالي، وتتعامل مع سلوك أخذ العينات باعتباره بديلًا عن الاعتقاد.
يدرب عمل المعايرة من التوليد الواحد على عينات متكررة غير متصلة، ويقيّم مهام محددة جيدًا مع فحوصات صحة آلية. ويترك مؤلفوه صراحةً عمليات النشر المفتوحة والتفاعلية كعمل مستقبلي (Zollo, Wang, and Zemel, 2026).

يمكن للأبحاث تحديد إشارات مرشحة. لكن عليك التحقق من النظام الكامل على العمل الذي سيؤديه فعليًا.

الأسئلة الشائعة

هل درجات ثقة LLM دقيقة؟

أحيانًا ترتبط بالصحة، لكن الدقة تعتمد على النموذج والمهمة وطريقة التقييم وprompt وتوزيع التقييم. تعامل مع الدرجة غير المعايرة باعتبارها ميزة للترتيب. واختبرها مقابل نتائج موسومة قبل تفسيرها كاحتمال.

هل logprobs للرموز هي نفسها الثقة؟

لا. إن logprob للرمز هو الاحتمال الشرطي لرمز بالنظر إلى سياقه. ويمكن أن يدعم تقديرًا للثقة، خصوصًا في المهام ذات التسميات المغلقة، لكنه ليس تلقائيًا احتمال أن تكون الإجابة الحرة صحيحة واقعيًا.

ما عتبة ثقة LLM التي ينبغي أن أستخدمها؟

لا توجد عتبة عالمية. اخترها من تحليل محجوز للمخاطر مقابل التغطية يعكس تكلفة القبول الخاطئ، والمراجعة اليدوية، والامتناع، والأتمتة الفائتة. وأعد التحقق منها بعد تغييرات النموذج أو prompt أو توزيع البيانات.

فحوصات الادعاءات

الادعاءالحالةالدليل والتأهيل
---------
الثقة اللفظية واحتمال الرمز قياسان يعتمدان على البروتوكولتم التحققغيّر Kim and Kang مصدر الإجابة، وقراءة الرمز، وسياق التكييف، والمقدّر عبر عائلات نماذج مفتوحة ومجموعات بيانات QA.
قلب سياق التكييف الإشارة المفضلة في 9 من أصل 12 إعدادًا مضبوطًا بالتعليمات وفق مقارنات ECE وBrierتم التحققورد ذلك في التحليل متعدد المقاييس في *Asking Is Not Enough*.
تقيس logprobs الاحتمال الشرطي للرموزتم التحققتعرّف وثائق API من OpenAI وGoogle حقول الاحتمال اللوغاريتمي للرموز/المرشحين.
يمكن لاتفاق أخذ العينات أن يتفوق على التقارير الذاتية المفردة في QA الواقعي القصيرمؤهلحققت SliCK ذلك في تجارب 2026 المبلغ عنها؛ والنتيجة ليست عالمية وتعتمد على افتراضات التجميع وأخذ العينات.
خالفت SliCK اختبار اتساق الاستلزام في 31% من الحالات المقيمةتم التحققأبلغت عن ذلك دراسة *Rethinking Uncertainty Evaluation in Large Language Models*.
لا تحدد الدقة المعايرةتم التحققيورد ConfidenceBench ترتيبات ودرجات Brier لا تتبع دقة النموذج ببساطة.
أفضل Brier score أبلغ عنه ConfidenceBench كان 0.103تم التحققالنتيجة هي المتوسط عبر ثلاث جولات على معياره الخاص المكون من 200 سؤال، وليست درجة عامة للنموذج.
Brier score هو متوسط الخطأ التربيعي بين الاحتمال والنتيجة الثنائيةتم التحققيعرّف ConfidenceBench Brier score الثنائي المستخدم في تقييمه.
كانت UQLM تحت صيانة نشطة في يوليو 2026تم التحققنُشر الإصدار v0.6.4 على GitHub في 26 يوليو 2026.
يجب أن تكون عتبة الإنتاج خاصة بالمهمةمؤهلهذا تفسير عملي لأدلة حساسية البروتوكول والمعايرة، وليس مبرهنة عالمية حول كل تطبيق.

المصادر

Rethinking Uncertainty Evaluation in Large Language Models — بحث أساسي؛ اختبارات الاتساق البنيوي والإخلاص والفائدة.
ConfidenceBench: Evaluating Confidence Calibration in Large Language Models — بحث أساسي؛ معيار للثقة اللفظية وBrier score.
Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration — بحث أساسي؛ حساسية بروتوكول القياس.
Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation — بحث أساسي؛ تقطير الاتساق الذاتي غير الخاضع للإشراف.
Can LLMs Express Their Uncertainty? — بحث أساسي؛ استحثاث الثقة اللفظية والقائمة على أخذ العينات.
Using logprobs — وثائق OpenAI الرسمية.
Gemini GenerateContent API — مرجع Google API الرسمي.
UQLM documentation — وثائق المشروع مفتوح المصدر الرسمية.
UQLM v0.6.4 release — سجل الإصدار الرسمي.