تقييم RAG: اختبار الاسترجاع قبل ضبط LLM
تقنية
AI
RAG
Evaluation
Machine Learning

تقييم RAG: اختبار الاسترجاع قبل ضبط LLM

سير عمل مدعوم بالأبحاث للعثور على ما إذا كان نظام RAG قد فشل في الاسترجاع أو التأسيس أو الامتناع أو العمليات.

Uygar DuzgunUUygar Duzgun
Jul 26, 2026
تم التحديث 1 أغسطس 2026
13 min read

يجب أن يبدأ تقييم RAG بالاسترجاع. إذا لم تصل الأدلة الصحيحة إلى النموذج، فإن ضبط المطالبات وترقيات النموذج تجعل السياق الخاطئ يبدو أكثر إقناعًا. اختبر الاسترجاع والتوليد والعمليات كخطوات منفصلة. احتفظ بمجموعة انحدار صغيرة، مُصدرة، تفشل عندما تسوء أي مرحلة.

مستوى القارئ: متوسط. يفترض هذا الدليل أنك تعرف أن التوليد المدعوم بالاسترجاع، أو RAG، يجد الوثائق قبل أن يطلب من نموذج اللغة الإجابة.

في هذا الدليل

تقييم RAG له ثلاث طبقات فشل منفصلة

تطبيق RAG هو خط أنابيب. تخفي درجة واحدة للإجابة النهائية أي مكون يحتاج إلى عمل.

الطبقةالسؤال للإجابةمقاييس بداية مفيدة
---------
الاسترجاعهل وجد النظام ورتب الأدلة التي تتطلبها السؤال؟معدل النجاح أو الاسترجاع@k، الدقة@k، MRR أو NDCG
التوليدهل استخدم النموذج تلك الأدلة بشكل صحيح؟التأسيس، الاكتمال، الصلة، الامتناع
العملياتهل عمل خط الأنابيب تحت قيود حقيقية؟زمن الاستجابة p95، التكلفة، معدل الخطأ، الحداثة، فشل التحكم في الوصول

ترتيب الأمور مهم. الاسترجاع هو في الأعلى. لا يمكن لمولد أن يستشهد بفقرة سياسة لم تدخل سياقه أبدًا، ولا تثبت الإجابة السلسة أن المسترجع عمل.

توفر وثائق مقيّم RAG الحالية من مايكروسوفت نفس الفصل من حيث التنفيذ. إنها توفر مقاييس استرجاع الوثائق للأدلة المرتبة، ثم تقيم التأسيس والصلة واكتمال الاستجابة في طبقة الإجابة. يتضمن مقيّم استرجاع الوثائق الدقة وNDCG وXDCG والصلة القصوى وأحكام الصلة المفقودة.

مخطط لمقاييس الاسترجاع والتوليد والعمليات في سير عمل تقييم RAG
مخطط لمقاييس الاسترجاع والتوليد والعمليات في سير عمل تقييم RAG

_تحتفظ بطاقة درجات RAG المفيدة بالاسترجاع والتوليد والتحقق من العمليات مرئية كطبقات منفصلة._

لماذا تعطي درجة واحدة شاملة أدلة تصحيح ضعيفة

تصل عدة أطر بحثية إلى نفس الاستنتاج العملي من اتجاهات مختلفة.

يقيم RAGChecker سلوك المسترجع والمولد بشكل منفصل. قارن مؤلفوه ثمانية أنظمة RAG عبر عشرة مجالات. تشمل مقاييسهم استرجاع المطالبات ودقة السياق للاسترجاع، بالإضافة إلى استخدام السياق، وحساسية الضوضاء، والهلوسة، والولاء للتوليد. في تقييم ميتا مكون من 280 زوجًا، كان لدى درجة التقييم العامة لـ RAGChecker ارتباط سبيرمان قدره 0.609 مع تفضيل البشر. وصل اثنان من المعلقين البشريين إلى 0.689. كانت التقييمات الآلية مفيدة، لكنها لم تزل الفجوة البشرية.

اقترح Ragas مقاييس خالية من المراجع للولاء، وصلة الإجابة، وصلة السياق. في مقارناته WikiEval، كان الاتفاق مع تفضيلات البشر 0.95 للولاء، و0.78 لصلة الإجابة، و0.70 لصلة السياق. وجد المؤلفون أن صلة السياق كانت الأصعب في الحكم. اعتبر تلك الأرقام كنتائج من تلك الدراسة، وليس معدلات دقة عالمية لكل قاضٍ أو مجموعة بيانات أو مجال.

إطار عمل أحدث، RAGe، يضيف اختيار المكونات وتليمترية الأجهزة. يقيم تكوينات خط الأنابيب عبر التجزئة، والتضمين، والاسترجاع، والتخزين، والتوليد بينما يقوم بتقليم التركيبات التي تتجاوز حدود زمن الاستجابة أو VRAM. تستخدم الورقة أسئلة طبيعية، وNewsQA، وTriviaQA بشكل افتراضي وتدعم مجموعات بيانات CSV أو JSON مخصصة. مساهمتها الرئيسية هي طريقة لمقارنة الجودة مع قيود الموارد؛ لا تؤسس تكوينًا واحدًا يفوز عبر المجالات.

معًا، تدعم هذه الأوراق نهجًا تشخيصيًا. لا تثبت أن مقياسًا أو مكتبة معينة كافية للإنتاج.

بناء مجموعة اختبار قبل اختيار المقاييس

ابدأ بـ 40 إلى 60 سؤالًا من المجال الذي تخدمه. هذا النطاق هو نقطة انطلاق عملية بدلاً من قانون إحصائي. إنه كبير بما يكفي لكشف عدة أنواع من الفشل وصغير بما يكفي لمراجعة إنسانية بعد كل تغيير مادي.

قم بتضمين خمس فئات استعلام على الأقل:

بحث مباشر: تحتوي فقرة واحدة على الإجابة.
متعددة الوثائق: تتطلب الإجابة أدلة من مصدرين أو أكثر.
غامض: يجب على النظام أن يطلب توضيحًا.
غير قابل للإجابة: لا يحتوي النص على أدلة كافية.
حديث أو مقيد: تعتمد النتيجة الصحيحة على تاريخ الوثيقة أو أذونات المستخدم.

يمكن أن تقترح سجلات الإنتاج أسئلة، ولكن قم بإزالة البيانات الشخصية والأسرار قبل إضافة أمثلة إلى مجموعة التقييم. تؤكد مناقشة الممارسين الأخيرة حول تقييم RAG في الإنتاج أيضًا على الاستعلامات الثابتة، والتكوينات المُصدرة، والتحقق المنفصل من الاسترجاع والتوليد. تعتبر تلك المناقشة دليلًا قصصيًا حول ألم سير العمل، وليس دليلاً على أن النهج يعمل في كل نظام.

قم بتخزين الأحكام ضد معرفات الوثائق الثابتة جنبًا إلى جنب مع أي نص منسوخ. تتغير حدود التجزئة عندما تقوم بضبط الفاصل. يسمح معرف المصدر القياسي للاختبار نفسه بالنجاة من هذا التغيير.

{ "query_id": "refund-window-01", "query": "كم من الوقت يمتلك العميل لإرجاع عنصر غير مفتوح؟", "relevant_document_ids": ["returns-policy-v4"], "required_claims": ["يمكن إرجاع العناصر غير المفتوحة خلال 30 يومًا."], "must_abstain": false, "allowed_roles": ["customer", "support"], "as_of": "2026-07-01" }

لحالة غير قابلة للإجابة، قم بتعيين `relevant_document_ids` إلى قائمة فارغة و`must_abstain` إلى `true`. لحالة مقيدة، قم بتشغيل نفس الاستعلام تحت دورين. يجب على المستخدم المصرح له استرجاع الوثيقة؛ يجب على المستخدم غير المصرح له ألا يتعلم محتويات تلك الوثيقة.

يجب على الفرق التي تبني نصها الخاص وطبقة التطبيق إصدار عقد المحتوى جنبًا إلى جنب مع مجموعة الاختبار. تنطبق نفس القاعدة على أنظمة البيانات المخصصة المبنية باستخدام Next.js وAI: يمكن أن يغير تغيير المخطط أو المحتوى الاسترجاع دون لمس المطالبة.

الخطوة 1: تقييم الاسترجاع دون توليد إجابة

قم بتشغيل كل استعلام عبر المسترجع واحفظ معرفات النتائج المرتبة، والدرجات، والطوابع الزمنية، وقرارات الوصول. لا تستدعِ نموذج اللغة بعد.

اختر مقاييس تتناسب مع شكل الأدلة

استخدم معدل النجاح@k عندما تكون وثيقة واحدة صحيحة كافية. يسأل عما إذا كان على الأقل مصدر واحد ذي صلة يظهر في أول `k` نتائج.

استخدم الاسترجاع@k عندما تتطلب الإجابة عدة مصادر. يقيس عدد الوثائق المعروفة ذات الصلة التي ظهرت في أول `k`.

استخدم الدقة@k عندما يكون السياق غير ذي صلة مكلفًا أو مشتتًا. يمكن أن يغمر الاسترجاع العالي مع الدقة المنخفضة المولد بالضوضاء.

استخدم MRR عندما تكون النتيجة ذات الصلة الأولى هي الأكثر أهمية. استخدم NDCG عندما يجب أن تظهر عدة نتائج مصنفة بترتيب مفيد. توثق مايكروسوفت NDCG والمقاييس المرتبطة بالاسترجاع المرتب في مقيّمها، بينما يستخدم RAGChecker استرجاع المطالبات ودقة السياق لربط الأدلة المسترجعة بالمطالبات التي تحتاجها الإجابة.

لا تجمع كل مقياس بشكل افتراضي. اختر مقياس تغطية واحد ومقياس ترتيب أو ضوضاء واحد. أضف مقياسًا فقط عندما يغير قرارًا.

صنف الفشل قبل تغيير النموذج

عادةً ما تقع فشل الاسترجاع في مجموعة صغيرة:

لم يتم استيعاب الوثيقة أبدًا.
توجد الوثيقة، لكن إصدارها الحالي قديم.
فصل التجزئة السؤال عن الحقيقة المطلوبة.
يستخدم الاستعلام والوثيقة مفردات مختلفة.
أزالت فلاتر البيانات الوصفية المصدر الصحيح.
وضعت الترتيب المصدر الصحيح تحت `k`.
كشفت ضوابط الوصول أو أخفت الوثيقة الخاطئة.

يمتلك كل فشل مالكًا مختلفًا. لا يمكن لإعادة التضمين إصلاح وثيقة مفقودة. لا يمكن لنموذج لغة أكبر إصلاح فلتر الأذونات. قد يساعد إعادة الترتيب عندما تكون الأدلة موجودة ولكن مرتبة بشكل سيء.

بالنسبة للتطبيقات المتصلة بالأدوات، احتفظ بطلب الاسترجاع، والفلاتر، ومعرفات النتائج، واستجابة الأداة في السجل. يتناسب ذلك مع نمط التحكم الأوسع الموصوف في سير عمل مطوري MCP: افحص العقدة، وانتقال الحالة، والنص النهائي.

الخطوة 2: تقييم التوليد على أدلة ثابتة

بمجرد أن يلبي الاسترجاع عتباته، قم بتجميد السياقات المسترجعة وأعد تشغيلها ضد المولد. هذا يعزل تغييرات المطالبات أو النموذج عن تغييرات الفهرس.

قم بقياس أربعة سلوكيات:

التأسيس: كل ادعاء واقعي في الإجابة مدعوم بالسياق المقدم.
الاكتمل: تغطي الإجابة المطالبات المطلوبة.
الصلة: تتناول الإجابة سؤال المستخدم دون مواد غير ذات صلة.
الامتناع: يرفض النظام أو يطلب توضيحًا عندما تكون الأدلة مفقودة أو متضاربة أو قديمة أو غير مصرح بها.

يمكن أن تساعد إجابة مرجعية في الاكتمال. إنها أقل فائدة كمصدر الحقيقة الوحيد لأن عدة صيغ قد تكون صحيحة. قم بتخزين المطالبات المطلوبة ومعرفات الوثائق الداعمة عند الإمكان.

قم بتشغيل اختبار توليد ثانٍ بسياق غير مكتمل عمدًا. يجب أن يكشف النظام الموثوق عدم اليقين بدلاً من ملء الفجوات من ذاكرة النموذج. هذا مهم عندما يحتوي النص على حقائق خاصة أو متغيرة أو محددة المجال.

لا يزال اختيار النموذج يؤثر على جودة الإجابة، وزمن الاستجابة، والتكلفة، لكن ذلك يأتي بعد أدلة الاسترجاع. إذا فشل نفس السياق الثابت عبر المولدات، قارن تجارة النموذج وAPI. إذا كان السياق نفسه خاطئًا، فإن تغيير المولد هو حركة مهدرة.

إضافة حالات الأمان والصراع إلى مجموعة الاسترجاع

تختفي اختبارات الصلة العادية الأدلة العدائية أو المتضاربة.

اختبرت ورقة يوليو 2026 حول تسمم سيبيل متعدد الأشكال في RAG مجموعات من الفقرات المختلفة لغويًا التي دعمت نفس الإجابة المختارة من قبل المهاجم. تحت إعداد التعرض القسري للورقة، أنتجت الفقرات المتعددة الأشكال معدل اختطاف قدره 22.8% مقارنة بـ 4.0% للفقرات الأحادية الشكل المتكررة. قامت تصفية تداخل الرموز بالتقاط جميع المجموعات الأحادية الشكل وأي من المجموعات المتعددة الأشكال.

لا تقيس النتيجة مدى نجاح هذا الهجوم في الإنتاج. قام المؤلفون بتثبيت المزيج المسترجع عند ست فقرات هجوم، وفقتين ذهبيتين، واثنتين من الحشوات لعزل سلوك القارئ. كما أبلغوا عن قيود حول فئة هجوم واحدة، وخطر تلوث مجموعة البيانات، و500 سؤال للإزالة، والتحقق القائم على LLM.

الدرس المفيد من التقييم هو أضيق: صنف أكثر من "صحيح" و"هدف المهاجم". تتبع الورقة أربعة نتائج:

إجابة ذهبية،
إجابة مختطفة،
امتناع،
انحراف غير ذي صلة.

أضف حالات الصراع إلى مجموعتك الخاصة. قم بتضمين مطالبات مكررة بصيغ مختلفة، ومصدر قديم يتعارض مع السياسة الحالية، ومصدر أقل موثوقية يتعارض مع مصدر موثوق. سجل ما إذا كان النظام يجيب أو يمتنع أو ينحرف.

معايرة قضاة LLM قبل الوثوق في درجاتهم

تجعل قضاة LLM اختبار الانحدار أرخص، خاصة بالنسبة للتأسيس وتغطية المطالبات. لا يزالون يعتمدون على البرمجيات مع المطالبات، وإصدارات النموذج، وسلوك التحليل، ونقاط العمى المعروفة.

استخدم أربعة ضوابط:

عمياء المقارنة. أزل أسماء النموذج والبائع من مخرجات المرشحين.
احتفظ بشريحة مُعلمة بشريًا. راجع على الأقل مجموعة صغيرة وثابتة لكل تغيير في القاضي أو المطالبة.
إصدار القاضي. احفظ نموذج القاضي، والمطالبة، ودرجة الحرارة، والمحلل، وتنفيذ المقياس.
افحص الاختلافات. عيّن حالات قريبة من عتبة النجاح وحالات حيث يختلف قاضيان.

تظهر دراسات Ragas وRAGChecker كلاهما لماذا تهم المعايرة. يختلف الاتفاق حسب البعد، وتبقى الارتباطات الآلية أقل من الاتفاق البشري. يجب أن يؤدي المقياس الرقمي إلى الفحص، وليس إنهائه.

تظهر الإصدارات الحالية مفتوحة المصدر أيضًا عملًا نشطًا حول المقيمين. أضافت DeepEval 4.1.3، التي صدرت في 12 يوليو 2026، فحوصات حتمية لدورات الوكلاء وأذونات الأدوات بينما أصلحت تكامل Ragas. أضافت TruLens 2.9.0، التي صدرت في 23 يوليو، مجموعات القضاة، واختبارات معايير A/B، وتحليل توزيع الدرجات، وتوليد مجموعة ذهبية. تعتبر نشاطات الإصدار دليلًا على العمل الهندسي المستمر، وليس دليلًا على أن أي مكتبة هي الخيار الصحيح لمجموعتك.

سير عمل انحدار RAG الحد الأدنى

استخدم نفس التسلسل لكل تغيير مادي في خط الأنابيب:

جمد إصدار مجموعة الاختبار ولقطة النص.
سجل إعدادات التجزئة، ونموذج التضمين، وإعدادات الفهرس، والفلاتر، وإعادة الترتيب، والمطالبة، ونموذج المولد، وإصدارات القاضي.
قم بتشغيل الاسترجاع فقط. توقف إذا تراجعت التغطية أو الترتيب أو الحداثة أو فحوصات الوصول.
أعد تشغيل السياقات المعتمدة عبر المولد.
سجل التأسيس، والاكتمل، والصلة، والامتناع.
راجع الشريحة المُعلمة بشريًا وعتبات الاختلافات.
سجل زمن الاستجابة p50 وp95، والتكلفة لكل استعلام، والمهلات، والنتائج الفارغة.
غيّر مكونًا واحدًا، ثم كرر.

يمكن أن يبدو سجل النتائج المدمج هكذا:

{ "run_id": "rag-2026-07-26-b", "test_set": "support-v7", "corpus_snapshot": "2026-07-25T22:00:00Z", "retrieval": { "recall_at_5": 0.91, "ndcg_at_5": 0.84, "unauthorized_hits": 0 }, "generation": { "grounded_pass_rate": 0.94, "complete_pass_rate": 0.87, "abstention_pass_rate": 0.90 }, "operations": { "p95_ms": 1380, "cost_per_query_usd": 0.0042 } }

تلك الأرقام توضيحية. حدد العتبات من مخاطر، وقاعدة، وتكلفة الخطأ. يجب ألا يشارك مساعد المعرفة الطبية ومساعد البحث عن المنتجات نفس بوابة الإصدار.

قرر الإصلاح من الطبقة الفاشلة

العرضالأدلة التي يجب فحصهاالإجراء الأول المحتمل
---------
الوثيقة ذات الصلة غائبةحالة الاستيعاب، المعرف القياسي، الفلاترإصلاح الاستيعاب أو البيانات الوصفية
الوثيقة ذات الصلة مرتبة بشكل منخفض جدًاتتبع الترتيب، مصطلحات الاستعلام، الدرجاتاختبار إعادة كتابة الاستعلام، الاسترجاع الهجين، أو إعادة الترتيب
أدلة صحيحة بالإضافة إلى ادعاء غير مدعومرسم ادعاء إلى سياقتشديد تعليمات التوليد أو بوابة التأسيس
إجابة صحيحة ولكن غير مكتملةتغطية المطالبات المطلوبةمراجعة تجميع السياق أو مطالبة الإجابة
إجابات عندما تكون الأدلة مفقودةاختبار سلبي وتتبع الامتناعإضافة بوابة كفاية الأدلة
جودة جيدة ولكن بطيئةتوقيتات المرحلة وتليمترية المواردتحسين عنق الزجاجة المقاس
استرجاع مصدر غير مصرح بهالهوية، الفلتر، معرفات النتائجحظر الإصدار وإصلاح التفويض

تعتبر هذه الجدول نقطة تقييم RAG: يجب أن تحدد درجة الفشل التجربة التالية. إذا لم تتمكن من ذلك، فإن المقياس بعيد جدًا عن المكون الذي تحتاج إلى تغييره.

ما تدعمه الأدلة

قامت الأوراق بقياس أنظمة ومجموعات بيانات محددة. وجد RAGChecker أن المقاييس المودولارية يمكن أن تتوافق مع تفضيلات البشر وتكشف عن تبادلات المسترجع-المولد. وجد Ragas أن اتفاق القضاة يختلف عبر الولاء، وصلة الإجابة، وصلة السياق. أظهر RAGe إطارًا يجمع بين مقاييس الجودة مع قيود زمن الاستجابة والذاكرة. أظهر معيار التسمم أن إعداد هجوم مقيد واحد أنتج أنماط اختطاف، وامتناع، وانحراف متميزة.

لا تثبت الأدلة عتبات عالمية، أو مقيّمًا الأفضل عالميًا، أو انتشار هجمات الإنتاج. تفسيري العملي هو فصل المراحل، والاحتفاظ بشريحة مُعلمة بشريًا، وطلب من كل مقياس أن يشير إلى إجراء هندسي.

فحوصات المطالبات

المطالبةالأدلة الداعمةالحدود التي تم فحصها
---------
يجب قياس الاسترجاع بشكل منفصل عن جودة الإجابةمقيمو RAG من مايكروسوفت؛ RAGCheckerإرشادات الهندسة، وليس ضمانًا عالميًا
قارن RAGChecker بين ثمانية أنظمة عبر عشرة مجالاتورقة RAGCheckerتعتمد النتائج على معيارها وإعداد المقياس
أفاد Ragas باتفاق 0.95، 0.78، و0.70 بين البشر عبر ثلاثة أبعادورقة Ragas، الجدول 1دقة زوجية محددة بالدراسة
يتضمن RAGe تليمترية الأجهزة وتقليم التكوينورقة RAGeمساهمة الإطار، وليس دليلاً على أفضل تكوين
أنتجت الفقرات المتعددة الأشكال 22.8% اختطاف مقابل 4.0% في إزالة الورقةورقة تسمم سيبيلتعرض قسري 6:2:2؛ ليس انتشار الإنتاج
أصدرت DeepEval وTruLens ميزات تقييم حديثةملاحظات الإصدار الرسمية على GitHubإشارة إلى الصيانة، وليس دليلًا على التبني أو الجودة