يجب أن يبدأ تقييم RAG بالاسترجاع. إذا لم تصل الأدلة الصحيحة إلى النموذج، فإن ضبط المطالبات وترقيات النموذج تجعل السياق الخاطئ يبدو أكثر إقناعًا. اختبر الاسترجاع والتوليد والعمليات كخطوات منفصلة. احتفظ بمجموعة انحدار صغيرة، مُصدرة، تفشل عندما تسوء أي مرحلة.
مستوى القارئ: متوسط. يفترض هذا الدليل أنك تعرف أن التوليد المدعوم بالاسترجاع، أو RAG، يجد الوثائق قبل أن يطلب من نموذج اللغة الإجابة.
في هذا الدليل
تقييم RAG له ثلاث طبقات فشل منفصلة
تطبيق RAG هو خط أنابيب. تخفي درجة واحدة للإجابة النهائية أي مكون يحتاج إلى عمل.
| الطبقة | السؤال للإجابة | مقاييس بداية مفيدة |
|---|---|---|
| --- | --- | --- |
| الاسترجاع | هل وجد النظام ورتب الأدلة التي تتطلبها السؤال؟ | معدل النجاح أو الاسترجاع@k، الدقة@k، MRR أو NDCG |
| التوليد | هل استخدم النموذج تلك الأدلة بشكل صحيح؟ | التأسيس، الاكتمال، الصلة، الامتناع |
| العمليات | هل عمل خط الأنابيب تحت قيود حقيقية؟ | زمن الاستجابة p95، التكلفة، معدل الخطأ، الحداثة، فشل التحكم في الوصول |
ترتيب الأمور مهم. الاسترجاع هو في الأعلى. لا يمكن لمولد أن يستشهد بفقرة سياسة لم تدخل سياقه أبدًا، ولا تثبت الإجابة السلسة أن المسترجع عمل.
توفر وثائق مقيّم RAG الحالية من مايكروسوفت نفس الفصل من حيث التنفيذ. إنها توفر مقاييس استرجاع الوثائق للأدلة المرتبة، ثم تقيم التأسيس والصلة واكتمال الاستجابة في طبقة الإجابة. يتضمن مقيّم استرجاع الوثائق الدقة وNDCG وXDCG والصلة القصوى وأحكام الصلة المفقودة.

_تحتفظ بطاقة درجات RAG المفيدة بالاسترجاع والتوليد والتحقق من العمليات مرئية كطبقات منفصلة._
لماذا تعطي درجة واحدة شاملة أدلة تصحيح ضعيفة
تصل عدة أطر بحثية إلى نفس الاستنتاج العملي من اتجاهات مختلفة.
يقيم RAGChecker سلوك المسترجع والمولد بشكل منفصل. قارن مؤلفوه ثمانية أنظمة RAG عبر عشرة مجالات. تشمل مقاييسهم استرجاع المطالبات ودقة السياق للاسترجاع، بالإضافة إلى استخدام السياق، وحساسية الضوضاء، والهلوسة، والولاء للتوليد. في تقييم ميتا مكون من 280 زوجًا، كان لدى درجة التقييم العامة لـ RAGChecker ارتباط سبيرمان قدره 0.609 مع تفضيل البشر. وصل اثنان من المعلقين البشريين إلى 0.689. كانت التقييمات الآلية مفيدة، لكنها لم تزل الفجوة البشرية.
اقترح Ragas مقاييس خالية من المراجع للولاء، وصلة الإجابة، وصلة السياق. في مقارناته WikiEval، كان الاتفاق مع تفضيلات البشر 0.95 للولاء، و0.78 لصلة الإجابة، و0.70 لصلة السياق. وجد المؤلفون أن صلة السياق كانت الأصعب في الحكم. اعتبر تلك الأرقام كنتائج من تلك الدراسة، وليس معدلات دقة عالمية لكل قاضٍ أو مجموعة بيانات أو مجال.
إطار عمل أحدث، RAGe، يضيف اختيار المكونات وتليمترية الأجهزة. يقيم تكوينات خط الأنابيب عبر التجزئة، والتضمين، والاسترجاع، والتخزين، والتوليد بينما يقوم بتقليم التركيبات التي تتجاوز حدود زمن الاستجابة أو VRAM. تستخدم الورقة أسئلة طبيعية، وNewsQA، وTriviaQA بشكل افتراضي وتدعم مجموعات بيانات CSV أو JSON مخصصة. مساهمتها الرئيسية هي طريقة لمقارنة الجودة مع قيود الموارد؛ لا تؤسس تكوينًا واحدًا يفوز عبر المجالات.
معًا، تدعم هذه الأوراق نهجًا تشخيصيًا. لا تثبت أن مقياسًا أو مكتبة معينة كافية للإنتاج.
بناء مجموعة اختبار قبل اختيار المقاييس
ابدأ بـ 40 إلى 60 سؤالًا من المجال الذي تخدمه. هذا النطاق هو نقطة انطلاق عملية بدلاً من قانون إحصائي. إنه كبير بما يكفي لكشف عدة أنواع من الفشل وصغير بما يكفي لمراجعة إنسانية بعد كل تغيير مادي.
قم بتضمين خمس فئات استعلام على الأقل:
يمكن أن تقترح سجلات الإنتاج أسئلة، ولكن قم بإزالة البيانات الشخصية والأسرار قبل إضافة أمثلة إلى مجموعة التقييم. تؤكد مناقشة الممارسين الأخيرة حول تقييم RAG في الإنتاج أيضًا على الاستعلامات الثابتة، والتكوينات المُصدرة، والتحقق المنفصل من الاسترجاع والتوليد. تعتبر تلك المناقشة دليلًا قصصيًا حول ألم سير العمل، وليس دليلاً على أن النهج يعمل في كل نظام.
قم بتخزين الأحكام ضد معرفات الوثائق الثابتة جنبًا إلى جنب مع أي نص منسوخ. تتغير حدود التجزئة عندما تقوم بضبط الفاصل. يسمح معرف المصدر القياسي للاختبار نفسه بالنجاة من هذا التغيير.
{ "query_id": "refund-window-01", "query": "كم من الوقت يمتلك العميل لإرجاع عنصر غير مفتوح؟", "relevant_document_ids": ["returns-policy-v4"], "required_claims": ["يمكن إرجاع العناصر غير المفتوحة خلال 30 يومًا."], "must_abstain": false, "allowed_roles": ["customer", "support"], "as_of": "2026-07-01" }
لحالة غير قابلة للإجابة، قم بتعيين `relevant_document_ids` إلى قائمة فارغة و`must_abstain` إلى `true`. لحالة مقيدة، قم بتشغيل نفس الاستعلام تحت دورين. يجب على المستخدم المصرح له استرجاع الوثيقة؛ يجب على المستخدم غير المصرح له ألا يتعلم محتويات تلك الوثيقة.
يجب على الفرق التي تبني نصها الخاص وطبقة التطبيق إصدار عقد المحتوى جنبًا إلى جنب مع مجموعة الاختبار. تنطبق نفس القاعدة على أنظمة البيانات المخصصة المبنية باستخدام Next.js وAI: يمكن أن يغير تغيير المخطط أو المحتوى الاسترجاع دون لمس المطالبة.
الخطوة 1: تقييم الاسترجاع دون توليد إجابة
قم بتشغيل كل استعلام عبر المسترجع واحفظ معرفات النتائج المرتبة، والدرجات، والطوابع الزمنية، وقرارات الوصول. لا تستدعِ نموذج اللغة بعد.
اختر مقاييس تتناسب مع شكل الأدلة
استخدم معدل النجاح@k عندما تكون وثيقة واحدة صحيحة كافية. يسأل عما إذا كان على الأقل مصدر واحد ذي صلة يظهر في أول `k` نتائج.
استخدم الاسترجاع@k عندما تتطلب الإجابة عدة مصادر. يقيس عدد الوثائق المعروفة ذات الصلة التي ظهرت في أول `k`.
استخدم الدقة@k عندما يكون السياق غير ذي صلة مكلفًا أو مشتتًا. يمكن أن يغمر الاسترجاع العالي مع الدقة المنخفضة المولد بالضوضاء.
استخدم MRR عندما تكون النتيجة ذات الصلة الأولى هي الأكثر أهمية. استخدم NDCG عندما يجب أن تظهر عدة نتائج مصنفة بترتيب مفيد. توثق مايكروسوفت NDCG والمقاييس المرتبطة بالاسترجاع المرتب في مقيّمها، بينما يستخدم RAGChecker استرجاع المطالبات ودقة السياق لربط الأدلة المسترجعة بالمطالبات التي تحتاجها الإجابة.
لا تجمع كل مقياس بشكل افتراضي. اختر مقياس تغطية واحد ومقياس ترتيب أو ضوضاء واحد. أضف مقياسًا فقط عندما يغير قرارًا.
صنف الفشل قبل تغيير النموذج
عادةً ما تقع فشل الاسترجاع في مجموعة صغيرة:
يمتلك كل فشل مالكًا مختلفًا. لا يمكن لإعادة التضمين إصلاح وثيقة مفقودة. لا يمكن لنموذج لغة أكبر إصلاح فلتر الأذونات. قد يساعد إعادة الترتيب عندما تكون الأدلة موجودة ولكن مرتبة بشكل سيء.
بالنسبة للتطبيقات المتصلة بالأدوات، احتفظ بطلب الاسترجاع، والفلاتر، ومعرفات النتائج، واستجابة الأداة في السجل. يتناسب ذلك مع نمط التحكم الأوسع الموصوف في سير عمل مطوري MCP: افحص العقدة، وانتقال الحالة، والنص النهائي.
الخطوة 2: تقييم التوليد على أدلة ثابتة
بمجرد أن يلبي الاسترجاع عتباته، قم بتجميد السياقات المسترجعة وأعد تشغيلها ضد المولد. هذا يعزل تغييرات المطالبات أو النموذج عن تغييرات الفهرس.
قم بقياس أربعة سلوكيات:
يمكن أن تساعد إجابة مرجعية في الاكتمال. إنها أقل فائدة كمصدر الحقيقة الوحيد لأن عدة صيغ قد تكون صحيحة. قم بتخزين المطالبات المطلوبة ومعرفات الوثائق الداعمة عند الإمكان.
قم بتشغيل اختبار توليد ثانٍ بسياق غير مكتمل عمدًا. يجب أن يكشف النظام الموثوق عدم اليقين بدلاً من ملء الفجوات من ذاكرة النموذج. هذا مهم عندما يحتوي النص على حقائق خاصة أو متغيرة أو محددة المجال.
لا يزال اختيار النموذج يؤثر على جودة الإجابة، وزمن الاستجابة، والتكلفة، لكن ذلك يأتي بعد أدلة الاسترجاع. إذا فشل نفس السياق الثابت عبر المولدات، قارن تجارة النموذج وAPI. إذا كان السياق نفسه خاطئًا، فإن تغيير المولد هو حركة مهدرة.
إضافة حالات الأمان والصراع إلى مجموعة الاسترجاع
تختفي اختبارات الصلة العادية الأدلة العدائية أو المتضاربة.
اختبرت ورقة يوليو 2026 حول تسمم سيبيل متعدد الأشكال في RAG مجموعات من الفقرات المختلفة لغويًا التي دعمت نفس الإجابة المختارة من قبل المهاجم. تحت إعداد التعرض القسري للورقة، أنتجت الفقرات المتعددة الأشكال معدل اختطاف قدره 22.8% مقارنة بـ 4.0% للفقرات الأحادية الشكل المتكررة. قامت تصفية تداخل الرموز بالتقاط جميع المجموعات الأحادية الشكل وأي من المجموعات المتعددة الأشكال.
لا تقيس النتيجة مدى نجاح هذا الهجوم في الإنتاج. قام المؤلفون بتثبيت المزيج المسترجع عند ست فقرات هجوم، وفقتين ذهبيتين، واثنتين من الحشوات لعزل سلوك القارئ. كما أبلغوا عن قيود حول فئة هجوم واحدة، وخطر تلوث مجموعة البيانات، و500 سؤال للإزالة، والتحقق القائم على LLM.
الدرس المفيد من التقييم هو أضيق: صنف أكثر من "صحيح" و"هدف المهاجم". تتبع الورقة أربعة نتائج:
أضف حالات الصراع إلى مجموعتك الخاصة. قم بتضمين مطالبات مكررة بصيغ مختلفة، ومصدر قديم يتعارض مع السياسة الحالية، ومصدر أقل موثوقية يتعارض مع مصدر موثوق. سجل ما إذا كان النظام يجيب أو يمتنع أو ينحرف.
معايرة قضاة LLM قبل الوثوق في درجاتهم
تجعل قضاة LLM اختبار الانحدار أرخص، خاصة بالنسبة للتأسيس وتغطية المطالبات. لا يزالون يعتمدون على البرمجيات مع المطالبات، وإصدارات النموذج، وسلوك التحليل، ونقاط العمى المعروفة.
استخدم أربعة ضوابط:
تظهر دراسات Ragas وRAGChecker كلاهما لماذا تهم المعايرة. يختلف الاتفاق حسب البعد، وتبقى الارتباطات الآلية أقل من الاتفاق البشري. يجب أن يؤدي المقياس الرقمي إلى الفحص، وليس إنهائه.
تظهر الإصدارات الحالية مفتوحة المصدر أيضًا عملًا نشطًا حول المقيمين. أضافت DeepEval 4.1.3، التي صدرت في 12 يوليو 2026، فحوصات حتمية لدورات الوكلاء وأذونات الأدوات بينما أصلحت تكامل Ragas. أضافت TruLens 2.9.0، التي صدرت في 23 يوليو، مجموعات القضاة، واختبارات معايير A/B، وتحليل توزيع الدرجات، وتوليد مجموعة ذهبية. تعتبر نشاطات الإصدار دليلًا على العمل الهندسي المستمر، وليس دليلًا على أن أي مكتبة هي الخيار الصحيح لمجموعتك.
سير عمل انحدار RAG الحد الأدنى
استخدم نفس التسلسل لكل تغيير مادي في خط الأنابيب:
يمكن أن يبدو سجل النتائج المدمج هكذا:
{ "run_id": "rag-2026-07-26-b", "test_set": "support-v7", "corpus_snapshot": "2026-07-25T22:00:00Z", "retrieval": { "recall_at_5": 0.91, "ndcg_at_5": 0.84, "unauthorized_hits": 0 }, "generation": { "grounded_pass_rate": 0.94, "complete_pass_rate": 0.87, "abstention_pass_rate": 0.90 }, "operations": { "p95_ms": 1380, "cost_per_query_usd": 0.0042 } }
تلك الأرقام توضيحية. حدد العتبات من مخاطر، وقاعدة، وتكلفة الخطأ. يجب ألا يشارك مساعد المعرفة الطبية ومساعد البحث عن المنتجات نفس بوابة الإصدار.
قرر الإصلاح من الطبقة الفاشلة
| العرض | الأدلة التي يجب فحصها | الإجراء الأول المحتمل |
|---|---|---|
| --- | --- | --- |
| الوثيقة ذات الصلة غائبة | حالة الاستيعاب، المعرف القياسي، الفلاتر | إصلاح الاستيعاب أو البيانات الوصفية |
| الوثيقة ذات الصلة مرتبة بشكل منخفض جدًا | تتبع الترتيب، مصطلحات الاستعلام، الدرجات | اختبار إعادة كتابة الاستعلام، الاسترجاع الهجين، أو إعادة الترتيب |
| أدلة صحيحة بالإضافة إلى ادعاء غير مدعوم | رسم ادعاء إلى سياق | تشديد تعليمات التوليد أو بوابة التأسيس |
| إجابة صحيحة ولكن غير مكتملة | تغطية المطالبات المطلوبة | مراجعة تجميع السياق أو مطالبة الإجابة |
| إجابات عندما تكون الأدلة مفقودة | اختبار سلبي وتتبع الامتناع | إضافة بوابة كفاية الأدلة |
| جودة جيدة ولكن بطيئة | توقيتات المرحلة وتليمترية الموارد | تحسين عنق الزجاجة المقاس |
| استرجاع مصدر غير مصرح به | الهوية، الفلتر، معرفات النتائج | حظر الإصدار وإصلاح التفويض |
تعتبر هذه الجدول نقطة تقييم RAG: يجب أن تحدد درجة الفشل التجربة التالية. إذا لم تتمكن من ذلك، فإن المقياس بعيد جدًا عن المكون الذي تحتاج إلى تغييره.
ما تدعمه الأدلة
قامت الأوراق بقياس أنظمة ومجموعات بيانات محددة. وجد RAGChecker أن المقاييس المودولارية يمكن أن تتوافق مع تفضيلات البشر وتكشف عن تبادلات المسترجع-المولد. وجد Ragas أن اتفاق القضاة يختلف عبر الولاء، وصلة الإجابة، وصلة السياق. أظهر RAGe إطارًا يجمع بين مقاييس الجودة مع قيود زمن الاستجابة والذاكرة. أظهر معيار التسمم أن إعداد هجوم مقيد واحد أنتج أنماط اختطاف، وامتناع، وانحراف متميزة.
لا تثبت الأدلة عتبات عالمية، أو مقيّمًا الأفضل عالميًا، أو انتشار هجمات الإنتاج. تفسيري العملي هو فصل المراحل، والاحتفاظ بشريحة مُعلمة بشريًا، وطلب من كل مقياس أن يشير إلى إجراء هندسي.
فحوصات المطالبات
| المطالبة | الأدلة الداعمة | الحدود التي تم فحصها |
|---|---|---|
| --- | --- | --- |
| يجب قياس الاسترجاع بشكل منفصل عن جودة الإجابة | مقيمو RAG من مايكروسوفت؛ RAGChecker | إرشادات الهندسة، وليس ضمانًا عالميًا |
| قارن RAGChecker بين ثمانية أنظمة عبر عشرة مجالات | ورقة RAGChecker | تعتمد النتائج على معيارها وإعداد المقياس |
| أفاد Ragas باتفاق 0.95، 0.78، و0.70 بين البشر عبر ثلاثة أبعاد | ورقة Ragas، الجدول 1 | دقة زوجية محددة بالدراسة |
| يتضمن RAGe تليمترية الأجهزة وتقليم التكوين | ورقة RAGe | مساهمة الإطار، وليس دليلاً على أفضل تكوين |
| أنتجت الفقرات المتعددة الأشكال 22.8% اختطاف مقابل 4.0% في إزالة الورقة | ورقة تسمم سيبيل | تعرض قسري 6:2:2؛ ليس انتشار الإنتاج |
| أصدرت DeepEval وTruLens ميزات تقييم حديثة | ملاحظات الإصدار الرسمية على GitHub | إشارة إلى الصيانة، وليس دليلًا على التبني أو الجودة |
