تحقق من استشهادات الذكاء الاصطناعي قبل أن تثق بها
الجمهور: القراء المتوسطون الذين يستخدمون الذكاء الاصطناعي للبحث أو الكتابة أو الدراسة أو اتخاذ القرارات الفنية أو العمل القائم على الأدلة.
للتحقق من استشهادات الذكاء الاصطناعي، يجب تأكيد حقيقتين منفصلتين: وجود المصدر، ودعم المصدر للاقتباس الدقيق. يمكن أن يحل البحث عن DOI السؤال الأول. فقط المقطع ذي الصلة يمكن أن يحل السؤال الثاني.
أكثر تدفق عمل آمن يتكون من خمس خطوات:
تستغرق هذه العملية دقائق للإجابة القصيرة. كما أنها تلتقط أكثر وضعي الفشل خطورة: مرجع محتمل لم يكن موجودًا أبدًا، ومصدر حقيقي يقول شيئًا أضيق أو مختلفًا عن نثر الذكاء الاصطناعي.
لماذا المصدر المرتبط ليس كافيًا
يمكن للمنتجات الحالية من الذكاء الاصطناعي البحث في الويب وإرفاق الاستشهادات. لا يزال مزودوها يخبرون المستخدمين بالتحقق من الادعاءات المهمة. توضح إرشادات الدقة الحالية من OpenAI الدراسات المفبركة، والاستشهادات، والمراجع كأخطاء محتملة، ثم ينصح القراء بزيارة المصادر مباشرة.
يمكن أن يفشل رابط المصدر على أربعة مستويات:
| المستوى | السؤال | الفشل الشائع |
|---|---|---|
| --- | --- | --- |
| الوجود | هل العمل موجود؟ | عنوان، مجلة، مؤلف، أو DOI مختلق |
| الهوية | هل هذا هو العمل المذكور؟ | سنة، نسخة، ورقة، أو مصدر يحمل عنوانًا مشابهًا خاطئًا |
| الدعم | هل يدعم المصدر الادعاء؟ | المقطع غير ذي صلة، متناقض، أو أضيق بكثير |
| النطاق | هل يمكن أن يحمل النتيجة الاستنتاج؟ | عينة صغيرة، مجموعة سكانية مختلفة، مقياس بديل، أو قيد مفقود |
التحقق من عنوان URL فقط يترك آخر ثلاثة مستويات غير محلولة. التحقق من العنوان فقط لا يزال يترك الدعم والنطاق غير محلولين.
تنطبق نفس الفحوصات على أكثر من الأوراق. قد يوجد رابط لوثائق المنتج ولكنه يصف إصدارًا آخر. قد يبلغ معيار عن نتيجة تحت أجهزة أو مطالبات مختلفة. قد تغطي صفحة سياسة مكانًا أو تاريخًا آخر.
ماذا وجدت الأبحاث الحديثة حول استشهادات الذكاء الاصطناعي
أربع دراسات تساعد في فصل الفشل المقاس عن الاستنتاج العملي. لا تثبت أي منها أن كل إجابة ذكاء اصطناعي مستشهد بها غير موثوقة. معًا، تظهر لماذا تحتاج هوية المصدر، ودعم المقطع، ومخاطر القرار إلى فحوصات منفصلة.
المراجع غير الموجودة وصلت إلى أوراق حقيقية
قامت ورقة مايو 2026 هلوسات LLM في البرية بتدقيق 111 مليون مرجع عبر 2.5 مليون ورقة في arXiv وbioRxiv وSSRN وPubMed Central. قدر المؤلفون 146,932 استشهادًا هلوسيًا في 2025، باستخدام خط أنابيب يطابق العناوين مع الفهارس الأكاديمية ويطبق مراحل تنظيف وبحث إضافية.
هذا الرقم هو تقدير محافظ داخل المستودعات المدروسة. يمكن أن تفوت الطريقة الأعمال الغامضة وتخطئ في تصنيف السجلات عندما تختلف بيانات التعريف. إنها تكشف عن المراجع غير الموجودة بشكل أكثر مباشرة من اكتشاف ورقة حقيقية تم استخدامها لدعم الادعاء الخاطئ. الاستنتاج الآمن ضيق: الاستشهادات المزيفة تظهر الآن في الأبحاث الحقيقية.
يمكن أن تزيد الاستشهادات من الاعتماد الخاطئ
اختبرت دراسة صدرت في 1 أغسطس 2026 مساعدًا سريريًا مرتبطًا بمصدر مع 46 طبيبًا. في نماذج اللغة الكبيرة تحسن دقة الأطباء ولكن تؤدي إلى اعتماد خاطئ، ارتفعت الدقة المتوسطة من 70.8% بدون المساعد إلى 82.6% معه. زاد الدعم المزعوم للاستشهاد من اعتماد النصيحة الصحيحة من 34% إلى 76.9%.
أنشأ نفس الإشارة خطرًا. عندما ظهر أن النصيحة غير الصحيحة مدعومة، انخفضت المقاومة من 92% إلى 34.8% في القرارات الملاحظة. لا تثبت الدراسة هذا التأثير الدقيق لوظائف أخرى أو أبحاث يومية. يحد إعدادها السريري، وترتيب الدراسة، ومجموعة صغيرة من القرارات الضارة من مدى إمكانية توسيع القراء للنتيجة. لا يزال الفجوة المقاسة تحذر من التعامل مع إجابة مستشهد بها كإشارة ثقة.
تعمل فحوصات مستوى الادعاء بشكل أفضل من الفحص البصري
VetScore، الذي صدر في 4 أغسطس، يقسم إجابة طويلة إلى ادعاءات، يتحقق من كل ادعاء مقابل مقتطفات مستشهد بها، يسجل الضرر المحتمل بشكل منفصل، ثم يحسب نتيجة معدلة حسب المخاطر. قام المؤلفون بالتحقق من المكونات مقابل تعليقات من خبراء بيطريين وأبلغوا عن ارتباطات تصل إلى 0.78 للتحقق من الحقائق و0.76 لتسجيل الضرر عبر نماذج القضاة المختبرة.
تتحقق الورقة من المقتطفات المستشهد بها، وليس الحقائق من بحث خارجي. لا تختبر الحذف، أو الطب البشري، أو مدخلات الصور، أو النتائج الواقعية. لا يزال بإمكان القراء استخدام طريقتها الأساسية: تقسيم النص إلى ادعاءات، والتحقق من كل واحدة، وقضاء المزيد من الوقت حيث يمكن أن يتسبب الخطأ في ضرر.
يمكن أن تخفي التقارير المصقولة سلاسل الأدلة الضعيفة
HiEviDR-Bench يمثل البحث كرسوم بيانية من الأدلة إلى الادعاءات الوسيطة ثم إلى الاستنتاج. تغطي أسئلته الـ 2,000 التي تم التحقق منها من قبل البشر النص والأدلة متعددة الوسائط. عبر 16 نموذجًا متعدد الوسائط تم اختباره، وجد المؤلفون فجوة بين جودة التقرير ودقة الاستشهاد، وبناء الادعاء، وصحة الإجابة.
يستخدم المعيار مجموعة اختبار وقضاة نماذج جنبًا إلى جنب مع المراجعة البشرية. لا يقيس كل أداة بحث أو تدفق عمل مباشر. يظهر فقط أن النثر المصقول هو دليل ضعيف. تتبع كل ادعاء إلى مصدره.
تدفق العمل المكون من خمس خطوات للتحقق من استشهادات الذكاء الاصطناعي
استخدم دفتر أدلة صغير. يعمل جدول بيانات، أو ملاحظة، أو قالب قضية. قم بتخزين صف واحد لكل ادعاء مادي مع هذه الحقول:
text claim | citation as given | stable identifier | source passage | status | risk | notes
يحافظ دفتر السجلات على كل تحقق مرتبط بادعائه. كما أنه يترك أثر تدقيق عندما يتغير النص.
1. تجميد الادعاء والاستشهاد الدقيقين
انسخ الجملة التي تعتمد على الأدلة. حافظ على المؤهلات، والتواريخ، والأرقام، ومجموعات المقارنة، واللغة السببية. ثم انسخ الاستشهاد تمامًا كما قدمه الذكاء الاصطناعي.
تجنب التحقق من فقرة كاملة كوحدة واحدة. قسمها عندما تحتوي الجملة على مقترحات واقعية منفصلة. على سبيل المثال:
تحتوي هذه الجملة على ادعائين على الأقل: انخفاض مقاس وادعاء حول جميع الصناعات. قد يدعم مصدر واحد الأول ولا يقدم أي دليل للثاني.
حدد البيانات التي لا تحتاج إلى أدلة خارجية، مثل الرأي أو التوصية المعلنة بوضوح. اقضِ وقت التحقق على الادعاءات الواقعية التي تغير قرارًا.
2. تأكيد هوية المصدر
ابحث عن معرف ثابت أولاً: DOI، أو معرف PubMed، أو معرف arXiv، أو رقم المعايير، أو رقم القضية، أو عنوان URL للوثائق الرسمية. تطابق العنوان، والمؤلفين أو الوكالة، والتاريخ، والمجلة، والنسخة.
تصف وثائق واجهة برمجة تطبيقات Crossref السجلات المودعة من قبل الأعضاء الناشرين والمكملة من قبل مصادر موثوقة. يمكن أن تؤكد واجهة برمجة التطبيقات الخاصة بها بيانات التعريف الببليوغرافية وتكشف عن التصحيحات أو التحديثات بعد النشر عند وجودها. يوفر OpenAlex كتالوجًا مفتوحًا للأعمال الأكاديمية وروابطها بالمؤلفين، والمصادر، والمؤسسات، والمواضيع.
تساعد هذه الأدوات في الإجابة على، "هل هذا هو العمل المذكور؟" لكنها لا تجيب على، "هل يدعم هذا العمل الجملة؟" يمكن أن تكون سجلاتها غير مكتملة أو قديمة. إذا اختلفت السجلات، ففضل الناشر، أو المؤتمر، أو المحكمة، أو الجهة التنظيمية، أو النسخة الحالية للمؤلفين ودوّن النزاع.
توقف ورفض الاستشهاد عندما لا يمكنك العثور على العمل بعد التحقق من عدة حقول ثابتة. لا تستبدله بأقرب ورقة محتملة وادعِ أن الأصل كان صحيحًا.
3. افتح المصدر الأساسي
اتبع المعرف إلى الورقة، أو المعيار، أو مجموعة البيانات، أو ملاحظات الإصدار، أو القانون، أو الوثائق الرسمية. استخدم مقالًا ثانويًا فقط لتحديد أو وضع سياق للمصدر الأساسي.
تحقق من النسخة والتاريخ قبل قراءة النتيجة. يمكن أن تتغير النسخة الأولية بعد مراجعة الأقران. يمكن أن تصف وثائق المنتج الإصدار الحالي بينما تناقش إجابة الذكاء الاصطناعي إصدارًا أقدم. يمكن أن تعكس سحب، أو تصحيح، أو معيار محدث التفسير الآمن.
يمكن أن تمنع الجدران المدفوعة التحقق الكامل. ضع علامة على الادعاء غير موثق عندما يمكنك الوصول فقط إلى ملخص ويعتمد الادعاء على طرق، أو نتائج مجموعات فرعية، أو قيود خارجها. الملخص هو دليل لما اختاره المؤلفون لتلخيصه، وليس بديلاً عن الدراسة الكاملة.
4. مطابقة الادعاء بمقطع ونطاقه
ابحث عن الجدول، أو الشكل، أو الفقرة، أو القسم الدقيق الذي يجب أن يدعم الادعاء. سجل ما يكفي من السياق للعثور عليه مرة أخرى: الصفحة، أو القسم، أو الجدول، أو الشكل، أو عنوان الفقرة.
صنف العلاقة:
اقرأ حول الجملة المطابقة. تحقق من السكان، وحجم العينة، والأساس، والمقارنة، وعدم اليقين، وتعريف النتيجة، والفترة الزمنية. افصل الارتباط عن السببية. أكد ما إذا كان الرقم مطلقًا أو نسبيًا وما إذا كان قد جاء من نتيجة أولية مسجلة مسبقًا، أو مجموعة فرعية استكشافية، أو محاكاة نموذج، أو معيار بائع.
بالنسبة للادعاءات الفنية، سجل نسخة النموذج، والمطالبة، وتقسيم البيانات، والأجهزة، والنسبة المئوية للتكميم، والتأخير، والتكلفة. استخدم نفس الفحوصات عندما تقوم بتقييم نماذج الذكاء الاصطناعي للعمل الحقيقي→.
5. اتخذ القرار وفقًا للمخاطر
يجب أن يرتفع جهد التحقق مع تكلفة الخطأ. قد يحتاج حقيقة خلفية منخفضة المخاطر إلى مصدر موثوق واحد. يحتاج الادعاء الطبي، أو القانوني، أو المالي، أو الأمني، أو المتعلق بالسلامة إلى مراجعة خبراء، والتحقق من الاختصاص أو النسخة الحالية، وتأكيد مستقل.
استخدم أربع إجراءات:
| النتيجة | الإجراء |
|---|---|
| --- | --- |
| المصدر موجود ويدعم مباشرة الادعاء المحدد | اقبل واستشهد بالمصدر الأساسي |
| المصدر يدعم بيانًا أضيق | أعد الكتابة مع الشرط المفقود وضع علامة على أنه مؤهل |
| المصدر مفقود، أو غير متطابق، أو متناقض | أزل أو ارفض الادعاء |
| تبقى الأدلة غير واضحة والقرار عالي المخاطر | اطلب من خبير في الموضوع |
لا تقم بمتوسط ادعاء مدعوم منخفض المخاطر مع ادعاء عالي المخاطر غير مدعوم. فكرة وزن المخاطر في VetScore مفيدة هنا حتى عند التحقق يدويًا: أعطِ الأولوية للجرعة، والواجب القانوني، والتحكم الأمني، والتعرض المالي، وغيرها من الادعاءات التي يمكن أن تسبب ضررًا ماديًا.

*التقاط الادعاء، تأكيد هوية المصدر، فتح المصدر الأساسي، مطابقة المقطع، وتوجيه النتيجة حسب المخاطر.*
مثال عملي قابل للتكرار
خذ هذا الادعاء من قسم البحث السابق:
قم بإجراء الفحوصات الخمس:
2605.07723 اسم الورقة، والمؤلفين، وتاريخ تقديمها في 8 مايو 2026، والنسخة.تحمل الصياغة النهائية حدود الأدلة بدلاً من نسخ الرقم الأكثر دراماتيكية.
ماذا يمكن وما لا يمكن لمدققي الاستشهادات الآليين القيام به
تعتبر الأتمتة قوية في فحوصات الهوية المتكررة. يمكنها تطبيع العناوين، ومطابقة المؤلفين والسنوات، وحل المعرفات، وإعلام الأعمال المفقودة، واكتشاف المراجع المكررة، وإنتاج قائمة للمراجعة.
يوثق مستودع RefChecker مفتوح المصدر الفحوصات ضد Semantic Scholar وOpenAlex وCrossref وDBLP وACL Anthology. يجمع بين المرشحات المحددة مسبقًا مع استخراج قائم على LLM وفحوصات أعمق اختيارية. كان المشروع نشطًا عند التحقق في 5 أغسطس 2026، مع إصدارات والتزامات في اليوم السابق. تظهر تلك النشاطات استمرار العمل الهندسي، وليس دليلاً مستقلاً على الدقة.
احتفظ بشخص في خطوة الدعم. لا يمكن لمطابقة العناوين أن تقرر ما إذا كانت نتيجة دراسة تنطبق على مجموعة سكانية أخرى. يمكن أن يكرر قاضي LLM نفس التجاوز الموجود في الإجابة. يمكن أن تفقد استخراج النص الكامل الجداول، أو الحواشي، أو النفي. يجب أن يعود المدقق بالأدلة وعدم اليقين، وليس شارة خضراء تنهي المراجعة.
يمكن للفرق التي تبني أنظمة مرتبطة بالمصادر إعادة استخدام المراحل في تدفق تقييم RAG→. اختبر الاسترجاع، وتناسب الاستشهاد، ودعم الادعاء، وجودة الإجابة بمفردها. قم بمعايرة أي درجة ضد أمثلة مصنفة من المجال الحقيقي. يوضح الدليل إلى معايرة ثقة LLM→ لماذا لا تعتبر درجة النموذج الخام احتمالًا.
قائمة مرجعية للتحقق من استشهادات الذكاء الاصطناعي قابلة لإعادة الاستخدام
قبل الاقتباس، أو النشر، أو التصرف بناءً على مصدر تم إنشاؤه بواسطة الذكاء الاصطناعي، تحقق من كل عنصر:
لا يمكن أن يضمن تدفق العمل الحقيقة. إنه ينشئ سببًا يمكن تتبعه للثقة، أو التضييق، أو التخلص من كل ادعاء. هذا معيار أقوى من الثقة في إجابة طليقة لأنها وصلت مع روابط.
فحوصات الادعاء
| الادعاء | الحالة | حدود الأدلة |
|---|---|---|
| --- | --- | --- |
| يمكن أن تصنع أنظمة الذكاء الاصطناعي دراسات، واستشهادات، ومراجع مختلقة. | تم التحقق | توثق OpenAI القيد؛ تقيس دراسة الاستشهادات البرية المراجع غير الموجودة في مجموعة أكاديمية محددة. |
| يثبت تطابق DOI أو البيانات الوصفية دعم الادعاء. | مرفوض | يثبت هوية المصدر. يجب التحقق من المقطع ذي الصلة والنطاق. |
| وجدت دراسة الاستشهادات البرية بالضبط 146,932 مرجعًا مزيفًا عبر جميع الأبحاث في 2025. | مرفوض | تبلغ الورقة عن تقدير محافظ لمستودعاتها المدروسة وطريقة الكشف. |
| تجعل الاستشهادات دائمًا القرارات المدعومة بالذكاء الاصطناعي أكثر أمانًا. | مرفوض | حسنت CORA دقة الأطباء المتوسطة ولكنها أيضًا قيست انخفاض المقاومة للنصائح غير الصحيحة المدعومة ظاهريًا. |
| تثبت CORA نفس التأثير في كل مجال. | مرفوض | شملت الدراسة 46 طبيبًا في إعداد سريري منظم. |
| يشكل تحليل الادعاءات والتحقق من المقتطفات نمطًا تم اختباره. | مؤهل | تحقق VetScore من النمط في QA البيطرية طويلة الشكل؛ تحتاج التحقق من الحقائق الخارجية والمجالات الأخرى إلى تحقق منفصل. |
| تثبت جودة التقرير المهنية تجميع الأدلة المستندة. | مرفوض | وجدت HiEviDR-Bench فجوة بين جودة التقرير ونتائج الاستشهاد، والادعاء، والإجابة في أنظمتها المختبرة. |
| يمكن أن تحل مطابقة المراجع الآلية محل مراجعة المقطع. | مرفوض | يمكن أن تقلل من عمل التحقق من الهوية ولكن لا يمكن أن تؤسس نطاق وتفسير كل ادعاء. |
