إلغاء تعلّم الآلة: سير عمل عملي لإزالة بيانات AI
تقنية
AI
AI Engineering
Privacy
Machine Learning

إلغاء تعلّم الآلة: سير عمل عملي لإزالة بيانات AI

سير عمل مدعوم بالمصادر لحذف بيانات AI عبر الاسترجاع، وتعديلات النموذج، والنسخ المكررة، وأدلة التدقيق.

Uygar DuzgunUUygar Duzgun
Jul 29, 2026
تم التحديث 14 أغسطس 2026
13 min read

إذا طلب منك شخص حذف بياناته من نظام AI، فإن إزالة صف واحد من قاعدة بيانات ليست المهمة بأكملها. يمكن لإلغاء تعلّم الآلة تقليل استجابة النموذج لأمثلة تدريب محددة أو إعادة توجيهها، لكنه لا ينظف تلقائيًا بقية المكدس: فهارس المتجهات، والمحوّلات المضبوطة بدقة، والمطالبات المخزنة مؤقتًا، ونقاط التحقق، والنسخ المكررة، والنسخ الاحتياطية، وعمليات التصدير. يعرّف NIST إلغاء تعلّم الآلة بأنه إزالة تأثير نقاط تدريب محددة من نموذج مدرّب بشكل انتقائي، ويشير صراحةً إلى أن التقنيات التقريبية الفعالة قد تتجنب إعادة التدريب الكامل من الصفر. وهذا أضيق من القول إن «النظام بأكمله نسي البيانات». NIST

بالنسبة إلى معظم الفرق، تكون الإجابة العملية متعددة الطبقات. ابدأ أولًا بتتبّع المكان الذي ذهبت إليه البيانات. ثم أوقف إعادة استخدامها. بعد ذلك احذف المخرجات المشتقة أو قيّد الوصول إليها. وفقط بعد ذلك قرر ما إذا كانت أوزان النموذج تحتاج إلى إعادة تدريب أو إلى إلغاء تعلّم تقريبي. استخدمت مسابقة Google لعام 2023 حول إلغاء تعلّم الآلة هذا الإطار المتمحور حول النموذج تحديدًا: ينبغي أن يصبح من الصعب تمييز النموذج الذي أُلغي تعلّمه عن نموذج أُعيد تدريبه من دون مجموعة النسيان، مع الحفاظ في الوقت نفسه على الأداء في مجموعة الاحتفاظ. Google Research

Prompt — Copy & Paste
الجمهور: متوسط كل نتيجة رقمية أدناه مأخوذة من الأوراق البحثية أو الوثائق الرسمية المستشهد بها. لم تُضف هنا أي ادعاءات حول معايير قياس غير منشورة.

جدول المحتويات

ما الذي يعنيه إلغاء تعلّم الآلة فعليًا

إلغاء تعلّم الآلة هو عملية على مستوى النموذج. ويتعلق بتقليل تأثير بيانات محددة على سلوك نموذج مدرّب. وقد يعني ذلك إعادة تدريب دقيقة على مجموعة الاحتفاظ، أو استخدام طريقة تقريبية تهدف إلى الاقتراب من النتيجة بما يكفي من دون تحمل تكلفة إعادة التدريب الكاملة. يستخدم NIST الفكرتين في مدخل المسرد الخاص به، وتعرض صفحة مسابقة Google المعيار الذهبي باعتباره التشابه مع نموذج أُعيد تدريبه من الصفر من دون الأمثلة المنسية. NIST Google Research

هذا التعريف مهم لأن أنظمة AI نادرًا ما تنتهي عند أوزان النموذج. فعادةً ما يتضمن مكدس الإنتاج ما يلي:

قواعد البيانات المصدرية وتخزين الكائنات
التضمينات وفهارس المتجهات
سجلات المطالبات، وآثار التنفيذ، وذاكرات التخزين المؤقت، والتحليلات
المحوّلات المضبوطة بدقة أو نقاط التحقق
نسخ النموذج المكررة، ومجموعات التقييم، وعمليات التصدير، والنسخ الاحتياطية

قد يؤدي حذف طبقة واحدة فقط من هذه الطبقات إلى بقاء البيانات قابلة للوصول في مكان آخر. عمليًا، تُعد عبارة «إزالة هذه البيانات من AI» مشكلة نسب بيانات قبل أن تصبح مشكلة تحرير نموذج.

لماذا لا يكفي تدفق الحذف العادي

لا تدرب العديد من منتجات AI على البيانات التي يُطلب منها حذفها أصلًا. بل تسترجعها فقط وقت الاستدلال. في هذه الحالة، تتمثل المهمة في إزالة السجلات المصدرية، والتضمينات المشتقة، وذاكرات التخزين المؤقت، ومسارات الوصول. ويصبح إلغاء تعلّم الآلة غير ذي صلة لأن أوزان النموذج لم تتغير أصلًا.

تبدأ الحالات الأصعب عندما تؤثر البيانات في الأوزان أو المحوّلات أو الذكريات الدائمة. عندها تحتاج إلى فصل أربع حالات بدلًا من التعامل مع كل طلب حذف بالطريقة نفسها.

الحالةأعمال الإزالة الفوريةهل إلغاء تعلّم النموذج مطلوب؟ما الأدلة التي ينبغي الاحتفاظ بها
------------
عاشت البيانات فقط في الأنظمة المصدرية والسجلاتاحذف السجل المصدر، وعمليات التصدير، والسجلات، وذاكرات التخزين المؤقت أو قيّد الوصول إليهالامعرّفات السجلات، والطابع الزمني للحذف، ومسار الاحتفاظ
دخلت البيانات أيضًا إلى RAG أو البحثأزل الملفات المصدرية، والمقاطع، والتضمينات، وصفوف المتجهات، ومفاتيح التخزين المؤقت، ومهام إعادة الفهرسةعادةً لا، إلا إذا استُخدمت تلك المستندات لاحقًا في التدريباكتمال إعادة الفهرسة، واختبارات الاسترجاع، وأعداد المقاطع
أثرت البيانات في نموذج مضبوط بدقة أو محوّلأزل المخرجات المصدرية وقرر بين إعادة التدريب، أو استبدال المحوّل، أو إلغاء التعلّم التقريبينعمتعريف مجموعة النسيان، وفحوصات مجموعة الاحتفاظ، وإيقاف النموذج القديم
قد تكون البيانات موجودة داخل نموذج أساس تابع لجهة خارجيةأزل نسخك وافتح مسارًا على مستوى المزوّدربما، لكن المزوّد وحده يستطيع تنفيذ ذلكالتذكرة، وبيان المورّد، والمسار التعاقدي/السياساتي

لهذا السبب، فإن نموذج «زر الحذف» هو التصور الذهني الخاطئ. النموذج الصحيح هو إزالة محددة النطاق مع أدلة.

سير عمل عملي من سبع خطوات

1. حدّد نطاق الطلب وأوقف إعادة الاستخدام

ابدأ بالمعرّفات الدقيقة: معرّف المستخدم، أو تجزئة الملف، أو معرّفات المستندات، أو أسماء مجموعات المتجهات، أو معرّفات دفعات التدريب، أو مراجع التذاكر. ثم أوقف إعادة الاستخدام الجديدة. أوقف مؤقتًا عمليات الإدخال، أو إعادة التدريب، أو التصدير، أو المزامنة التي قد تعيد إنشاء البيانات نفسها أثناء تنظيفها.

إذا كان الطلب مدفوعًا باعتبارات الخصوصية، فأبقِ الإطار القانوني ضيقًا. تنشئ المادة 17 من GDPR حقًا في المحو ضمن ظروف محددة، لكنها لا تخبرك بأي طبقة تقنية ينبغي التعامل معها أولًا. كما ينص رأي مجلس حماية البيانات الأوروبي الصادر في 18 ديسمبر 2024 بشأن نماذج AI على أن النماذج المدرّبة باستخدام بيانات شخصية لا يمكن اعتبارها مجهّلة الهوية في جميع الحالات. احتفظ بسير عمل حذف صريح بدلًا من افتراض أن النموذج خارج النطاق. EUR-Lex EDPB

2. تتبّع نسب البيانات قبل حذف أي شيء

ارسم المسار الكامل:

النظام المصدر
مهمة المعالجة المسبقة أو تقسيم المقاطع
فهرس المتجهات أو مخزن الاسترجاع
مجموعة بيانات الضبط الدقيق أو التدريب المستمر
المحوّل، أو نقطة التحقق، أو النموذج المدمج
النسخ المكررة المقدّمة، وذاكرات التخزين المؤقت، والنسخ الاحتياطية
قراءة مقترحة

هنا تصبح قائمة مواد AI مفيدة. إذا كنت لا تعرف أي نموذج أو محوّل أو فهرس استهلك السجل، فلن تتمكن من إثبات إزالته لاحقًا.

3. احذف المخرجات المصدرية والمشتقة أو قيّد الوصول إليها

امسح الآن ما يمكنك مسحه بشكل حتمي:

السجل المصدر وعمليات التصدير المباشرة
مقاطع المستندات والتضمينات
إدخالات فهرس المتجهات
ذاكرة المطالبة/الجلسة المرتبطة بالسجل
المخرجات المولّدة أو مقتطفات البحث المخزنة مؤقتًا
تجهيزات التقييم التي نسخت المحتوى الحساس
قراءة مقترحة

بالنسبة إلى الأنظمة التي تعتمد بكثافة على الاسترجاع، غالبًا ما تكون هذه الخطوة أهم من تحرير النموذج. يظهر المنطق نفسه في تقييم RAG: إذا كان الاسترجاع هو المسار الذي يعيد إدخال المحتوى غير المرغوب فيه، فأصلح الاسترجاع قبل إلقاء اللوم على النموذج.

أبلغت مشكلة عامة في AnythingLLM عن بقاء تضمينات المستندات المحذوفة قابلة للاسترجاع، حسب الادعاء، في إعداد واحد مدعوم بـ Weaviate. المشكلة الواحدة دليل قصصي وليست نتيجة على مستوى المنصة بأكملها. لكنها لا تزال توضح سبب حاجة كل تدفق حذف إلى اختبار استرجاع سلبي لمعرّفات المستندات، والعبارات المميزة، وإعادة الصياغة.

4. قرر ما إذا كانت أوزان النموذج قد تغيرت أصلًا

هذه هي نقطة التفرع التي تتجاوزها الفرق كثيرًا.

إذا كان النظام يستخدم الاسترجاع وقت المطالبة فقط، فلا حاجة إلى إلغاء تعلّم الأوزان.
إذا دخلت البيانات إلى محوّل مضبوط بدقة أو نموذج مجالي، فاختر بين إعادة التدريب الدقيقة وإلغاء التعلّم التقريبي.
إذا كانت البيانات قد تكون موجودة في نموذج مزوّد لا تتحكم فيه، فإن عملك التقني يتوقف عند حدودك، وتتحول عمليتك إلى التصعيد لدى المزوّد.

تعرّف مسابقة Google لعام 2023 الهدف على جانب النموذج: ينبغي أن يشبه النموذج الذي أُلغي تعلّمه نموذجًا أُعيد تدريبه من دون الأمثلة المنسية، مع الاحتفاظ بالسلوك المفيد المتعلم من بقية البيانات. Google Research

5. أنشئ مجموعات التقييم قبل تغيير الأوزان

تحتاج إلى ثلاث شرائح على الأقل:

مجموعة النسيان: مطالبات أو عينات ينبغي ألا تعيد إنتاج السلوك الحساس
مجموعة الاحتفاظ: مهام مجاورة ينبغي أن تستمر في العمل
مجموعة المنفعة: مهام المنتج العادية التي ينبغي ألا تنهار
قراءة مقترحة

وهذا هو الانضباط نفسه الذي يجعل أذونات وكلاء AI قابلة للتدقيق: حدّد ما يجب أن يتوقف، وما يجب أن يبقى، وما الدليل الذي يُعتد به.

مخطط سير عمل لإزالة بيانات AI بدءًا من تحديد النطاق مرورًا بتتبّع نسب البيانات وتنظيف المخرجات واتخاذ قرار بشأن النموذج والتقييم والأدلة
مخطط سير عمل لإزالة بيانات AI بدءًا من تحديد النطاق مرورًا بتتبّع نسب البيانات وتنظيف المخرجات واتخاذ قرار بشأن النموذج والتقييم والأدلة

*التعليق: يبدأ عمل الحذف بنسب البيانات والمخرجات المشتقة. ولا يبدأ إلغاء تعلّم النموذج إلا بعد إثبات ما إذا كانت الأوزان قد تأثرت.*

6. اختبر النسيان ومنفعة البيانات المحتفظ بها معًا

توضح الأبحاث الحديثة المفاضلة بجلاء.

تجادل ورقة *Behavioral Audit of Machine Unlearning Has a Privacy Cost* بأنه، بالنسبة إلى النماذج المحدبة، لا يستطيع التدقيق السلوكي عبر الصندوق الأسود أن يكتشف في الوقت نفسه إلغاء التعلّم غير الكافي ويتجنب تسريب معلومات عضوية مجموعة الاحتفاظ إلى مدقق صادق لكنه فضولي. ويعرض المؤلفون أيضًا أدلة تجريبية على استمرار هذا التوتر في البيئات غير المحدبة. وهذا يعني أن نتيجة تدقيق واحدة نظيفة لا تساوي برهانًا شاملًا على النسيان الآمن. arXiv

يتناول إطار التدقيق الذي نشره Google Research في 10 يونيو 2026 المشكلة من اتجاه آخر. فهو يقترح اختبارات نواة تباعد f المنتظم لجعل التدقيق أكثر حساسية والتحكم في الإيجابيات الكاذبة بدرجة أكثر موثوقية عبر أحجام العينات. والنتيجة اختبار إحصائي، وليست برهانًا على الحذف الكامل. Google Research

يفصل PrivUn بين ثلاثة مستويات للاستعادة: الاسترجاع المباشر، والاستعادة ضمن السياق، والاستعادة عبر الضبط الدقيق. استخدم المستويات التي تتوافق مع مستوى وصولك إلى النموذج. فقد ينجح الرفض عند المطالبة الأصلية في الفحص الأول، بينما لا يزال مسار استعادة أقوى يكشف الهدف.

7. أوقف المخرجات القديمة واحتفظ بالأدلة

بعد العمل على جانب النموذج، أزل النسخ المكررة القديمة، ونقاط التحقق، والمحوّلات، وذاكرات التخزين المؤقت أو اعزلها. ثم احتفظ بحزمة أدلة تتضمن:

نطاق الطلب
الأنظمة المتأثرة
إجراءات الحذف
إصدار النموذج الذي أُوقف
الإصدار البديل الذي جرى تفعيله
نتائج مجموعة النسيان ومجموعة الاحتفاظ
انتهاء صلاحية النسخ الاحتياطية أو معالجتها ضمن سياسة الاحتفاظ

هذه الأدلة هي ما يحول سير عمل الحذف إلى شيء يمكن للدعم، والأمن، والشؤون القانونية، والهندسة التحقق منه جميعًا.

ما الذي يدعمه أحدث بحث في إلغاء التعلّم فعليًا

ثلاث أوراق بحثية حديثة مفيدة هنا، لكنها تدعم ادعاءات مختلفة.

عمليات التدقيق السلوكية ليست مجانية

تُعد ورقة يونيو 2026 حول التدقيق السلوكي أقوى تحذير من المبالغة في الادعاءات. ونتيجتها الأساسية ليست أن «إلغاء التعلّم مستحيل». بل إن النتيجة أضيق وأكثر فائدة: في ظل مالك غير نزيه ومدقق صادق لكنه فضولي، يمكن للتدقيق السلوكي أن ينشئ مفاضلة بين الخصوصية والتدقيق. إذا كانت قصة الامتثال لديك تعتمد فقط على الاستقصاء عبر الصندوق الأسود، فقد تسرّب معلومات حول البيانات المحتفظ بها أثناء محاولة التحقق من النسيان. arXiv

يمكن أن ينجح التحرير المستهدف في معايير قياس محددة

تقدم *ZeroUnlearn* نتيجة أكثر تفاؤلًا. فهي تعيد صياغة إلغاء تعلّم الآلة باعتباره مشكلة تحرير نموذج، وتبلغ عن نتائج قوية في معايير القياس على Llama-3.2 وLlama-3.1 وQwen-3، وتقول إن تحديثها المغلق الصيغة ذي اللقطات القليلة يبقي خطوة SVD تحت 0.3 ثانية على MCF وZsRE، بينما ينمو التحرير الشامل من نحو 0.04 ساعة عند 10 عينات إلى 3.35–3.82 ساعة عند 1000 عينة، مع ذاكرة إجمالية تقارب 14.9–17.4 GB. تهم هذه الأرقام لأنها توضح أن إلغاء التعلّم التقريبي ليس مكلفًا جدًا للاختبار تلقائيًا. arXiv

لكن القيود أهم من العنوان الرئيسي. تقيّم الورقة نماذج مفتوحة ومجموعات بيانات معيارية محددة مثل MCF وZsRE ونسخة أحادية القفزة معدّلة من MQUAKE. كما تستخدم اختيارًا مستهدفًا للطبقات لتجنب الإضرار بالقدرة العامة. وهذا دليل على إزالة حقائق واعدة على نطاق المعايير، وليس برهانًا على أن نظامًا إنتاجيًا محا كل نسخة من المعلومات الحساسة بالكامل. arXiv

لا يزال الحذف المستمر ضعيفًا في الأنظمة متعددة الوسائط

تُعد *ICU-Bench* النظير المثير للقلق. يضم المعيار 1,000 ملف شخصي حساسًا للخصوصية من تقارير طبية وعقود عمل، و9,500 صورة، و16,000 زوج سؤال وجواب، و100 مهمة نسيان متسلسلة. واستنتاجه بسيط: تواجه أساليب إلغاء التعلّم متعددة الوسائط الحالية صعوبة في البيئات المستمرة، ولا تحافظ في الوقت نفسه على جودة النسيان، ومنفعة البيانات المحتفظ بها، والاستقرار في التسلسلات الطويلة. إذا كان منتجك يتلقى طلبات حذف متكررة بمرور الوقت، فهذه هي الورقة التي ينبغي قراءتها قبل الوعد بأتمتة نظيفة. arXiv

مجتمعةً، تدعم هذه الأوراق موقفًا عمليًا:

إلغاء التعلّم حقيقي بما يكفي للهندسة على أساسه
عمليات التدقيق إحصائية وقد تسرّب المعلومات
يظل الحذف المستمر والمتكرر ومتعدد الوسائط أصعب بكثير من تعديل معياري واحد

ما الذي ينبغي أن تعد به المستخدمين وأصحاب المصلحة

قدّم وعودًا أقل. وتحقق أكثر.

تبدو الصياغة الجيدة هكذا:

«أزلنا بياناتك المصدرية ومخرجات الاسترجاع المشتقة.»
«أوقفنا المحوّل المتأثر واستبدلناه بإصدار مدرّب من دون المجموعة المحذوفة.»
«اختبرنا الإصدار البديل مقابل فحوصات النسيان والاحتفاظ والمنفعة.»

وتبدو الصياغة السيئة هكذا:

«لقد نسيك AI بالكامل.»
«حل حذف البيانات من مخزن المتجهات مشكلة النموذج.»
«تثبت نتيجة تدقيق واحدة أن البيانات اختفت من كل مكان.»

إذا كنت تحتاج إلى قاعدة قصيرة، فاستخدم هذه: إلغاء تعلّم الآلة طبقة واحدة داخل سير عمل أوسع لإزالة بيانات AI.

الأسئلة الشائعة

هل يؤدي حذف صف من قاعدة بيانات المتجهات إلى جعل LLM ينسى؟

لا. يمكن أن يوقف ذلك مسار استرجاع من إعادة إدخال البيانات، وهو غالبًا الإصلاح الأول الصحيح لأنظمة RAG. لكن إذا استُخدم المحتوى نفسه في الضبط الدقيق، أو التدريب المستمر، أو ذاكرة نموذج دائمة، فإن حذف صف المتجه وحده لا يغير الأوزان.

هل يمكن لإلغاء تعلّم الآلة أن يثبت اختفاء بياناتي من كل نسخة من النماذج؟

ليس بمفرده. تُظهر أبحاث التدقيق الحديثة أن عمليات التدقيق عبر الصندوق الأسود لها حدود، وغالبًا ما تتضمن أنظمة الإنتاج ذاكرات تخزين مؤقت، ومحوّلات، ونقاط تحقق، ونسخًا مكررة، ونسخًا احتياطية خارج سطح النموذج الخاضع للتدقيق. تحتاج إلى أدلة على مستوى النظام، لا إلى نتيجة على مستوى النموذج فقط. arXiv Google Research

التحقق من الادعاءات

الادعاءالتحققالمصدر
---------
يعني إلغاء تعلّم الآلة إزالة تأثير نقاط تدريب محددة، وقد تتجنب الأساليب التقريبية إعادة التدريب الكامل.يتطابق مع صياغة مسرد NIST ونطاقه.مسرد NIST لإلغاء تعلّم الآلة
تتعامل مسابقة Google مع إعادة التدريب من دون مجموعة النسيان باعتبارها نقطة المرجع على جانب النموذج.موصوف في الإعلان الرسمي عن المسابقة.إعلان مسابقة Google Research
يمكن للتدقيق السلوكي عبر الصندوق الأسود أن ينشئ مفاضلة بين الخصوصية والتدقيق.تدعم ذلك الورقة النظرية والتجريبية الصادرة في يونيو 2026.Behavioral Audit of Machine Unlearning Has a Privacy Cost
يثبت رفض إجابة واحدة النسيان الدائم.مرفوض؛ إذ يفصل PrivUn بين فحوصات المخرجات المباشرة والاستعادة ضمن السياق والاستعادة عبر الضبط الدقيق.PrivUn
تبلغ ZeroUnlearn عن نتائج قوية في معايير القياس مع نطاقات عملية لزمن التنفيذ والذاكرة، لكن على نماذج ومجموعات بيانات مفتوحة محددة.تدعم ذلك أقسام التجارب والتعقيد في الورقة.ZeroUnlearn
يظل الحذف المستمر متعدد الوسائط صعبًا بالنسبة إلى الأساليب الحالية.تدعم ذلك مقاييس مجموعة بيانات ICU-Bench ونتائجها الرئيسية.ICU-Bench
لا يمكن دائمًا اعتبار نماذج AI المدرّبة باستخدام بيانات شخصية مجهّلة الهوية.ورد ذلك في ملخص رأي EDPB ونص الرأي.رأي EDPB رقم 28/2024
تثبت مشكلة واحدة على GitHub وجود خلل في الحذف على مستوى المنصة بأكملها.مرفوض؛ فهي تقرير تكاملي قصصي يُستخدم فقط للتحفيز على اختبار استرجاع سلبي.مشكلة AnythingLLM رقم 3958

المصادر

مسرد NIST: إلغاء تعلّم الآلة — التعريف الأساسي ونطاق إلغاء التعلّم التقريبي.
Google Research: الإعلان عن أول مسابقة لإلغاء تعلّم الآلة — الإطار الرسمي لسلوك النسيان والاحتفاظ.
Google Research: إطار جديد لتدقيق إلغاء تعلّم الآلة — آخر تحديث رسمي لإطار التدقيق من 10 يونيو 2026.
Behavioral Audit of Machine Unlearning Has a Privacy Cost — نتيجة نظرية وتجريبية حول المفاضلة بين الخصوصية والتدقيق.
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models — أسلوب تحرير مستهدف مع نتائج مُبلغ عنها لزمن التنفيذ والذاكرة ومعايير القياس.
ICU-Bench: Benchmarking Continual Unlearning in Multimodal Large Language Models — معيار قياس الحذف المستمر متعدد الوسائط وقيوده.
PrivUn: A Privacy-Focused Evaluation Framework for Machine Unlearning in Large Language Models — تقييم موجّه نحو الاستعادة مع مستويات هجوم مباشرة وضمن السياق وعبر الضبط الدقيق.
مستودع OpenUnlearning — سطح مفتوح حالي للمعايير والتنفيذات الخاصة بتجارب إلغاء تعلّم LLM.
المادة 17 من GDPR على EUR-Lex — نص الحق القانوني في المحو.
رأي EDPB رقم 28/2024 بشأن نماذج AI والبيانات الشخصية — سياق إخفاء الهوية والمعالجة القانونية لنماذج AI على أساس كل حالة.
مشكلة AnythingLLM رقم 3958 — تقرير ممارس قصصي يُستخدم فقط كمثال على اختبار تكاملي.