إذا طلب منك شخص حذف بياناته من نظام AI، فإن إزالة صف واحد من قاعدة بيانات ليست المهمة بأكملها. يمكن لإلغاء تعلّم الآلة تقليل استجابة النموذج لأمثلة تدريب محددة أو إعادة توجيهها، لكنه لا ينظف تلقائيًا بقية المكدس: فهارس المتجهات، والمحوّلات المضبوطة بدقة، والمطالبات المخزنة مؤقتًا، ونقاط التحقق، والنسخ المكررة، والنسخ الاحتياطية، وعمليات التصدير. يعرّف NIST إلغاء تعلّم الآلة بأنه إزالة تأثير نقاط تدريب محددة من نموذج مدرّب بشكل انتقائي، ويشير صراحةً إلى أن التقنيات التقريبية الفعالة قد تتجنب إعادة التدريب الكامل من الصفر. وهذا أضيق من القول إن «النظام بأكمله نسي البيانات». NIST
بالنسبة إلى معظم الفرق، تكون الإجابة العملية متعددة الطبقات. ابدأ أولًا بتتبّع المكان الذي ذهبت إليه البيانات. ثم أوقف إعادة استخدامها. بعد ذلك احذف المخرجات المشتقة أو قيّد الوصول إليها. وفقط بعد ذلك قرر ما إذا كانت أوزان النموذج تحتاج إلى إعادة تدريب أو إلى إلغاء تعلّم تقريبي. استخدمت مسابقة Google لعام 2023 حول إلغاء تعلّم الآلة هذا الإطار المتمحور حول النموذج تحديدًا: ينبغي أن يصبح من الصعب تمييز النموذج الذي أُلغي تعلّمه عن نموذج أُعيد تدريبه من دون مجموعة النسيان، مع الحفاظ في الوقت نفسه على الأداء في مجموعة الاحتفاظ. Google Research
جدول المحتويات
ما الذي يعنيه إلغاء تعلّم الآلة فعليًا
إلغاء تعلّم الآلة هو عملية على مستوى النموذج. ويتعلق بتقليل تأثير بيانات محددة على سلوك نموذج مدرّب. وقد يعني ذلك إعادة تدريب دقيقة على مجموعة الاحتفاظ، أو استخدام طريقة تقريبية تهدف إلى الاقتراب من النتيجة بما يكفي من دون تحمل تكلفة إعادة التدريب الكاملة. يستخدم NIST الفكرتين في مدخل المسرد الخاص به، وتعرض صفحة مسابقة Google المعيار الذهبي باعتباره التشابه مع نموذج أُعيد تدريبه من الصفر من دون الأمثلة المنسية. NIST Google Research
هذا التعريف مهم لأن أنظمة AI نادرًا ما تنتهي عند أوزان النموذج. فعادةً ما يتضمن مكدس الإنتاج ما يلي:
قد يؤدي حذف طبقة واحدة فقط من هذه الطبقات إلى بقاء البيانات قابلة للوصول في مكان آخر. عمليًا، تُعد عبارة «إزالة هذه البيانات من AI» مشكلة نسب بيانات قبل أن تصبح مشكلة تحرير نموذج.
لماذا لا يكفي تدفق الحذف العادي
لا تدرب العديد من منتجات AI على البيانات التي يُطلب منها حذفها أصلًا. بل تسترجعها فقط وقت الاستدلال. في هذه الحالة، تتمثل المهمة في إزالة السجلات المصدرية، والتضمينات المشتقة، وذاكرات التخزين المؤقت، ومسارات الوصول. ويصبح إلغاء تعلّم الآلة غير ذي صلة لأن أوزان النموذج لم تتغير أصلًا.
تبدأ الحالات الأصعب عندما تؤثر البيانات في الأوزان أو المحوّلات أو الذكريات الدائمة. عندها تحتاج إلى فصل أربع حالات بدلًا من التعامل مع كل طلب حذف بالطريقة نفسها.
| الحالة | أعمال الإزالة الفورية | هل إلغاء تعلّم النموذج مطلوب؟ | ما الأدلة التي ينبغي الاحتفاظ بها |
|---|---|---|---|
| --- | --- | --- | --- |
| عاشت البيانات فقط في الأنظمة المصدرية والسجلات | احذف السجل المصدر، وعمليات التصدير، والسجلات، وذاكرات التخزين المؤقت أو قيّد الوصول إليها | لا | معرّفات السجلات، والطابع الزمني للحذف، ومسار الاحتفاظ |
| دخلت البيانات أيضًا إلى RAG أو البحث | أزل الملفات المصدرية، والمقاطع، والتضمينات، وصفوف المتجهات، ومفاتيح التخزين المؤقت، ومهام إعادة الفهرسة | عادةً لا، إلا إذا استُخدمت تلك المستندات لاحقًا في التدريب | اكتمال إعادة الفهرسة، واختبارات الاسترجاع، وأعداد المقاطع |
| أثرت البيانات في نموذج مضبوط بدقة أو محوّل | أزل المخرجات المصدرية وقرر بين إعادة التدريب، أو استبدال المحوّل، أو إلغاء التعلّم التقريبي | نعم | تعريف مجموعة النسيان، وفحوصات مجموعة الاحتفاظ، وإيقاف النموذج القديم |
| قد تكون البيانات موجودة داخل نموذج أساس تابع لجهة خارجية | أزل نسخك وافتح مسارًا على مستوى المزوّد | ربما، لكن المزوّد وحده يستطيع تنفيذ ذلك | التذكرة، وبيان المورّد، والمسار التعاقدي/السياساتي |
لهذا السبب، فإن نموذج «زر الحذف» هو التصور الذهني الخاطئ. النموذج الصحيح هو إزالة محددة النطاق مع أدلة.
سير عمل عملي من سبع خطوات
1. حدّد نطاق الطلب وأوقف إعادة الاستخدام
ابدأ بالمعرّفات الدقيقة: معرّف المستخدم، أو تجزئة الملف، أو معرّفات المستندات، أو أسماء مجموعات المتجهات، أو معرّفات دفعات التدريب، أو مراجع التذاكر. ثم أوقف إعادة الاستخدام الجديدة. أوقف مؤقتًا عمليات الإدخال، أو إعادة التدريب، أو التصدير، أو المزامنة التي قد تعيد إنشاء البيانات نفسها أثناء تنظيفها.
إذا كان الطلب مدفوعًا باعتبارات الخصوصية، فأبقِ الإطار القانوني ضيقًا. تنشئ المادة 17 من GDPR حقًا في المحو ضمن ظروف محددة، لكنها لا تخبرك بأي طبقة تقنية ينبغي التعامل معها أولًا. كما ينص رأي مجلس حماية البيانات الأوروبي الصادر في 18 ديسمبر 2024 بشأن نماذج AI على أن النماذج المدرّبة باستخدام بيانات شخصية لا يمكن اعتبارها مجهّلة الهوية في جميع الحالات. احتفظ بسير عمل حذف صريح بدلًا من افتراض أن النموذج خارج النطاق. EUR-Lex EDPB
2. تتبّع نسب البيانات قبل حذف أي شيء
ارسم المسار الكامل:
هنا تصبح قائمة مواد AI→ مفيدة. إذا كنت لا تعرف أي نموذج أو محوّل أو فهرس استهلك السجل، فلن تتمكن من إثبات إزالته لاحقًا.
3. احذف المخرجات المصدرية والمشتقة أو قيّد الوصول إليها
امسح الآن ما يمكنك مسحه بشكل حتمي:
بالنسبة إلى الأنظمة التي تعتمد بكثافة على الاسترجاع، غالبًا ما تكون هذه الخطوة أهم من تحرير النموذج. يظهر المنطق نفسه في تقييم RAG→: إذا كان الاسترجاع هو المسار الذي يعيد إدخال المحتوى غير المرغوب فيه، فأصلح الاسترجاع قبل إلقاء اللوم على النموذج.
أبلغت مشكلة عامة في AnythingLLM عن بقاء تضمينات المستندات المحذوفة قابلة للاسترجاع، حسب الادعاء، في إعداد واحد مدعوم بـ Weaviate. المشكلة الواحدة دليل قصصي وليست نتيجة على مستوى المنصة بأكملها. لكنها لا تزال توضح سبب حاجة كل تدفق حذف إلى اختبار استرجاع سلبي لمعرّفات المستندات، والعبارات المميزة، وإعادة الصياغة.
4. قرر ما إذا كانت أوزان النموذج قد تغيرت أصلًا
هذه هي نقطة التفرع التي تتجاوزها الفرق كثيرًا.
تعرّف مسابقة Google لعام 2023 الهدف على جانب النموذج: ينبغي أن يشبه النموذج الذي أُلغي تعلّمه نموذجًا أُعيد تدريبه من دون الأمثلة المنسية، مع الاحتفاظ بالسلوك المفيد المتعلم من بقية البيانات. Google Research
5. أنشئ مجموعات التقييم قبل تغيير الأوزان
تحتاج إلى ثلاث شرائح على الأقل:
وهذا هو الانضباط نفسه الذي يجعل أذونات وكلاء AI→ قابلة للتدقيق: حدّد ما يجب أن يتوقف، وما يجب أن يبقى، وما الدليل الذي يُعتد به.

*التعليق: يبدأ عمل الحذف بنسب البيانات والمخرجات المشتقة. ولا يبدأ إلغاء تعلّم النموذج إلا بعد إثبات ما إذا كانت الأوزان قد تأثرت.*
6. اختبر النسيان ومنفعة البيانات المحتفظ بها معًا
توضح الأبحاث الحديثة المفاضلة بجلاء.
تجادل ورقة *Behavioral Audit of Machine Unlearning Has a Privacy Cost* بأنه، بالنسبة إلى النماذج المحدبة، لا يستطيع التدقيق السلوكي عبر الصندوق الأسود أن يكتشف في الوقت نفسه إلغاء التعلّم غير الكافي ويتجنب تسريب معلومات عضوية مجموعة الاحتفاظ إلى مدقق صادق لكنه فضولي. ويعرض المؤلفون أيضًا أدلة تجريبية على استمرار هذا التوتر في البيئات غير المحدبة. وهذا يعني أن نتيجة تدقيق واحدة نظيفة لا تساوي برهانًا شاملًا على النسيان الآمن. arXiv
يتناول إطار التدقيق الذي نشره Google Research في 10 يونيو 2026 المشكلة من اتجاه آخر. فهو يقترح اختبارات نواة تباعد f المنتظم لجعل التدقيق أكثر حساسية والتحكم في الإيجابيات الكاذبة بدرجة أكثر موثوقية عبر أحجام العينات. والنتيجة اختبار إحصائي، وليست برهانًا على الحذف الكامل. Google Research
يفصل PrivUn بين ثلاثة مستويات للاستعادة: الاسترجاع المباشر، والاستعادة ضمن السياق، والاستعادة عبر الضبط الدقيق. استخدم المستويات التي تتوافق مع مستوى وصولك إلى النموذج. فقد ينجح الرفض عند المطالبة الأصلية في الفحص الأول، بينما لا يزال مسار استعادة أقوى يكشف الهدف.
7. أوقف المخرجات القديمة واحتفظ بالأدلة
بعد العمل على جانب النموذج، أزل النسخ المكررة القديمة، ونقاط التحقق، والمحوّلات، وذاكرات التخزين المؤقت أو اعزلها. ثم احتفظ بحزمة أدلة تتضمن:
هذه الأدلة هي ما يحول سير عمل الحذف إلى شيء يمكن للدعم، والأمن، والشؤون القانونية، والهندسة التحقق منه جميعًا.
ما الذي يدعمه أحدث بحث في إلغاء التعلّم فعليًا
ثلاث أوراق بحثية حديثة مفيدة هنا، لكنها تدعم ادعاءات مختلفة.
عمليات التدقيق السلوكية ليست مجانية
تُعد ورقة يونيو 2026 حول التدقيق السلوكي أقوى تحذير من المبالغة في الادعاءات. ونتيجتها الأساسية ليست أن «إلغاء التعلّم مستحيل». بل إن النتيجة أضيق وأكثر فائدة: في ظل مالك غير نزيه ومدقق صادق لكنه فضولي، يمكن للتدقيق السلوكي أن ينشئ مفاضلة بين الخصوصية والتدقيق. إذا كانت قصة الامتثال لديك تعتمد فقط على الاستقصاء عبر الصندوق الأسود، فقد تسرّب معلومات حول البيانات المحتفظ بها أثناء محاولة التحقق من النسيان. arXiv
يمكن أن ينجح التحرير المستهدف في معايير قياس محددة
تقدم *ZeroUnlearn* نتيجة أكثر تفاؤلًا. فهي تعيد صياغة إلغاء تعلّم الآلة باعتباره مشكلة تحرير نموذج، وتبلغ عن نتائج قوية في معايير القياس على Llama-3.2 وLlama-3.1 وQwen-3، وتقول إن تحديثها المغلق الصيغة ذي اللقطات القليلة يبقي خطوة SVD تحت 0.3 ثانية على MCF وZsRE، بينما ينمو التحرير الشامل من نحو 0.04 ساعة عند 10 عينات إلى 3.35–3.82 ساعة عند 1000 عينة، مع ذاكرة إجمالية تقارب 14.9–17.4 GB. تهم هذه الأرقام لأنها توضح أن إلغاء التعلّم التقريبي ليس مكلفًا جدًا للاختبار تلقائيًا. arXiv
لكن القيود أهم من العنوان الرئيسي. تقيّم الورقة نماذج مفتوحة ومجموعات بيانات معيارية محددة مثل MCF وZsRE ونسخة أحادية القفزة معدّلة من MQUAKE. كما تستخدم اختيارًا مستهدفًا للطبقات لتجنب الإضرار بالقدرة العامة. وهذا دليل على إزالة حقائق واعدة على نطاق المعايير، وليس برهانًا على أن نظامًا إنتاجيًا محا كل نسخة من المعلومات الحساسة بالكامل. arXiv
لا يزال الحذف المستمر ضعيفًا في الأنظمة متعددة الوسائط
تُعد *ICU-Bench* النظير المثير للقلق. يضم المعيار 1,000 ملف شخصي حساسًا للخصوصية من تقارير طبية وعقود عمل، و9,500 صورة، و16,000 زوج سؤال وجواب، و100 مهمة نسيان متسلسلة. واستنتاجه بسيط: تواجه أساليب إلغاء التعلّم متعددة الوسائط الحالية صعوبة في البيئات المستمرة، ولا تحافظ في الوقت نفسه على جودة النسيان، ومنفعة البيانات المحتفظ بها، والاستقرار في التسلسلات الطويلة. إذا كان منتجك يتلقى طلبات حذف متكررة بمرور الوقت، فهذه هي الورقة التي ينبغي قراءتها قبل الوعد بأتمتة نظيفة. arXiv
مجتمعةً، تدعم هذه الأوراق موقفًا عمليًا:
ما الذي ينبغي أن تعد به المستخدمين وأصحاب المصلحة
قدّم وعودًا أقل. وتحقق أكثر.
تبدو الصياغة الجيدة هكذا:
وتبدو الصياغة السيئة هكذا:
إذا كنت تحتاج إلى قاعدة قصيرة، فاستخدم هذه: إلغاء تعلّم الآلة طبقة واحدة داخل سير عمل أوسع لإزالة بيانات AI.
الأسئلة الشائعة
هل يؤدي حذف صف من قاعدة بيانات المتجهات إلى جعل LLM ينسى؟
لا. يمكن أن يوقف ذلك مسار استرجاع من إعادة إدخال البيانات، وهو غالبًا الإصلاح الأول الصحيح لأنظمة RAG. لكن إذا استُخدم المحتوى نفسه في الضبط الدقيق، أو التدريب المستمر، أو ذاكرة نموذج دائمة، فإن حذف صف المتجه وحده لا يغير الأوزان.
هل يمكن لإلغاء تعلّم الآلة أن يثبت اختفاء بياناتي من كل نسخة من النماذج؟
ليس بمفرده. تُظهر أبحاث التدقيق الحديثة أن عمليات التدقيق عبر الصندوق الأسود لها حدود، وغالبًا ما تتضمن أنظمة الإنتاج ذاكرات تخزين مؤقت، ومحوّلات، ونقاط تحقق، ونسخًا مكررة، ونسخًا احتياطية خارج سطح النموذج الخاضع للتدقيق. تحتاج إلى أدلة على مستوى النظام، لا إلى نتيجة على مستوى النموذج فقط. arXiv Google Research
التحقق من الادعاءات
| الادعاء | التحقق | المصدر |
|---|---|---|
| --- | --- | --- |
| يعني إلغاء تعلّم الآلة إزالة تأثير نقاط تدريب محددة، وقد تتجنب الأساليب التقريبية إعادة التدريب الكامل. | يتطابق مع صياغة مسرد NIST ونطاقه. | مسرد NIST لإلغاء تعلّم الآلة |
| تتعامل مسابقة Google مع إعادة التدريب من دون مجموعة النسيان باعتبارها نقطة المرجع على جانب النموذج. | موصوف في الإعلان الرسمي عن المسابقة. | إعلان مسابقة Google Research |
| يمكن للتدقيق السلوكي عبر الصندوق الأسود أن ينشئ مفاضلة بين الخصوصية والتدقيق. | تدعم ذلك الورقة النظرية والتجريبية الصادرة في يونيو 2026. | Behavioral Audit of Machine Unlearning Has a Privacy Cost |
| يثبت رفض إجابة واحدة النسيان الدائم. | مرفوض؛ إذ يفصل PrivUn بين فحوصات المخرجات المباشرة والاستعادة ضمن السياق والاستعادة عبر الضبط الدقيق. | PrivUn |
| تبلغ ZeroUnlearn عن نتائج قوية في معايير القياس مع نطاقات عملية لزمن التنفيذ والذاكرة، لكن على نماذج ومجموعات بيانات مفتوحة محددة. | تدعم ذلك أقسام التجارب والتعقيد في الورقة. | ZeroUnlearn |
| يظل الحذف المستمر متعدد الوسائط صعبًا بالنسبة إلى الأساليب الحالية. | تدعم ذلك مقاييس مجموعة بيانات ICU-Bench ونتائجها الرئيسية. | ICU-Bench |
| لا يمكن دائمًا اعتبار نماذج AI المدرّبة باستخدام بيانات شخصية مجهّلة الهوية. | ورد ذلك في ملخص رأي EDPB ونص الرأي. | رأي EDPB رقم 28/2024 |
| تثبت مشكلة واحدة على GitHub وجود خلل في الحذف على مستوى المنصة بأكملها. | مرفوض؛ فهي تقرير تكاملي قصصي يُستخدم فقط للتحفيز على اختبار استرجاع سلبي. | مشكلة AnythingLLM رقم 3958 |
