يمكن أن يخفي إخلاء KV Cache إخفاقات LLM في بيئة الإنتاج
تقنية
AI
LLM Inference
KV Cache
Reliability

يمكن أن يخفي إخلاء KV Cache إخفاقات LLM في بيئة الإنتاج

خطة اختبار مدعومة بالأبحاث للفصل بين التراجعات الناجمة عن التخزين المؤقت والمهام الصعبة قبل وصول إعداد استدلال أسرع إلى بيئة الإنتاج.

Uygar DuzgunUUygar Duzgun
Jul 26, 2026
تم التحديث 12 أغسطس 2026
12 min read

نعم. يمكن أن يخفي إخلاء KV cache إخفاقات LLM لأن سياسة التقديم قد تتخلص من حالة انتباه كانت مهمة، ثم لا تملك معلومات كافية لتقدير الضرر اعتمادًا على cache المحتفظ به وحده.

تمنح ورقة بحثية قُدّمت في 23 يوليو 2026 هذه المشكلة حدًا دقيقًا: لا يستطيع الإخلاء الحتمي top-k، غير المعتمد على القيم، تقدير خطأ مخرجات الانتباه الذي يسببه باستمرار اعتمادًا على الحالة المحتفظ بها. ويحافظ البديل المقترح على عينة احتمالية من الذيل المستبعد، ويبني شهادة إحصائية حول الخطأ المقدّر. حسّنت الطريقة إسناد الإخفاقات في التجارب المُبلّغ عنها، لكن النموذج الأولي أبطأ، وتتوقف التجارب عند سياق 16K و8B من المعاملات، ولا تثبت الورقة صحة الإجابة من البداية إلى النهاية.

قبل الطرح، قارن كل معالجة مرشحة لـ cache مع تحكم يستخدم cache كاملًا على الطلبات المجمدة نفسها. احسب الحالات التي ينجح فيها cache الكامل ويفشل فيها المرشح. اختبر الإخلاء، والتكميم، والتفريغ، وإعادة الاستخدام كلًّا على حدة بحيث تعزل كل مقارنة مصدرًا واحدًا للخطأ.

مستوى القارئ: متقدم. يفترض هذا الدليل أنك تفهم استدلال transformer، والانتباه، وتقييم النماذج الأساسي.

المحتويات

لماذا يمكن أن يخفي إخلاء KV cache الإخفاقات

تعتمد مخرجات الانتباه على الإدخالات المحتفظ بها والإدخالات التي تزيلها السياسة. بعد أن تتخلص سياسة حتمية من الذيل، لا يستطيع نظام مراقبة يرى المجموعة المحددة فقط فحص القيم المفقودة.

تدرس ArXiv:2607.21475 مشكلة قابلية المراقبة هذه. وتنطبق نتيجتها السلبية على الإخلاء الحتمي top-k غير المعتمد على القيم: لا تستطيع الحالة المحتفظ بها وحدها دعم تقدير متسق لخطأ مخرجات الانتباه الناجم عن الإخلاء. ولا تعني النتيجة أن كل سياسة حتمية تنتج مخرجات رديئة. بل تعني أن فئة السياسات هذه لا تستطيع اعتماد خطئها الناجم عنها بشكل موثوق باستخدام ما احتفظت به فقط.

تحافظ الطريقة المقترحة على دليل حول الذيل المستبعد. فهي تأخذ عينات Poisson من الإدخالات التي كانت ستختفي لولا ذلك، وتطبق تصحيح Hájek، وتجمع هذا التقدير مع شهادة تباين للمجموعة المحتفظ بها.

مقاس: سجلت شهادة الخطأ تغطية قدرها 0.97 عبر 12,096 خلية لإعادة تشغيل الانتباه. واستخدمت دراسة منفصلة لأحمال عمل حقيقية نحو 74,000 عملية توليد لاختبار إسناد الإخفاقات. وفي تلك الدراسة، وصلت الشهادة إلى AUC قدره 0.73–0.75 للتمييز بين الإخفاقات الناجمة عن cache وإخفاقات النموذج المتأصلة. وبلغت ثقة المخرجات 0.47–0.54 في مهمة الإسناد نفسها.

مقاس: تنبأت ثقة المخرجات بالإخفاق العام بصورة أفضل. وتجيب الإشارتان عن سؤالين مختلفين:

تقدّر ثقة المخرجات ما إذا كانت الإجابة قد تفشل.
تقدّر شهادة cache ما إذا كان تقريب cache قد تسبب على الأرجح في الإخفاق.

مستنتج: لا يمكن استخدام انخفاض ثقة المخرجات بوصفه إنذارًا وحيدًا لتراجعات cache. فقد يشير إلى إجابة ضعيفة من دون تحديد سببها، بينما قد تتغير إجابة واثقة بعد أن تزيل سياسة cache حالة مفيدة.

وتُبلغ الورقة أيضًا عن نتائج سلبية وتشغيلية. فقد فشلت ثلاث من أصل سبع فرضيات مسجلة مسبقًا. واستغرق نموذجها الأولي 0.043 ثانية لكل رمز، مقارنةً بـ0.023 للإخلاء الحتمي و0.015 لـcache الكامل. وشملت التجارب سياقات تصل إلى 16K، ونماذج تصل إلى 8B، ووكيلًا بديلًا أحادي الدور. ولا يقدم المؤلفون نظرية تربط الشهادة بصحة المهمة من البداية إلى النهاية.

التفسير العملي: تعامل مع الشهادة بوصفها إشارة إسناد ضمن الظروف المدروسة. فهي لا تشهد على الجاهزية للإنتاج.

أربع معالجات لـ cache، وأربعة أسئلة حول الموثوقية

غالبًا ما تجمع الفرق عدة تدخلات تحت مسمى «تحسين KV cache». ويغير كل تدخل جزءًا مختلفًا من الاستدلال.

المعالجةما الذي يتغيرسؤال الموثوقية
---------
الإخلاءيزيل حالات key-value محددةهل احتاج رمز لاحق إلى الحالة المُزالة؟
التكميميخزن الحالات المحتفظ بها بدقة أقلهل غيّر الخطأ العددي الانتباه بما يكفي لتغيير النتيجة؟
التفريغ أو التدرجينقل الحالة بين GPU أو CPU أو طبقة تخزين أخرىهل غيّر النقل أو الجدولة أو سلوك التنفيذ التوافر أو زمن الاستجابة أو الصحة؟
إعادة الاستخدام أو التخزين المؤقت للبادئةيعيد استخدام الحالة من بادئة سابقة مطابقةهل جاءت الحالة من النموذج والبادئة والإعداد وحدود العزل الصحيحة؟

يصنف المسح المدرك للنظام في arXiv:2607.08057 المجال عبر الجدولة الزمنية، والوضع المكاني والترحيل، والتمثيل البنيوي والاحتفاظ. ويصلح هذا التصنيف أيضًا حدًا للتقييم. فمقارنة تحكم BF16 يستخدم cache كاملًا مع مرشح FP8 يستخدم الإخلاء تغيّر متغيرين بنيويين في آن واحد. ولا يستطيع المرشح الفاشل تحديد ما إذا كان الإخلاء أو التكميم أو تفاعلهما قد تسبب في التراجع.

التفسير العملي: اختبر كل تدخل في cache بوصفه تجربة مستقلة. ولا تجمعها إلا بعد اجتياز المعالجات الفردية.

سياسات تحافظ على قدر أكبر من الحالة المفيدة

تُظهر ورقتان أخريان أن تصميم السياسة يمكن أن يحافظ على قدر أكبر من الجودة عند ميزانية الذاكرة نفسها. ولا توفر أي منهما عتبة إنتاج عالمية.

تحمي VaSE، arXiv:2606.03928 حالات القيم ذات المقدار الكبير مع الحفاظ على التنوع العشوائي. وعلى Qwen3-4B وQwen3-14B عبر ست مهام استدلال، حققت ضغطًا لـcache بنحو 4× وحسّنت النتائج بمقدار 4.4 و4.9 نقطة مقارنةً بأقوى خط أساس للإخلاء. وبلغ إعداد واحد بسياق 16K وعلى A100 واحدة 3.1× رمزًا في الثانية.

تغطي هذه القياسات فك الترميز فقط، ونماذج Qwen3، ولا تتضمن التجميع في الإنتاج. ولا تثبت تحقيق المكسب نفسه مع عائلة نماذج أخرى أو محرك تقديم أو مستوى تزامن أو حمل عمل آخر.

تنسق K-VEC، arXiv:2606.29563 تغطية الاحتفاظ عبر رؤوس الانتباه والطبقات. وعلى Llama 3.1 8B عبر 16 مجموعة فرعية من LongBench، حسّنت الدرجات بما يصل إلى 10.35 نقطة وبمقدار 1.61 نقطة في المتوسط عند ميزانية `B=128`. ويستخدم التقييم عائلة نماذج واحدة ومجموعة معايير واحدة، كما تضيف الطريقة عملًا أثناء prefill.

التفسير العملي: تستحق السياسات المدركة للقيم والعشوائية والتغطية أن تشغل مواقع مرشحة في التقييم. ويظل تشغيل cache الكامل مصدر الحقيقة المحلي لديك.

لماذا يحتاج التكميم إلى تحكم منفصل

يقلل تكميم FP8 لـKV cache الدقة بدلًا من إزالة الرموز. ولا يزال بإمكان أخطائه الوصول إلى التطبيق من دون حدوث خطأ في المحرك.

أفاد تحقيق رسمي في FP8 من vLLM، نُشر في 22 أبريل 2026، بانخفاض دقة needle في السياقات الطويلة من 91% مع cache من نوع BF16 إلى 13% مع FP8 قبل إصلاح للتجميع ذي المستويين. وأعاد الإصلاح الدقة إلى 89%. وفي أفضل إعداد FP8 مُبلغ عنه، بلغ ميل فك الترميز 54% من BF16.

مقاس: تسبب مسار عددي واحد في تراجع حاد، واستعاد تصحيح على مستوى kernel معظم الدقة المفقودة.

غير مثبت: لا يتسبب FP8 cache عالميًا في ذلك التراجع ولا يحقق ذلك التسارع. وتعتمد النتيجة على التنفيذ والنموذج والعتاد ومسار الانتباه والمعيار.

تضيف المسألة #37554 في vLLM تحذيرًا ضيق النطاق: وجد أحد المبلغين تحجيمًا تالفًا صامتًا لـFP8 KV في نموذج هجين. ولا يمكن لتقرير الخطأ هذا دعم ادعاء عام حول FP8 أو البنى الهجينة.

تتضمن مناقشة LocalLLaMA من 7 أبريل تقارير متضاربة من الممارسين حول تنسيقات cache والجودة. ويمكن لهذه التقارير اقتراح حالات اختبار، لكن التقييم المنضبط هو الذي يجب أن يقرر الطرح.

يتضمن إصدار vLLM v0.26.0، المؤرخ في 25 يوليو، 411 التزامًا من 212 مساهمًا، ويوسع الرؤية في تدرج KV، ومقاييس التفريغ، وإعادة استخدام cache. ولا يثبت نشاط الإصدار وميزات المراقبة الجديدة اعتمادًا واسعًا في الإنتاج أو الصحة.

سير عمل للتحقق المزدوج باستخدام cache كامل

عرّف «cache الكامل» بأنه سلوك الانتباه الأصلي للنموذج من دون إضافة إخلاء أو تكميم لـcache. ثبّت أوزان النموذج، وtokenizer، وإصدار runtime، وbackend الانتباه، وإعدادات أخذ العينات، ورموز prompt، ومدقق المخرجات داخل كل زوج.

1. شغّل مصفوفة إزالة العوامل

استخدم أربع معالجات على الأقل:

التشغيلالاحتفاظالدقةالمقارنة
------------
Aكاملالدقة المرجعيةالتحكم
Bكاملتكميم المرشحA → B يعزل التكميم
Cإخلاء المرشحالدقة المرجعيةA → C يعزل الإخلاء
Dإخلاء المرشحتكميم المرشحA → D يقيس المعالجة المجمعة
E اختياريكاملالدقة المرجعية، مع التفريغ أو إعادة الاستخدامA → E يعزل الوضع أو إعادة الاستخدام

يمكن أن تكشف مقارنة A مع D عن تراجع مجمع، لكنها لا تستطيع إسناد السبب. ويوفر التشغيلان B وC عناصر التحكم المفقودة.

اختبر كل نموذج وruntime وkernel ومسار عتاد مدعوم على حدة. وتوضح نتيجة FP8 في vLLM سبب عدم كفاية تسمية مثل «تمكين FP8» لاتخاذ قرار موثوقية.

مخطط للتحقق المزدوج من KV cache يقارن بين الاستدلال باستخدام cache كامل والاستدلال المضغوط والنتائج
مخطط للتحقق المزدوج من KV cache يقارن بين الاستدلال باستخدام cache كامل والاستدلال المضغوط والنتائج

*التعليق: يعزل التحقق المزدوج باستخدام cache كامل الإخفاقات الخاصة بالمرشح قبل وصول الإخلاء أو التكميم إلى الإنتاج.*

2. جمّد مصفوفة حمل العمل

ابنِ المصفوفة من أشكال الطلبات الحقيقية، وأدرج الحالات الحدية:

طول السياق: قصير، ونموذجي، وعند المئين العالي، والحد الأقصى المدعوم.
طول التوليد: إجابات قصيرة، وإكمالات نموذجية، واستمراريات طويلة.
نوع المهمة: الاسترجاع، والاستدلال متعدد الخطوات، والمخرجات المنظمة، واختيار الأدوات، وكل مسار حرج خاص بالتطبيق.
ضغط cache: الميزانية المستهدفة وأصغر ميزانية مسموحة تحت الحمل.
وضع التقديم: فك ترميز معزول، إضافة إلى التجميع أو التزامن التمثيلي.
العشوائية: فك ترميز جشع لزوج ميكانيكي مستقر، يتبعه تكرار ببذور ثابتة إذا كان الإنتاج يستخدم أخذ العينات.

تحتاج أحمال العمل ذات السياق الطويل إلى أكثر من اختبار needle اصطناعي. إذا كان المنتج يشغّل وكلاء برمجة أو سير عمل ممتدًا، فأدرج آثارًا تمثيلية. يؤثر حجم الرموز وشكل سير العمل في الاقتصاديات الموضحة في رموز أكثر، وAI أفضل — وفاتورة الحوسبة ووكلاء البرمجة، و21 مليار رمز نشاط، وحكاية GPT-5.6.

3. زاوج الطلبات واعزل حالة cache

استخدم منطق التقييم الآتي:

text for each frozen_case: full = run(frozen_case, treatment=A, isolated_cache=true) candidate = run(frozen_case, treatment=candidate, isolated_cache=true)

full_pass = validate(full, frozen_case.expected_behavior) candidate_pass = validate(candidate, frozen_case.expected_behavior)

record(full_pass, candidate_pass, context_length, task_type, model, runtime, hardware, treatment)

هذه الكتلة pseudocode وليست API خاصة بمحرك معين. استخدم مدققًا للمهمة بدلًا من مساواة النص عندما تكون عدة إجابات صحيحة ممكنة. وتشمل المدققات المناسبة اختبارات الوحدة للكود المُولّد، وفحوصات المخطط للمخرجات المنظمة، وفحوصات الأداة ومعاملاتها بدقة، وتأكيدات الاسترجاع، أو rubric مسجلًا مسبقًا.

حافظ على عزل مساحات أسماء cache. فقد تلوث حالة البادئة المعاد استخدامها المقارنة بين المعالجات.

4. قِس الإخفاقات الخاصة بالمرشح

استخدم هذا المقياس الأساسي:

text cache_induced_failure_rate = count(full passes and candidate fails) / count(full passes)

يُشترط في المقام نجاح cache الكامل. ولا تُظهر الحالة التي يفشل فيها التشغيلان أن ضغط cache تسبب في الإخفاق.

أبلغ عن البسط والمقام الخامين لكل شريحة حرجة. فقد يخفي تجميع واحد تراجعًا عند أقصى سياق، أو في نموذج واحد، أو تحت backend انتباه واحد. وتتبع معدل الإخفاق الكلي إلى جانب المقياس المزدوج، لأن إشارات ثقة المخرجات وإسناد cache تغطي أنماط إخفاق مختلفة.

5. أعلن قاعدة القرار مسبقًا

اختر الحد الأقصى المقبول، `τ`، قبل الاطلاع على نتائج المرشح. ضع قواعد أكثر صرامة للمهام الحرجة. وقد يبرر إخفاق خاص بالمرشح وقابل لإعادة الإنتاج رفضه في مسار أداة أو سلامة أو معاملة، حتى عندما يبقى الإجمالي تحت `τ`.

ينتمي إعداد cache إلى سياسة التنفيذ. سجّله وطبّقه بالانضباط المستخدم في أذونات وكلاء AI الحتمية: إعداد صريح، وقرارات قابلة للمراقبة، ومسار إصلاح عند فشل التطبيق.

قرارات الطرح

الدليلالقرارالإجراء التالي
---------
لا توجد أزواج صالحة تستخدم cache كاملًاحظرأصلح أداة التقييم
يتجاوز المرشح `τ` إجمالًا أو في شريحة حرجةرفضزد ميزانية cache، أو غيّر السياسة، أو عطّل التكميم
ينجح الإجمالي لكن يتراجع نموذج أو kernel أو شريحة سياق واحدةتعليقاعزل ذلك المسار وأعد الاختبار المزدوج
تنجح الأزواج خارج الشبكة، لكن يظل التجميع أو عتاد الإنتاج غير مختبرCanary فقطخذ عينات من حركة مزدوجة واحتفظ ببديل يستخدم cache كاملًا
تنجح النتائج المزدوجة عبر المسارات المدعومة وتتكرر المكاسب التشغيليةطرح تدريجيوسّع حسب الشرائح مع الإبقاء على عتبات التراجع
تتجاوز الإخفاقات الخاصة بالمرشح عبر الإنترنت الحد المعلنتراجعاستعد آخر إعداد ناجح يستخدم cache كاملًا أو المرشح

لا يمكن لنشاط ملاحظات الإصدار أو التقارير القصصية أو مكاسب المعايير المتوسطة أن يحل محل بوابة طرح مزدوجة.

حدود الأدلة الحالية

تغطي أقوى نتيجة للشهادة خطأ مخرجات الانتباه تحت وكيل أحادي الدور، وليس صحة التطبيق من البداية إلى النهاية. وتتوقف تجاربها عند 16K و8B، بينما قد تشغّل أنظمة الإنتاج نماذج أكبر وسياقات أطول وأدوارًا متعددة وأدوات ودفعات. كما أن النموذج الأولي المقاس يكلف وقتًا أكبر لكل رمز من الإخلاء الحتمي وcache الكامل في الإعداد المُبلغ عنه.

وتظل VaSE وK-VEC مرتبطتين بنماذج ومهام وميزانيات وإعدادات تقديم محددة. وتُظهر أدلة vLLM أن تفاصيل التنفيذ قد تهيمن على نتيجة تنسيق cache. ولا يوفر أي من هذه المصادر نسبة ضغط آمنة عالمية.

التفسير العملي: استخدم البحث لاختيار السياسات المرشحة وإشارات المراقبة. واستخدم التحقق المزدوج باستخدام cache كامل لتقرر ما إذا كان تنفيذك يفي بحدود الموثوقية الخاصة بحمل عملك.

فحوصات الادعاءات

الادعاءالصياغة المستندة إلى الأدلة
------
«الإخلاء الحتمي غير آمن.»واسع جدًا. تتعلق النتيجة السلبية بالتقدير الذاتي المتسق من الحالة المحتفظ بها للإخلاء الحتمي top-k غير المعتمد على القيم.
«تكتشف الشهادة الإجابات الخاطئة.»تقدّر خطأ الانتباه الناجم عن cache وأظهرت إسنادًا مفيدًا للإخفاقات؛ ولا توجد نظرية لصحة التطبيق من البداية إلى النهاية.
«يدمر FP8 KV cache الدقة.»انخفض أحد مسارات vLLM من 91% إلى 13%، ثم تعافى إلى 89% بعد إصلاح. والنتيجة خاصة بالمسار.
«الإخلاء العشوائي جاهز للإنتاج.»تُظهر VaSE والنموذج الأولي للشهادة مفاضلات مقاسة مع حدود تتعلق بالنموذج والسياق والتجميع والسرعة.
«تثبت مقاييس vLLM الجديدة الاعتماد.»إنها تحسن الرؤية. ولا يثبت نطاق الإصدار وعدد المساهمين الاستخدام في الإنتاج.

المصادر

arXiv:2607.21475، قُدّمت في 23 يوليو 2026 — حدود الإخلاء الحتمي وشهادة الخطأ العشوائية.
arXiv:2606.03928 — الإخلاء العشوائي المدرك للقيم VaSE.
arXiv:2606.29563 — تغطية K-VEC عبر الرؤوس والطبقات.
arXiv:2607.08057 — مسح مدرك للنظام حول KV cache.
تحقيق vLLM في FP8 KV-cache، 22 أبريل 2026.
إصدار vLLM v0.26.0، 25 يوليو 2026.
المسألة #37554 في vLLM — تقرير عن تلف صامت في تحجيم FP8 على نموذج هجين.
مناقشة ممارسي LocalLLaMA، 7 أبريل 2026 — تقارير قصصية متضاربة.