يمكن لتخزين مطالبات LLM مؤقتًا أن يجعل API مميزًا أرخص من وحدة GPU محلية غير مستغلة عند تكرار السياق. لكنه قد لا يحقق أي توفير على الإطلاق. المتغيرات الحاسمة ليست أسعار النماذج المعلنة، بل إعادة استخدام البادئة، وتكلفة الكتابة إلى الذاكرة المؤقتة، وخصومات القراءة، وانتهاء الصلاحية، والإخلاء، والاستغلال، وتكلفة العمل الفاشل.
الجمهور: الممارسون المتقدمون المسؤولون عن تكلفة منصة LLM أو زمن الاستجابة أو قرارات البنية التحتية.
القاعدة العملية: قِس عمليات القراءة من الذاكرة المؤقتة وإبطالها على حمل العمل الحقيقي قبل شراء سعة GPU. تعرض دراسة حالة جديدة عن وكيل برمجي مؤسسي هذه النقطة بنتيجة لافتة بلغت 99.3% لمعدل إصابة الذاكرة المؤقتة، لكن مؤلفيها درسوا مطورًا واحدًا، وفترتين متتاليتين مدة كل منهما 28 يومًا، وعائلتي نماذج مختلفتين، وقاعدة شيفرة إنتاجية واحدة. تعامل مع الورقة باعتبارها حافزًا للقياس، لا حكمًا نهائيًا بين السحابة والتشغيل المحلي.
ما الذي يغيّره تخزين مطالبات LLM مؤقتًا
يعالج LLM الإدخال في مرحلتين عامتين:
على مستوى الخدمة، يمكن لتخزين البادئة مؤقتًا أن يحفظ حالات الانتباه أو حالات key-value القابلة لإعادة الاستخدام لبادئة المطالبة. ويمكن لطلب لاحق ذي البادئة المؤهلة نفسها أن يتجاوز بعض أعمال التهيئة المسبقة المتكررة. أما اللاحقة المتغيرة فما زالت تحتاج إلى المعالجة، كما أن النموذج ما زال يفك ترميز إجابة جديدة.
هذا التمييز مهم. تخزين المطالبات مؤقتًا ليس تخزينًا مؤقتًا للاستجابات. فهو لا يعيد إجابة محفوظة، ولا يختصر المخرجات، ولا يصلح مطالبة ضعيفة، ولا يضمن انخفاض زمن الاستجابة من البداية إلى النهاية. ويستهدف أساسًا الحساب المتكرر للإدخال، وغالبًا ما يحسّن زمن الوصول إلى أول رمز.
قدّمت ورقة Prompt Cache الأصلية صياغة رسمية لوحدات المطالبات القابلة لإعادة الاستخدام، وأبلغت عن تحسينات أولية في زمن الوصول إلى أول رمز تراوحت بين 8× على وحدات GPU و60× على وحدات CPU. وهذه نتائج للنماذج والأجهزة والمطالبات والتنفيذات التي اختبرتها الورقة، وليست توقعًا لواجهات API التجارية الحالية.
دراسة حالة 99.3%: دليل مفيد بحدود ضيقة
قارنت مسودة أولية من يوليو 2026 بعنوان *Inference Economics of Enterprise Coding Agents* بين فترتين متتاليتين مدة كل منهما 28 يومًا على مستودع أحادي إنتاجي واحد:
حلّل المؤلفون بيانات القياس عن بُعد الخاصة بـ LLM وسجل Git. وأبلغوا عن معدل إصابة لذاكرة المطالبات المؤقتة بلغ 99.3% خلال فترة API، وتكلفة API فعلية قدرها 0.573 دولار لكل مليون رمز مُعالَج، وتكلفة وحدية مُستهلكة قدرها 2.83 دولار لتخصيص التشغيل المحلي المشترك. عالج API عددًا من الرموز أكبر بـ16.9 مرة، بينما كانت الاستفادة من الأجهزة المحلية منخفضة، ولذلك لا تحسم أسعار الرموز المعيارية هذه مسألة البنية التحتية.
تشير نتائج التكلفة الإجمالية إلى اتجاهات مختلفة بحسب التخصيص. فوفق افتراضات الورقة المتعلقة بسوق تايوان والعمالة، خفّضت السعة المحلية المشتركة التكلفة الإجمالية الحقيقية المقدّرة للملكية بنسبة 40.1%. أما حجز السعة المحلية المخصصة فكان أغلى بنسبة 43.8% من API المخزّن مؤقتًا. كما ارتبطت الفترة المحلية بنسبة أعلى من commits الإصلاح: 74.9% مقابل 45.9%.
ما الذي قاسه المؤلفون
ما الذي استنتجوه
ما الذي لا تستطيع الدراسة إثباته
كان التصميم غير عشوائي ومتسلسلًا. وربما تغيّرت قاعدة الشيفرة والمطور ومزيج المهام وممارسات العمل بين الفترتين. كما تغيّرت قدرة النموذج ومكدس الخدمة وأداة التشغيل والكمّية معًا. وكان المؤلف الأول على علم بالفرضية. وتصنيف commit الإصلاح هو مؤشر بديل، وليس تدقيقًا مستقلًا للعيوب. ولم تُنشر بيانات القياس الخام من الإنتاج ولا بيئة إعادة التشغيل الكاملة.
الاستنتاج المتين أضيق من الأرقام الرئيسية: يمكن لإعادة استخدام المطالبات واستغلال وحدات GPU أن يهيما على مقارنات الأسعار المعلنة، بينما قد يهيمن عمل الإصلاح على وفورات الرموز.
حدّد عقد القياس قبل حساب معدل الإصابة
يكون مصطلح «معدل إصابة الذاكرة المؤقتة» غامضًا ما لم يكن المقام محددًا بوضوح. فقد تقسم لوحة معلومات ما الرموز المخزنة مؤقتًا على رموز البادئة المؤهلة. وقد تقسم أخرى الطلبات التي تتضمن أي قراءة من الذاكرة المؤقتة على جميع الطلبات. وقد تعرض ثالثة الرموز المخزنة مؤقتًا كنسبة من إجمالي الإدخال، بما في ذلك اللاحقة غير المخزنة مؤقتًا.
استخدم مقاييس منفصلة:
أبقِ حقول الاستخدام التي يبلّغ عنها المزوّد منفصلة عن المقاييس التي تستنتجها. كما يمكن أن تتغير أعداد الرموز مع أدوات ترميز النماذج والقوالب؛ ويوضح شرح ضريبة أداة ترميز LLM→ سبب كون أعداد الأحرف الخام بديلًا ضعيفًا.
سلوك API الحالي والاستضافة الذاتية ليس موحدًا
تم التحقق من اللقطة التالية في 30 يوليو 2026. أعد التحقق من الوثائق المرتبطة قبل استخدامها في الشراء أو الفوترة.
| المنصة | التحكم في الذاكرة المؤقتة | الإشارة القابلة للرصد | القيد التشغيلي |
|---|---|---|---|
| --- | --- | --- | --- |
| OpenAI API | يدعم GPT-5.6 التخزين المؤقت الضمني والصريح للمطالبات | `cached_tokens` و`cache_write_tokens` | تسعّر إرشادات GPT-5.6 الحالية عمليات الكتابة الصريحة عند 1.25× من الإدخال غير المخزن مؤقتًا؛ أما القراءات فمخفّضة السعر |
| Anthropic API | تخزين مؤقت تلقائي أو نقاط فصل صريحة للكتل | استخدام منفصل لإنشاء الذاكرة المؤقتة وقراءتها | ترتيب البادئة هو الأدوات، ثم النظام، ثم الرسائل؛ وTTL الافتراضي 5 دقائق، مع خيار مدفوع لمدة ساعة واحدة |
| Gemini Interactions API | التخزين المؤقت الضمني للسياق مفعّل افتراضيًا لنماذج Gemini 2.5 والأحدث | `usage.total_cached_tokens` | يجب وضع المحتوى المشترك في البداية؛ وتتراوح الحدود الدنيا الحالية بين 2,048 و4,096 رمزًا بحسب النموذج |
| vLLM | يمكن تفعيل Automatic Prefix Caching في المحرك | مقاييس المحرك وتوقيت الطلبات | فريقك مسؤول عن السعة والإخلاء والعزل والترقيات والرصد |
توضح إرشادات النماذج الحالية من OpenAI لمستخدمي GPT-5.6 ضرورة مراقبة عمليات الكتابة والقراءة من الذاكرة المؤقتة، لأن الكتابات الصريحة تكلف أكثر من الإدخال غير المخزن مؤقتًا. وتوثّق وثائق تخزين المطالبات مؤقتًا لدى Anthropic عمليات كتابة لمدة 5 دقائق بسعر 1.25× من إدخال الأساس، وعمليات كتابة لمدة ساعة بسعر 2×، وقراءات الذاكرة المؤقتة بسعر 0.1×. وتذكر دليل التخزين المؤقت للسياق من Google أن التخزين المؤقت الضمني تلقائي في Interactions API، ويعرض الرموز المخزنة مؤقتًا ضمن الاستخدام. ويعرض مثال Automatic Prefix Caching في vLLM الفكرة نفسها الخاصة بالبادئة المشتركة في محرك مستضاف ذاتيًا.
تشترك هذه التطبيقات في مبدأ، لا في عقد فوترة قابل للنقل. فقد تختلف الحدود الدنيا لطول البادئة، ونطاق الذاكرة المؤقتة، والاحتفاظ، ورسوم التخزين، وحقول الاستخدام، والعزل.

*قِس الذاكرة المؤقتة قبل تغيير البنية التحتية: ثبّت البادئة، وأجرِ اختبارات باردة ودافئة، وافرض الإبطال، ثم قارن التكلفة الإجمالية.*
معادلة نقطة التعادل للبادئة القابلة لإعادة الاستخدام
لنعرّف:
مع تجاهل رسوم التخزين، تكون تكلفة البادئة القابلة لإعادة الاستخدام في المتوسط لكل طلب:
`(W + (N - 1) × R) / N`
يكون التخزين المؤقت أرخص من معالجة تلك البادئة دون تخزين مؤقت عندما:
`N > (W - R) / (U - R)`
تعزل هذه المعادلة البادئة القابلة لإعادة الاستخدام. وهي تستبعد اللاحقة المتغيرة، ورموز المخرجات، والحد الأدنى للطول القابل للتخزين المؤقت، ورسوم التخزين، والإخفاقات الناتجة عن الإخلاء، وتأثيرات التزامن، والعمالة الهندسية، والمهام الفاشلة.
في مثال توضيحي مؤرخ، كانت معاملات Anthropic لمدة 5 دقائق في 30 يوليو 2026 هي `U = 1` و`W = 1.25` و`R = 0.1`. وكان حد الإدخال فقط هو `N > 1.28`، لذا فإن الاستخدام الثاني خلال عمر الذاكرة المؤقتة يوزّع تكلفة الكتابة الأعلى على تلك البادئة المؤهلة. لكن هذا لا يعني أن مكالمتين إجمالًا إلى API تجعل التخزين المؤقت مربحًا. فقد تمحو بادئة قصيرة، أو لاحقة طويلة غير مخزنة مؤقتًا، أو إخفاق في الذاكرة المؤقتة، أو مخرج مكلف، التوفير.
استخدم المعادلة كاختبار وحدي لنموذج التكلفة لديك. واستبدل كل متغير بقيم من عقد المزوّد الحالي ومن حمل العمل المقاس لديك.
لماذا تفشل المطالبات التي تبدو مستقرة في إصابة الذاكرة المؤقتة
تبدأ معظم الإخفاقات في بناء المطالبة، لا في النموذج.
ظهور بيانات متغيرة في وقت مبكر جدًا
يؤدي طابع زمني أو معرّف طلب أو nonce عشوائي أو اسم مستخدم أو نتيجة استرجاع جديدة بالقرب من البداية إلى تغيير كل رمز يأتي بعده. ضع الأدوات والسياسات والقوالب والوثائق القابلة لإعادة الاستخدام والمستقرة أولًا. وانقل البيانات الخاصة بالطلب إلى ما بعد البادئة القابلة لإعادة الاستخدام أو نقطة الفصل الصريحة.
تغيّر التسلسل بين الطلبات
يمكن لترتيب مفاتيح JSON والمسافات البيضاء وترتيب الأدوات وترتيب الوثائق أن يغيّر بادئة تبدو مكافئة في غير ذلك. استخدم تسلسلًا حتميًا. ورتّب تعريفات الأدوات والوثائق المسترجعة وفق معرّفات مستقرة حيثما سمحت الدلالات بذلك.
تدمير مدير السياق لاستمرارية البادئة
يمكن للتقليم المكثف أن يوفر رموز الإدخال مع إبطال البادئات المخزنة مؤقتًا. ويتعامل TokenPilot، وهو عمل أولي قيد التطوير من يونيو 2026، مع ذلك باعتباره مسألة تحسين مشتركة. ويثبّت مؤلفوه عملية الإدخال ويؤخرون الإخلاء حتى يفقد السياق قيمته للمهمة. ويبلغون عن خفض التكلفة بنسبة 56% إلى 87% عبر معيارين ووضعَي تنفيذ، مع الحفاظ على أداء تنافسي للمهام. وتتطلب هذه النتائج تكرارًا يتجاوز أحمال العمل الخاصة بالورقة وتكامل LightMem2.
انتهاء صلاحية الذاكرة المؤقتة أو إخلاؤها تحت الحمل الحقيقي
يمكن لاختبار محلي دافئ أن يخفي حدود TTL وضغط السعة. ويشارك تخزين البادئة مؤقتًا في الأنظمة المستضافة ذاتيًا الواقع نفسه الخاص بالذاكرة المحدودة لأنظمة KV-cache الأخرى. ويغطي الدليل المتعمق لإخلاء KV-cache→ سبب انهيار إعادة الاستخدام عندما يرتفع التزامن وطول التسلسل.
تغيّر النموذج أو القالب
قد يؤدي إصدار نموذج أو أداة ترميز أو قالب محادثة أو إعداد تفاصيل صورة أو مخطط أداة أو تمهيد أمان إلى إنشاء بادئة جديدة. تعامل مع الإصدارات وترحيلات المطالبات باعتبارها أحداث إبطال للذاكرة المؤقتة.
توضح المناقشات الهندسية الحالية في vLLM هذا الضغط. إذ تجادل مقترح الاحتفاظ المدرك للسياق بأن أحمال عمل الوكلاء المتزامنة يمكن أن تُخلي البادئات القيّمة، بينما يستكشف مقترح KV-cache الدلالي إعادة الاستخدام خارج نطاق التطابقات الدقيقة. وهذه مناقشات تصميم مفتوحة، وليست ضمانات إنتاجية أو قياسات للتبني.
اختبار قابل لإعادة الإنتاج لذاكرة المطالبات المؤقتة
استخدم مجموعة المهام نفسها التي ستستخدمها في قياس نماذج AI للعمل الحقيقي→. ويضيف اختبار الذاكرة المؤقتة تغييرات مضبوطة على البادئة ومحاسبة للبنية التحتية.
1. جمّد حمل عمل ممثلًا
اختر من 30 إلى 100 مهمة من حركة الإنتاج أو مجموعة إعادة تشغيل آمنة للخصوصية. وحافظ على التوزيع الحقيقي لطول البادئة وطول اللاحقة وطول المخرجات والأدوات والوثائق والتزامن. وحدد نجاح المهمة قبل تشغيل الاختبار.
لا تحسّن اعتمادًا على مطالبة تجريبية طويلة واحدة. فقد تكون لاقتصاديات سير عمل دعم ملائم للذاكرة المؤقتة وسير عمل بحثي معادٍ لها نتائج متعاكسة.
2. افصل المحتوى المستقر عن المتغير
صنّف كل جزء من المطالبة:
أنشئ مُركّب مطالبات حتميًا. وسجّل إصدارًا معتمًا للبادئة أو تجزئة keyed hash حتى يحدد كل طلب البادئة التي حاول إعادة استخدامها. لا تضع الأسرار أو محتوى العملاء الخام في السجلات.
3. شغّل مصفوفة مضبوطة
لكل فئة من المهام، قِس:
| التجربة | التغيير | السؤال الذي تجيب عنه |
|---|---|---|
| --- | --- | --- |
| باردة | بادئة جديدة بلا حالة قابلة لإعادة الاستخدام | ما تكلفة الكتابة أو التهيئة المسبقة الأساسية؟ |
| دافئة | بادئة مؤهلة مطابقة | هل يبلّغ المزوّد أو المحرك عن قراءة؟ |
| تغيير مبكر | تغيير رمز واحد بالقرب من البداية | كم مقدار إعادة الاستخدام الذي يختفي؟ |
| تغيير متأخر | تغيير اللاحقة فقط | هل تبقى البادئة المستقرة قابلة لإعادة الاستخدام؟ |
| حد TTL | التكرار قبل انتهاء الصلاحية وبعده | كم مرة ستصل حركة الإنتاج في الوقت المناسب؟ |
| التزامن | زيادة الطلبات المتوازية على مراحل | هل يقلل الإخلاء أو الجدولة من إعادة الاستخدام؟ |
| تغيير الإصدار | تغيير النموذج أو الأدوات أو القالب | أي عمليات نشر تُبطل الذاكرة المؤقتة؟ |
شغّل عددًا كافيًا من التكرارات للإبلاغ عن توزيعات بدلًا من رقم زمن استجابة واحد. وافصل بين p50 وp95 لزمن الوصول إلى أول رمز وزمن الاستجابة من البداية إلى النهاية.
4. سجّل الفوترة والجودة معًا
التقط ما يلي:
ينبغي لإعادة استخدام الحالة ذات البادئة المطابقة تمامًا أن تتجنب حساب التهيئة المسبقة المتكرر؛ لكنها لا تعفي من فحص الجودة. فقد يؤدي تغيير النموذج أو مستوى الكمّية أو سياسة التوجيه أو مكدس الخدمة إلى تغيير جودة المخرجات حتى عندما تكون آلية الذاكرة المؤقتة نفسها صحيحة.
5. احسب ثلاث رؤى للتكلفة
إذا كان الخيار المحلي يعتمد على استغلال مستمر، فاختبر افتراض الاستغلال. لا تصبح عملية شراء GPU اقتصادية لأن جدولًا يخصص كل ساعة خاملة للطلب المستقبلي.
API سحابي أم GPU محلي أم توجيه هجين؟
نادراً ما يكون القرار ثنائيًا.
فضّل API مخزّنًا مؤقتًا عندما
فضّل السعة المحلية المشتركة عندما
استخدم التوجيه الهجين عندما
يمكن لنقاط النهاية المجانية أو المدعومة أن تساعد في النماذج الأولية، لكنها لا تلغي الحاجة إلى محاسبة حمل العمل. وتُعد دراسة حالة API لنماذج AI المجانية→ نقطة بداية مفيدة لفصل سعر الوصول عن موثوقية الإنتاج.
يحتاج أمان ذاكرة المطالبات المؤقتة إلى اختبار خاص به
ينشئ التخزين المؤقت توقيتًا يعتمد على البيانات: فقد تعيد البادئة المعاد استخدامها أول رمز أسرع من حالة عدم الإصابة. واستخدم تدقيق ICML 2025 قياسات التوقيت لاختبار APIs حقيقية، وأبلغ عن أدلة على مشاركة الذاكرة المؤقتة بين المستخدمين لدى سبعة مزوّدين خلال فترة الدراسة.
هذه نتيجة تاريخية خاصة بالمزوّدين. ولا تثبت كيفية عزل تلك الخدمات للذاكرة المؤقتة اليوم.
اسأل المزوّدين الحاليين ومالكي المنصات الداخلية:
بالنسبة للأنظمة المستضافة ذاتيًا، أدرج اختبارات التوقيت والإخلاء بين المستأجرين. ولا تسجّل البادئات الحساسة القابلة لإعادة الاستخدام لمجرد تصحيح الذاكرة المؤقتة. خزّن التجزئات وأعداد الرموز ومعرّفات الإصدارات والبيانات الوصفية الآمنة وفق السياسة.
قائمة التحقق من القرار
لا توافق على شراء GPU أو ترحيل API اعتمادًا على الأسعار المعلنة وحدها. اطلب ما يلي:
تخزين المطالبات مؤقتًا ذو قيمة لأن تكرار السياق شائع. لكنه خطير كاختصار للشراء لأن إعادة الاستخدام خاصة بحمل العمل. قِس البادئة، وقِس الإخفاقات، ثم قارن التكلفة الإجمالية.
فحوصات الادعاءات
| الادعاء المهم | نوع الدليل | الفحص والقيد |
|---|---|---|
| --- | --- | --- |
| أبلغت دراسة وكيل البرمجة عن معدل إصابة لذاكرة المطالبات المؤقتة بلغ 99.3% | بحث أولي، مسودة أولية من يوليو 2026 | مطور واحد، وقاعدة شيفرة واحدة، وفترتان متتاليتان؛ النتيجة غير قابلة للنقل |
| أبلغت الورقة عن 0.573 دولار لكل مليون رمز API مُعالَج مقابل 2.83 دولار لكل مليون لتخصيص محلي مشترك | بحث أولي | عالج API رموزًا أكثر بـ16.9 مرة وكانت الاستفادة المحلية منخفضة؛ الإنفاق الإجمالي وTCO مقارنتان أقوى |
| وفّرت السعة المحلية المشتركة 40.1% من TCO، بينما كلفت السعة المخصصة 43.8% أكثر | بحث أولي | يعتمد ذلك على افتراضات الورقة المتعلقة بالأجهزة والتخصيص وسوق تايوان والعمالة والجودة |
| يعيد تخزين البادئة مؤقتًا استخدام حالة الانتباه لمقاطع المطالبة المتكررة | بحث أولي محكّم ووثائق محركات رسمية | يقلل أعمال التهيئة المسبقة المتكررة؛ وتبقى أعمال فك الترميز واللاحقة المتغيرة |
| تكلف كتابات الذاكرة المؤقتة لمدة 5 دقائق لدى Anthropic 1.25× وتكلف القراءات 0.1× من إدخال الأساس | وثائق رسمية تم التحقق منها في 30 يوليو 2026 | قد تتغير الأسعار والنماذج المدعومة؛ يستبعد المثال المخرجات واللاحقة والتخزين |
| يكون التخزين المؤقت الضمني في Gemini افتراضيًا لـ Gemini 2.5 والأحدث في Interactions API | وثائق رسمية محدّثة في 7 يوليو 2026 | تختلف أعداد الرموز الدنيا ودعم التخزين المؤقت الصريح بحسب API والنموذج |
| أبلغ TokenPilot عن خفض التكلفة بنسبة 56%–87% عبر إعداداته المختبرة | بحث أولي، مسودة أولية قيد التطوير | معياران وتكامل محدد؛ يلزم تكرار مستقل |
| يمكن لتوقيت ذاكرة المطالبات المؤقتة كشف المعلومات عندما يتجاوز نطاق الذاكرة المؤقتة المستخدمين | بحث أولي من ICML 2025 | تدقيق تاريخي للمزوّدين المختبرين؛ لا تستنتج سلوك المزوّد الحالي |
