تتمتع النماذج اللغوية الكبيرة (LLMs) بقدرات هائلة، لكنها تواجه تحديين رئيسيين: التكلفة وزمن الاستجابة. يتم فرض تكلفة على كل رمز مميز تتم معالجته، وعندما يكرر المستخدمون الاستعلام عن السياق نفسه، مثل مستند كبير، ترتفع التكاليف نتيجة إجراء عمليات حسابية متكررة.
كما يمكن أن يؤدي زمن الاستجابة المرتبط بمعالجة هذه الطلبات إلى إبطاء استجابة تطبيقك، ما ينتج عنه تجربة مستخدم أقل من المستوى المطلوب[1]. ويظهر التخزين المؤقت للمطالبات كحل رئيسي لمعالجة هذه التحديات.
في هذه المقالة، سنتعرف على مفهوم التخزين المؤقت للمطالبات، وكيف يختلف عن التخزين المؤقت التقليدي، وكيفية تطبيقه في تطبيقات الذكاء الاصطناعي، إلى جانب حالات استخدامه المختلفة. وسنتناول أيضًا مزايا التخزين المؤقت للمطالبات والجوانب التي ينبغي مراعاتها عند استخدامه.
التخزين المؤقت للمطالبات طريقة بسيطة لتحسين سرعة النماذج اللغوية الكبيرة (LLMs) وكفاءة تكلفتها. ويحقق هذه التحسينات من خلال تخزين الأجزاء التي غالبًا ما تظل دون تغيير في المطالبة، مثل المحتوى الإرشادي أو المواد المرجعية، حتى لا يضطر النموذج إلى إعادة معالجة تلك الرموز المميزة مرارًا.
على سبيل المثال، عندما ترسل طلبًا إلى نموذج لغوي كبير (LLM)، مثل "اشرح ما هو الذكاء الاصطناعي؟"، يقرأ النموذج المطالبة بالكامل لفهمها وتقديم استجابة. وإذا أرسلت المطالبة نفسها مرة أخرى، يعيد النموذج عملية المعالجة نفسها، ما يزيد الوقت والتكلفة.
مع التخزين المؤقت للمطالبات، يحفظ النموذج الأجزاء المتكررة من المطالبة بعد الطلب الأول. وعند إعادة إرسال المطالبة نفسها، يسترجع النموذج الاستجابة المخزنة بدلًا من إعادة معالجتها. تجعل هذه العملية الاستجابات أسرع وأكثر كفاءة وأعلى فاعلية من حيث التكلفة، لأن النموذج لا يضطر إلى إعادة إجراء العمليات الحسابية نفسها للمطالبات المتطابقة.[2]
الهدف والنطاق:
موثوقية المخرجات:
الأداء:
انتهاء الصلاحية والإبطال:
في التخزين المؤقت للمطالبات، يتم تخزين الأجزاء المتكررة من المطالبة بحيث يمكن إعادة استخدامها في الطلبات المستقبلية، ما يُلغي الحاجة إلى إعادة إرسالها ومعالجتها.
فيما يلي دليل خطوة بخطوة يوضِّح كيفية عمله:
يوفر LangChain إطار عمل مرنًا لإضافة التخزين المؤقت للمطالبات إلى تطبيقات النماذج اللغوية الكبيرة (LLMs). وعلى عكس أنظمة التخزين المؤقت المستقلة، يُعَد LangChain إطار عمل متكاملًا لبناء تطبيقات النماذج اللغوية الكبيرة (LLMs). فهو يجمع التخزين المؤقت مع المكونات الضرورية الأخرى في حل واحد، مثل التسلسل والذاكرة والتوليد المعزز بالاسترجاع (RAG) وتكامل الأدوات.
للمزيد من المعلومات حول كيفية تطبيق التخزين المؤقت للمطالبات باستخدام LangChain، انقر على الرابط التالي:
تستخدم المنصات الرائدة مخازن التخزين المؤقت للمطالبات من خلال كتابة البيانات في ذاكرة التخزين المؤقت وإدارة فترة الاحتفاظ بها، مع استخدام TTL والتحكم في التخزين المؤقت لإدارة مخرجاتها ومراعاة معدلات الاستخدام، وضمان خصوصية البيانات وإدارة الأسعار أو التكاليف المرتبطة بالتخزين المؤقت. يمكن تخزين مخططات التمثيلات المتجهية وتعليمات النظام مؤقتًا لاستخدامها في التفاعلات في الوقت الفعلي، ما يؤدي إلى تحسين سهولة استخدام الأدوات عبر محادثات متعددة الأدوار.
على الرغم من الفوائد القيّمة التي يمكن أن يوفرها التخزين المؤقت للمطالبات، فمن المهم مراعاة حدوده فيما يتعلق بالتحسين والأداء. تشمل بعض الاعتبارات الرئيسية ما يلي:
يُعَد التخزين المؤقت للمطالبات استراتيجية ذكية للتخزين المؤقت تعزز أداء الأنظمة المدعومة بالذكاء الاصطناعي، مثل روبوتات المحادثة والمساعدات البرمجية ومسارات التوليد المعزز بالاسترجاع (RAG)، لتحسين الأداء والكفاءة على حد سواء. بدلًا من إرسال طلبات متعددة إلى واجهة برمجة التطبيقات بالطلب نفسه للمطالبة الكاملة أو مطالبة النظام، يستفيد النظام من المحتوى المخزن مؤقتًا، مثل بادئات المطالبات وبادئات التخزين المؤقت والمحتوى الثابت، لتمثيل تلك البيانات، ما يوفر في رموز الإدخال ورموز الإخراج على حد سواء.
والنتيجة هي تقليل عدد استدعاءات واجهات برمجة التطبيقات، وتقليل حالات فشل العثور على البيانات في ذاكرة التخزين المؤقت، وزيادة كبيرة بشكل عام في زمن الاستجابة وتحسين تجربة المستخدم.
يعمل التخزين المؤقت للمطالبات بأفضل صورة في الأنظمة المدعومة بالذكاء الاصطناعي، مثل روبوتات المحادثة، إذ يعزز الأداء من خلال الاستفادة من رسائل المستخدمين وتقليل طلبات واجهات برمجة التطبيقات وزيادة معدلات نجاح الوصول إلى ذاكرة التخزين المؤقت بشكل كبير من خلال القراءة الموجزة من ذاكرة التخزين المؤقت.
عند تشغيل وظيفة أو الاستجابة للطلبات أو الاستعلامات اللاحقة في تطبيقك، يوفر التخزين المؤقت للمطالبات رموز المطالبة وإجمالي الرموز المميزة وعدد الرموز المميزة، كما يجعل من السهل تتبُّع المقاييس. مع التخزين المؤقت للمطالبات، يمكن للفِرق تتبُّع رموز المطالبات وإجمالي الرموز المميزة في الوقت الفعلي، ومواصلة توسيع نطاق استخدام النماذج اللغوية الكبيرة مع تحقيق التوازن المناسب بين التكلفة والسرعة والموثوقية على نطاق عالمي لحالات استخدام الذكاء الاصطناعي التوليدي.
[1] Kaplan, J.، وMcCandlish, S.، وHenighan, T.، وBrown, T. B.، وChess, B.، وChild, R.، وGray, S.، وRadford, A.، وWu, J.، وAmodei, D. (2020). قوانين التوسع للنماذج اللغوية العصبية. arXiv
[2] Gim, I.، وChen, G.، وLee, S.، وSarda, N.، وKhandelwal, A.، وZhong, L. (2024). التخزين المؤقت للمطالبات: إعادة استخدام الانتباه المعياري للاستدلال منخفض زمن الاستجابة. وقائع المؤتمر السنوي السابع للتعلم الآلي والأنظمة (MLSys 2024). سانتا كلارا، كاليفورنيا.
[3] OpenAI. "التخزين المؤقت للمطالبات". وثائق منصة OpenAI، OpenAI، متاحة على الرابط التالي: https://platform.openai.com/docs/guides/prompt-caching
[4] Gu, C.، وLi, X. L.، وKuditipudi, R.، وLiang, P.، وHashimoto, T. (2025). تدقيق التخزين المؤقت للمطالبات في واجهات برمجة تطبيقات النماذج اللغوية. arXiv. https://arxiv.org/abs/2502.07776
[5] Kelly، Conor. التخزين المؤقت للمطالبات: تقليل زمن الاستجابة والتكلفة عند التعامل مع المطالبات الطويلة. مدونة Humanloop، 2 أكتوبر 2024، https://humanloop.com/blog/prompt-caching
[6] Chakraborty, S.، وZhang, X.، وBansal, C.، وGupta, I.، وNath, S. (2025). التخزين المؤقت التوليدي للمطالبات والاستجابات المتشابهة من حيث البنية.
[7] Wu, G.، وZhang, Z.، وZhang, Y.، وWang, W.، وNiu, J.، وWu, Y.، وZhang, Y. (2025). أعرف ما طلبته: تسريب المطالبات من خلال مشاركة KV-Cache في خدمة LLM متعددة المستأجرين. وقائع ندوة أمن الشبكات والأنظمة الموزعة (NDSS).