ما المقصود بالتخزين المؤقت للمطالبات؟

مؤلف

Shalini Harkar

Lead AI Advocate

تتمتع النماذج اللغوية الكبيرة (LLMs) بقدرات هائلة، لكنها تواجه تحديين رئيسيين: التكلفة وزمن الاستجابة. يتم فرض تكلفة على كل رمز مميز تتم معالجته، وعندما يكرر المستخدمون الاستعلام عن السياق نفسه، مثل مستند كبير، ترتفع التكاليف نتيجة إجراء عمليات حسابية متكررة.

كما يمكن أن يؤدي زمن الاستجابة المرتبط بمعالجة هذه الطلبات إلى إبطاء استجابة تطبيقك، ما ينتج عنه تجربة مستخدم أقل من المستوى المطلوب[1]. ويظهر التخزين المؤقت للمطالبات كحل رئيسي لمعالجة هذه التحديات.

في هذه المقالة، سنتعرف على مفهوم التخزين المؤقت للمطالبات، وكيف يختلف عن التخزين المؤقت التقليدي، وكيفية تطبيقه في تطبيقات الذكاء الاصطناعي، إلى جانب حالات استخدامه المختلفة. وسنتناول أيضًا مزايا التخزين المؤقت للمطالبات والجوانب التي ينبغي مراعاتها عند استخدامه. 

ما المقصود بالتخزين المؤقت للمطالبات؟ | IBM

التخزين المؤقت للمطالبات طريقة بسيطة لتحسين سرعة النماذج اللغوية الكبيرة (LLMs) وكفاءة تكلفتها. ويحقق هذه التحسينات من خلال تخزين الأجزاء التي غالبًا ما تظل دون تغيير في المطالبة، مثل المحتوى الإرشادي أو المواد المرجعية، حتى لا يضطر النموذج إلى إعادة معالجة تلك الرموز المميزة مرارًا. 

على سبيل المثال، عندما ترسل طلبًا إلى نموذج لغوي كبير (LLM)، مثل "اشرح ما هو الذكاء الاصطناعي؟"، يقرأ النموذج المطالبة بالكامل لفهمها وتقديم استجابة. وإذا أرسلت المطالبة نفسها مرة أخرى، يعيد النموذج عملية المعالجة نفسها، ما يزيد الوقت والتكلفة.

مع التخزين المؤقت للمطالبات، يحفظ النموذج الأجزاء المتكررة من المطالبة بعد الطلب الأول. وعند إعادة إرسال المطالبة نفسها، يسترجع النموذج الاستجابة المخزنة بدلًا من إعادة معالجتها. تجعل هذه العملية الاستجابات أسرع وأكثر كفاءة وأعلى فاعلية من حيث التكلفة، لأن النموذج لا يضطر إلى إعادة إجراء العمليات الحسابية نفسها للمطالبات المتطابقة.[2]

ما الفرق بين التخزين المؤقت للمطالبات والتخزين المؤقت التقليدي؟

الهدف والنطاق:

  • يحفظ التخزين المؤقت للمطالبات مطالبات النماذج اللغوية الكبيرة (LLMs) المتكررة لتجنُّب إعادة العمليات الحسابية وتقليل زمن الاستجابة.
  • يعمل التخزين المؤقت التقليدي على تخزين البيانات أو الموارد التي يكثر الوصول إليها، مثل صفحات HTML واستعلامات قواعد البيانات واستجابات واجهات برمجة التطبيقات (API) والصور، لتسريع الوصول إليها مستقبلًا.

موثوقية المخرجات:

  • لا يعمل التخزين المؤقت للمطالبات إلا عندما تظل المطالبة وجميع المَعلمات، مثل temperature وtop-p وغيرها، متطابقة تمامًا في كل طلب.
  • يتميز التخزين المؤقت التقليدي بطابع حتمي، أي أن الإدخال نفسه ينتج دائمًا المخرج نفسه، مثل نتائج الاستعلامات أو الصور المتطابقة.

الأداء:

  • يقلل التخزين المؤقت للمطالبات من استخدام الرموز المميزة وتكلفة واجهات برمجة التطبيقات (API) وزمن الاستجابة من البداية إلى النهاية للطلبات المتكررة أو المتشابهة الموجَّهة إلى النماذج اللغوية الكبيرة (LLMs).
  • يحسِّن التخزين المؤقت التقليدي أداء التطبيق، ويخفف الحمل على الواجهة الخلفية أو قاعدة البيانات، ويقلل زمن استجابة الشبكة.

انتهاء الصلاحية والإبطال:

  • غالبًا ما يرتبط التخزين المؤقت للمطالبات بتحديثات إصدار النموذج أو دورات إعادة تدريبه.
  • تتم إدارة التخزين المؤقت التقليدي باستخدام مدة البقاء (TTL)، أو تعيين الإصدارات، أو الإبطال اليدوي عند تغيُّر البيانات الأساسية.[3]

كيف يعمل التخزين المؤقت للمطالبات؟

في التخزين المؤقت للمطالبات، يتم تخزين الأجزاء المتكررة من المطالبة بحيث يمكن إعادة استخدامها في الطلبات المستقبلية، ما يُلغي الحاجة إلى إعادة إرسالها ومعالجتها.

فيما يلي دليل خطوة بخطوة يوضِّح كيفية عمله: 

  1. توليد المفاتيح: عند إرسال مطالبة، يُنشئ النظام مفتاحًا للتخزين المؤقت. 
    يعتمد التخزين المؤقت للمطابقة التامة على نص المطالبة، أو نسخة مجزأة أو موحَّدة منه، ويمكن أن يتضمن مَعلمات مثل اسم النموذج ودرجة الحرارة أو مطالبة النظام. ولا يعمل إلا عندما تكون المطالبة وجميع الإعدادات متطابقة.
    أما التخزين المؤقت الدلالي، فيُنشئ تمثيلًا متجهيًا للمطالبة ويبحث عن إدخالات متشابهة من حيث المعنى. ويُتيح هذا النوع من التخزين المؤقت إعادة الاستخدام حتى إذا تغيَّرت صياغة المطالبة. وهاتان الطريقتان للتخزين المؤقت نهجان منفصلان، لكل منهما نقاط قوة مختلفة.
  2. البحث في ذاكرة التخزين المؤقت: بعد ذلك، يتم البحث عن المفتاح أو التمثيل المتجهي في مخزن التخزين المؤقت، والذي يكون عادةً مخزنًا للقيم والمفاتيح في حالات التخزين المؤقت التقليدي، أو قاعدة بيانات متجهية للمطابقات الدلالية.
  3. نجاح البحث في ذاكرة التخزين المؤقت وفشله: يعيد نجاح البحث نتيجة مخزنة على الفور، ما يلغي الحاجة إلى إعادة المعالجة. أما عند فشل البحث في ذاكرة التخزين المؤقت، فيتم إرسال المطالبة إلى النموذج، ثم يتم حفظ المخرجات لاستخدامها في المرة التالية.
  4. تخزين النتيجة: عند فشل البحث في ذاكرة التخزين المؤقت، وبمجرد أن يعيد النموذج اللغوي الكبير (LLM) استجابة، يتم حفظ المخرجات التي تم إنشاؤها، وأحيانًا التمثيل المتجهي أو بيانات التعريف الأخرى، تحت ذلك المفتاح لاستخدامها مستقبلًا.
  5. الإبطال: يمكن أن تنتهي صلاحية إدخالات ذاكرة التخزين المؤقت استنادًا إلى مدة البقاء (TTL) التي يحددها الخادم، أو تحديث النموذج، أو تغيُّر المحتوى، للحفاظ على دقة الإجابات وحداثتها.

تطبيق التخزين المؤقت للمطالبات في النماذج اللغوية الكبيرة (LLMs)

يوفر LangChain إطار عمل مرنًا لإضافة التخزين المؤقت للمطالبات إلى تطبيقات النماذج اللغوية الكبيرة (LLMs). وعلى عكس أنظمة التخزين المؤقت المستقلة، يُعَد LangChain إطار عمل متكاملًا لبناء تطبيقات النماذج اللغوية الكبيرة (LLMs). فهو يجمع التخزين المؤقت مع المكونات الضرورية الأخرى في حل واحد، مثل التسلسل والذاكرة والتوليد المعزز بالاسترجاع (RAG) وتكامل الأدوات.

للمزيد من المعلومات حول كيفية تطبيق التخزين المؤقت للمطالبات باستخدام LangChain، انقر على الرابط التالي:

حالات الاستخدام

  • بوابات التوثيق التفاعلية: يكون التخزين المؤقت للمطالبات فعَّالًا للغاية في أنظمة إدارة المعرفة الداخلية، من خلال تخزين الاستجابات للاستعلامات المتكررة حول سياسات المؤسسة أو إجراءاتها أو وثائقها التقنية. عندما يبحث الموظفون بشكل متكرر عن معلومات متشابهة، توفِّر الاستجابات المخزنة مؤقتًا إجابات فورية دون الحاجة إلى تكرار الاستعلام من النموذج اللغوي الكبير (LLM). 

  • الحملات التسويقية: يعمل التخزين المؤقت للمطالبات على تبسيط أنظمة روبوتات المحادثة والأتمتة من خلال حساب إجابات الأسئلة الشائعة مسبقًا وحفظها. فعلى سبيل المثال، تتم معالجة الاستعلامات المتعلقة بالخصومات أو مواصفات المنتجات أو توافرها في المخزون، لضمان حصول المستخدمين على استجابات سريعة للأسئلة الشائعة. خلال فترات ارتفاع حركة المستخدمين، تساعد الاستجابات المخزَّنة مؤقتًا على تجنُّب استدعاءات النماذج اللغوية الكبيرة (LLM) غير الضرورية، ما يقلل تكاليف واجهات برمجة التطبيقات (API) غير الضرورية ويخفف من زمن الاستجابة.

  • أنظمة دعم العملاء: في قنوات الدعم التي تُتيح للعملاء إرسال الأسئلة، يمكن تخزين إجابات الاستفسارات الشائعة المتعلقة باستكشاف الأخطاء وإصلاحها، أو إدارة الحسابات، أو الفوترة مؤقتًا. ويؤدي ذلك إلى استجابات أسرع، واتساق في الإجابات المقدمة، وتقليل الاعتماد على معالجة النماذج اللغوية الكبيرة (LLM) للأنواع نفسها من الاستفسارات. يمكن أن تؤدي هذه التحسينات إلى زيادة الكفاءة وتحسين رضا العملاء.[4]

المزايا

  • خفض التكاليف: توفير تكاليف واجهات برمجة التطبيقات (API) من خلال إعادة استخدام أزواج المطالبات والاستجابات بدلًا من استدعاء النموذج اللغوي الكبير (LLM) عدة مرات.
  • السرعة: يُتيح تقديم استجابة مخزَّنة مؤقتًا الحصول على إجابة فورية. فهو يؤدي إلى تقليل إجمالي وقت معالجة الاستعلام وزيادة سرعة الاستجابة.
  • الاستخدام الذكي للموارد: تجنُّب إهدار موارد الحوسبة دون داعٍ، وتخصيص الموارد لتنفيذ الاستعلامات الأخرى المتنوعة والمعقدة.
  • السعة غير المحدودة: إدارة حركة المرور المرتفعة والاستعلامات المتكررة بكفاءة، والحفاظ على سلاسة عمل التطبيق مع توسُّع نطاقه.
  • استجابات متسقة: تنتج جميع الاستعلامات المتطابقة أو المتشابهة الاستجابة نفسها في كل مرة من خلال آلية محددة، ما يوفر للمستخدم تجارب موثوقًا بها ويمكن الاعتماد عليها.
  • تجربة المستخدم: يُتيح تقديم استجابات أسرع ويمكن توقعها إجراء تفاعلات أكثر سلاسة، ما يُسهم في زيادة رضا المستخدمين في التطبيقات الموجَّهة للعملاء.
  • تقليل أعباء عمل الخوادم: تقليل عبء العمل على الخوادم وتمكين النظام من العمل بكفاءة أكبر من خلال تخفيف الاستعلامات التي يمكن الإجابة عنها باستجابة مخزَّنة مؤقتًا.[5]

تستخدم المنصات الرائدة مخازن التخزين المؤقت للمطالبات من خلال كتابة البيانات في ذاكرة التخزين المؤقت وإدارة فترة الاحتفاظ بها، مع استخدام TTL والتحكم في التخزين المؤقت لإدارة مخرجاتها ومراعاة معدلات الاستخدام، وضمان خصوصية البيانات وإدارة الأسعار أو التكاليف المرتبطة بالتخزين المؤقت. يمكن تخزين مخططات التمثيلات المتجهية وتعليمات النظام مؤقتًا لاستخدامها في التفاعلات في الوقت الفعلي، ما يؤدي إلى تحسين سهولة استخدام الأدوات عبر محادثات متعددة الأدوار. 

نقاط يجب مراعاتها عند استخدام التخزين المؤقت للمطالبات

على الرغم من الفوائد القيّمة التي يمكن أن يوفرها التخزين المؤقت للمطالبات، فمن المهم مراعاة حدوده فيما يتعلق بالتحسين والأداء. تشمل بعض الاعتبارات الرئيسية ما يلي: 

  • إدارة الاستعلامات الديناميكية أو الاستعلامات الحساسة للسياق: على الرغم من أن التخزين المؤقت للمطالبات غالبًا ما تكون فائدته محدودة مع الاستعلامات الديناميكية، سواء من حيث الوقت أو استنادًا إلى مدخلات المستخدم السابقة، أو الاستعلامات الحساسة للسياق، مثل الاستعلامات التي قد تتضمن تحديثات للبيانات في الوقت الفعلي أو محادثة متكررة متعددة الأدوار، فإنه يجب أن تنتج هذه الاستعلامات استجابة تتفاعل مع المعلومات الجديدة.
  • الاستجابات القديمة: يمكن أن تصبح الاستجابات المخزنة مؤقتًا قديمة بسرعة نسبيًا إذا تغيَّرت البيانات أو تغيَّر السياق، ما قد يؤدي إلى تقديم معلومات غير صحيحة أو غير ذات صلة استجابةً للاستعلام.
  • التعقيد في الحالات الاستثنائية: قد يؤدي تعديل ذاكرة التخزين المؤقت لدعم إعادة استخدام جزء من المطالبة، أو لتطبيق إجراءات تخفيف محددة، إلى مزيد من المشكلات، لأن هذه التعديلات تزيد من تعقيد تصميم النظام وجهود تنفيذه.
  • تحديات صيانة ذاكرة التخزين المؤقت: قد تنطوي الإدارة الفعَّالة لذاكرة التخزين المؤقت، مثل إعدادات انتهاء الصلاحية أو قيود التخزين، على أعباء تشغيلية.[6][7]

الملخص

يُعَد التخزين المؤقت للمطالبات استراتيجية ذكية للتخزين المؤقت تعزز أداء الأنظمة المدعومة بالذكاء الاصطناعي، مثل روبوتات المحادثة والمساعدات البرمجية ومسارات التوليد المعزز بالاسترجاع (RAG)، لتحسين الأداء والكفاءة على حد سواء. بدلًا من إرسال طلبات متعددة إلى واجهة برمجة التطبيقات بالطلب نفسه للمطالبة الكاملة أو مطالبة النظام، يستفيد النظام من المحتوى المخزن مؤقتًا، مثل بادئات المطالبات وبادئات التخزين المؤقت والمحتوى الثابت، لتمثيل تلك البيانات، ما يوفر في رموز الإدخال ورموز الإخراج على حد سواء.

والنتيجة هي تقليل عدد استدعاءات واجهات برمجة التطبيقات، وتقليل حالات فشل العثور على البيانات في ذاكرة التخزين المؤقت، وزيادة كبيرة بشكل عام في زمن الاستجابة وتحسين تجربة المستخدم. 

يعمل التخزين المؤقت للمطالبات بأفضل صورة في الأنظمة المدعومة بالذكاء الاصطناعي، مثل روبوتات المحادثة، إذ يعزز الأداء من خلال الاستفادة من رسائل المستخدمين وتقليل طلبات واجهات برمجة التطبيقات وزيادة معدلات نجاح الوصول إلى ذاكرة التخزين المؤقت بشكل كبير من خلال القراءة الموجزة من ذاكرة التخزين المؤقت.

عند تشغيل وظيفة أو الاستجابة للطلبات أو الاستعلامات اللاحقة في تطبيقك، يوفر التخزين المؤقت للمطالبات رموز المطالبة وإجمالي الرموز المميزة وعدد الرموز المميزة، كما يجعل من السهل تتبُّع المقاييس. مع التخزين المؤقت للمطالبات، يمكن للفِرق تتبُّع رموز المطالبات وإجمالي الرموز المميزة في الوقت الفعلي، ومواصلة توسيع نطاق استخدام النماذج اللغوية الكبيرة مع تحقيق التوازن المناسب بين التكلفة والسرعة والموثوقية على نطاق عالمي لحالات استخدام الذكاء الاصطناعي التوليدي.

المراجع

[1] Kaplan, J.، وMcCandlish, S.، وHenighan, T.، وBrown, T. B.، وChess, B.، وChild, R.، وGray, S.، وRadford, A.، وWu, J.، وAmodei, D. (2020). قوانين التوسع للنماذج اللغوية العصبية. arXiv

[2] Gim, I.، وChen, G.، وLee, S.، وSarda, N.، وKhandelwal, A.، وZhong, L. (2024). التخزين المؤقت للمطالبات: إعادة استخدام الانتباه المعياري للاستدلال منخفض زمن الاستجابة. وقائع المؤتمر السنوي السابع للتعلم الآلي والأنظمة (MLSys 2024). سانتا كلارا، كاليفورنيا.

[3] OpenAI. "التخزين المؤقت للمطالبات". وثائق منصة OpenAI، OpenAI، متاحة على الرابط التالي: https://platform.openai.com/docs/guides/prompt-caching

[4] Gu, C.، وLi, X. L.، وKuditipudi, R.، وLiang, P.، وHashimoto, T. (2025). تدقيق التخزين المؤقت للمطالبات في واجهات برمجة تطبيقات النماذج اللغوية. arXiv. https://arxiv.org/abs/2502.07776

[5] Kelly، Conor. التخزين المؤقت للمطالبات: تقليل زمن الاستجابة والتكلفة عند التعامل مع المطالبات الطويلة. مدونة Humanloop، 2 أكتوبر 2024، https://humanloop.com/blog/prompt-caching

[6] Chakraborty, S.، وZhang, X.، وBansal, C.، وGupta, I.، وNath, S. (2025). التخزين المؤقت التوليدي للمطالبات والاستجابات المتشابهة من حيث البنية.

[7] Wu, G.، وZhang, Z.، وZhang, Y.، وWang, W.، وNiu, J.، وWu, Y.، وZhang, Y. (2025). أعرف ما طلبته: تسريب المطالبات من خلال مشاركة KV-Cache في خدمة LLM متعددة المستأجرين. وقائع ندوة أمن الشبكات والأنظمة الموزعة (NDSS).

حلول ذات صلة
IBM watsonx Orchestrate

يمكنك بسهولة تصميم مساعدي ووكلاء الذكاء الاصطناعي القابلين للتوسع وأتمتة المهام المتكررة وتبسيط العمليات المعقدة باستخدام IBM watsonx Orchestrate.

استكشف watsonx Orchestrate
حلول الذكاء الاصطناعي

استفِد من الذكاء الاصطناعي في عملك بالاستعانة بخبرة IBM الرائدة في مجال الذكاء الاصطناعي ومحفظة حلولها التي ستكون بجانبك.

استكشف حلول الذكاء الاصطناعي
استشارات وخدمات الذكاء الاصطناعي

تساعد خدمات IBM Consulting® AI في إعادة تصور طريقة تعاون الشركات مع حلول الذكاء الاصطناعي من أجل النهوض بأعمالها.

استكشف خدمات الذكاء الاصطناعي
اتخِذ الخطوة التالية

باستخدام الذكاء الاصطناعي، يكشف IBM Concert عن رؤى مهمة حول عملياتك ويقدم توصيات خاصة بالتطبيق من أجل التحسين. اكتشف كيف يمكن لمنصة Concert تعزيز نمو أعمالك.

  1. استكشف Concert®
  2. استكشف حلول أتمتة عمليات الأعمال