تدفق بيانات ضخمة عبر شبكة رقمية. حقول بيانات سلسلة الكتل. تدفق بيانات عبر خطوط شبكة مترابطة. تصور لتقنية الذكاء الاصطناعي والاتصالات الرقمية والبحث العلمي وموجات موسيقية في رسم ثلاثي الأبعاد

ما المقصود بالتحقق من صحة النموذج؟

شرح التحقق من صحة النموذج

التحقق من صحة النموذج هو عملية منظمة لتحديد ما إذا كان نموذج التعلم الآلي (ML) ملائمًا للاستخدام المقصود منه.

وبدلًا من الاكتفاء بالسؤال: "هل ينتج النموذج إجابة؟"، تبحث عملية التحقق من صحة النموذج في مدى موثوقية تصميم النموذج وافتراضاته وبياناته وتنفيذه ومخرجاته وقيوده وسلوكه المستمر، بما يكفي للاعتماد عليه في القرارات التي سيتخذها الأشخاص استنادًا إليه.

يساعد التحقق من صحة النموذج الشركات على الحد من مخاطر النموذج، أي مخاطر أن ينتج النموذج نتائج غير دقيقة أو متحيزة أو غير مستقرة أو غير آمنة، أو أن يُساء استخدام نتائجه، وذلك من خلال التقييم الاستباقي لمدى كفاءة النموذج في أداء المهام المنوطة به.

وفي أبسط صور التحقق من الصحة، يمكن لمطوري النماذج أثناء مرحلة التطوير تقييم النموذج المرشح باستخدام مجموعة التحقق من الصحة، وهي مجموعة من الأمثلة يستخدمها مهندسو التعلم الآلي وعلماء البيانات للتحقق من مدى جودة تعلّم النموذج.

أما على مستوى إدارة مخاطر النماذج، فإن التحقق من صحة النموذج يكون أشمل بكثير. فعادةً ما يكون التحقق من صحة النماذج في المؤسسات تقييمًا مستقلًا يغطي دورة حياة النموذج بالكامل. إذ يراجع نموذج التعلم الآلي أشخاص لم يشاركوا في إنشائه، وتشمل المراجعة كيفية تطوير النموذج وإطلاقه واستخدامه ومراقبته وتعديله، وصولًا إلى إيقافه عن العمل في نهاية المطاف.

وتُثبت عملية التحقق الناجحة خمسة أمور رئيسية.

  1. أن يكون لنموذج التعلم الآلي غرض واضح، ومجتمع مستهدف محدد، ونطاق وسياق واضحان لاتخاذ القرارات.
  2. أن يكون النهج المفاهيمي للنموذج، أي الطريقة الأساسية لتحويل المدخلات إلى مخرجات وما تستند إليه من منطق وافتراضات، مناسبًا للغرض الذي صُمم النموذج من أجله.
  3. أن تكون البيانات التي يستخدمها النموذج وطريقة تنفيذه دقيقة وتخضع لضوابط مناسبة.
  4. أن يحقق النموذج مستوى أداء مناسبًا عند التعامل مع البيانات ذات الصلة، بما في ذلك البيانات التي لم يسبق له الاطلاع عليها أثناء مرحلة التطوير.
  5. أن تكون المؤسسة على دراية بقيود النموذج، وأن تتخذ الإجراءات المناسبة إذا بدأ أداؤه في التراجع.

وتتناسب عادةً درجة الصرامة في عملية التحقق من صحة النموذج مع الغرض الذي يُستخدم من أجله. فأداة داخلية محدودة التأثير للتنبؤ لا تستدعي مستوى التدقيق نفسه الذي يتطلبه نموذج يُستخدم للموافقة على القروض العقارية أو لاكتشاف معاملات مصرفية احتيالية.

والأهم أن التحقق من صحة النموذج ليس عملية موافقة تُجرى مرة واحدة وتنتهي. فحتى النماذج التي تحقق أداءً جيدًا في البداية قد تتعرض للانحراف ويتراجع أداؤها بعد إطلاقها. لذلك، غالبًا ما يكون التحقق المستمر من صحة نماذج التعلم الآلي جزءًا أساسيًا من ممارسات حوكمة الذكاء الاصطناعي (AI) في المؤسسات.

ركائز الثقة في النموذج

ووفقًا لإطار عمل إدارة مخاطر الذكاء الاصطناعي الصادر عن المعهد الوطني للمعايير والتقنية (NIST)، تشمل ركائز الثقة في النماذج: الصلاحية والموثوقية، والسلامة، والأمن والمرونة، والمساءلة والشفافية، وقابلية الشرح والتفسير، وتعزيز الخصوصية، والإنصاف وإدارة التحيز.

يساعد التحقق من صحة نماذج التعلم الآلي على بناء الثقة في النموذج والحفاظ عليها، والمقصود بها مستوى الثقة المبررة في أن النموذج سيتصرف على النحو الملائم. وتتخذ الشركات قرارات استنادًا إلى مخرجات نماذج التعلم الآلي، لذلك لا تقتصر الثقة في النموذج على كونها هدفًا مرتبطًا بالسمعة فحسب. بل إنها أساس لاستخدام الذكاء الاصطناعي بصورة آمنة وفعالة وقابلة للتوسع. وفي الواقع، كثيرًا ما تسهم الأهداف المتعلقة بالثقة في النموذج في تحديد ممارسات التحقق من صحته.

علاوةً على ذلك، لا يمكن اعتبار النموذج جديرًا بالثقة لمجرد أن مطوره يصفه بأنه "ذكاء اصطناعي مسؤول". بل يجب أن يكون النموذج قادرًا على أداء مهامه بموثوقية، وحماية الأشخاص والبيانات، والصمود أمام إساءة الاستخدام، وأن يكون مفهومًا وخاضعًا للحوكمة. لا بد من اكتساب هذا المستوى من الثقة من خلال ضوابط يمكن إثباتها، وجمع الأدلة بصورة مستمرة أثناء التحقق من صحة نماذج الذكاء الاصطناعي.

ومن الأطر واسعة الاستخدام لفهم ركائز الثقة في النماذج إطار عمل إدارة مخاطر الذكاء الاصطناعي الصادر عن المعهد الوطني للمعايير والتقنية (NIST). ويحدد الإطار سبع خصائص مترابطة للذكاء الاصطناعي الجدير بالثقة.

الصحة والموثوقية

يجب أن يكون النموذج الجدير بالثقة صالحًا لأداء المهمة المقصودة، وأن يحافظ على موثوقية أدائه بمرور الوقت وفي مختلف الظروف المتوقعة. وتتعلق الصلاحية بما إذا كان النموذج يقيس أو يتنبأ أو يصنّف أو يولّد بالفعل ما يدّعي أنه يقوم به.

أما الموثوقية فتتعلق بمدى قدرة النموذج على تقديم أداء متسق ويمكن الاعتماد عليه عند تلقي مدخلات متشابهة، بما في ذلك المدخلات الواردة من مستخدمين وبيئات ومصادر بيانات وفترات زمنية مختلفة.

السلامة

تركز ركيزة السلامة على ما إذا كان النموذج قد يتسبب في إلحاق ضرر بالأشخاص أو الممتلكات أو المؤسسات أو المجتمع، حتى عندما يكون، من الناحية التقنية، يعمل على النحو الذي صُمم من أجله.

فقد يكون النموذج دقيقًا، لكنه غير آمن في الوقت نفسه. فعلى سبيل المثال، قد يتمكن برنامج دردشة آلي لخدمة العملاء من استرجاع معلومات الحساب بصورة صحيحة، ولكن إذا أمكن التلاعب به للكشف عن بيانات حساسة، فإنه يظل غير آمن للاستخدام الفعلي. وتتطلب السلامة من الفرق تحديد الأضرار التي يمكن توقعها قبل نشر النموذج، ومعالجتها بصورة استباقية من خلال تصميم النظام.

الأمن والمرونة

أما الأمن فيهدف إلى حماية النموذج وبياناته وواجهاته والتطبيق المحيط به من الوصول الضار أو التلاعب. وفي أنظمة الذكاء الاصطناعي الحديثة، يمتد سطح الهجوم إلى ما هو أبعد بكثير من أوزان النموذج. فهو يشمل أيضًا بيانات التدريب، ومصادر الاسترجاع، والمطالبات، وواجهات برمجة التطبيقات (APIs)، والمكونات الإضافية، وهويات المستخدمين، والبنية الأساسية للنشر، والسجلات، وسلاسل توريد النماذج. ولذلك، يجب أن تكون ضوابط الأمن قادرة على إدارة سطح الهجوم بأكمله.

وتشير المرونة إلى قدرة النموذج على مواصلة العمل بأمان، أو التعافي بالشكل المناسب، أو التوقف بصورة آمنة ومنضبطة إذا حدث خلل ما. ويعني ذلك التحقق من قدرة النماذج على التعامل مع الاضطرابات غير المتعمدة، إلى جانب الهجمات الإلكترونية. وفي السياقات ذات التأثير الكبير، غالبًا ما تكون القدرة على التوقف بأمان أهم من مجرد استمرار توفر النظام.

المساءلة والشفافية

وتعني المساءلة وجود مسؤولين محددين يتحملون مسؤولية تصميم النموذج ونشره ونتائجه والإجراءات التصحيحية المتعلقة به. فمن دون المساءلة، قد تلجأ المؤسسة ببساطة إلى القول: "الذكاء الاصطناعي هو الذي اتخذ القرار" عند حدوث مشكلة.

أما الشفافية فتعني إتاحة جميع المعلومات ذات الصلة بالنظام ومخرجاته وقيوده وحوكمته للأشخاص الذين يحتاجون إليها. ولا تقتضي الشفافية أن تكشف الشركات عن الشيفرة المصدرية المملوكة لها أو عن التفاصيل الأمنية الحساسة. بل تعني توفير قدر كافٍ من المعلومات الدقيقة والقابلة للاستخدام بما يمكّن الأطراف المعنية من فهم النظام بكامل نطاقه.

قابلية التفسير وقابلية الشرح

وتساعد قابلية الشرح وقابلية التفسير الأشخاص على فهم كيفية عمل النموذج، ومعنى مخرجاته في سياق قرار فعلي. وبصياغة مبسطة، تجيب قابلية الشرح عن السؤال: "ما العوامل أو العمليات التي أدت إلى هذه النتيجة؟" بينما تجيب قابلية التفسير عن السؤال: "ماذا تعني هذه النتيجة، وكيف ينبغي للشخص استخدامها؟"

وتزداد أهمية هذه الركيزة عندما تكون القرارات ذات تبعات كبيرة، أو محل نزاع، أو خاضعة للتنظيم، أو يصعب التراجع عنها، كما في نمذجة مخاطر الائتمان على سبيل المثال.

تحسين الخصوصية

ترتبط الخصوصية ارتباطًا وثيقًا بالأمن، لكنهما مفهومان مختلفان. فالأمن يمنع الجهات غير المصرح لها من الوصول إلى البيانات، بينما تساعد الخصوصية على ضمان جمع البيانات واستخدامها وتخزينها ومشاركتها بالشكل المناسب.

وقد تنشأ عن النماذج مخاطر تتعلق بالخصوصية حتى إذا لم تكن مصممة صراحةً لمعالجة البيانات الشخصية. فقد تتضمن مجموعات البيانات المستخدمة في تدريب النموذج معلومات حساسة، كما قد تحتفظ السجلات ببيانات المستخدمين التي كان من المفترض تخزينها بصورة مؤقتة فقط. وتساعد ممارسات التحقق من صحة النماذج الشركات على ضمان أن تكون أدوات الذكاء الاصطناعي آمنة وملتزمة في الوقت نفسه بمتطلبات الخصوصية.

إدارة الإنصاف والتحيز

ويتطلب الإنصاف من المؤسسة تحديد أوجه التحيز الضارة وقياسها والحد منها ومراقبتها. ولا يعني ذلك بالضرورة أن يحصل كل شخص على النتيجة نفسها في جميع الحالات. بل يجب أن تكون أي اختلافات في المعاملة أو النتائج مبررة وقانونية وذات صلة بالمهمة، وألا تنتج عن تحيز يمكن تجنبه أو ينطوي على ضرر.

تقنيات وأساليب التحقق من صحة النموذج

وعادةً ما يتضمن التحقق من صحة النموذج مجموعة متنوعة من عمليات الفحص وأساليب التحقق.

التحقق من سلامة الأساس المفاهيمي

ويقيّم سلامة الأساس المفاهيمي المنطق والتصميم اللذين يقوم عليهما النموذج. ويبحث هذا التقييم في مدى ملاءمة المنهجية والمدخلات والافتراضات والأحكام النوعية وخيارات التصميم للقرارات التي يُفترض أن يدعمها النموذج. وتشمل عمليات التحقق من سلامة الأساس المفاهيمي ما يلي:

  • تقييم منهجية النموذج لفهم كيفية تحويله البيانات إلى مخرجات.
  • فحص الخصائص والمدخلات للتأكد من أن كل خاصية مهمة ذات صلة، ومتاحة، ومسموح باستخدامها قانونيًا.
  • اختبار الافتراضات والتأكد من توثيقها ومراقبتها.
  • تحديد القيود والعوامل المفقودة لمعرفة ما لا يدركه النموذج، وفهم الظروف التي تقل فيها موثوقيته.
  • تقييم قابلية التفسير وملاءمة الاستخدام لتحديد أسباب إنتاج النموذج لمخرجاته والمواضع التي قد يُخفق فيها.

التحقق من صحة البيانات

يساعد التحقق من صحة البيانات الفرق على تحديد ما إذا كانت البيانات المستخدمة في إنشاء النموذج وضبطه واختباره وتشغيله جديرة بالثقة. تشمل عملية التحقق من صحة البيانات ما يلي:

  • تقييم جودة البيانات. تهدف عمليات التحقق من جودة البيانات إلى ضمان أن تكون سجلات البيانات دقيقة وكاملة وذات صلة وممثلة للواقع، وأن تكون مصنفة بصورة صحيحة، ومجمّعة بطريقة قانونية، ومحمية، ومفصولة على النحو المناسب.
  • إثبات مصدر البيانات ومسارها. ينبغي أن تتيح مراجعات التحقق تتبع كل مجموعة بيانات وكل خاصية وصولًا إلى مصدر محدد ومعروف.
  • التأكد من صلة البيانات بالمهمة. ويعني ذلك التحقق من أن كل عنصر بيانات يستخدمه النموذج يعكس معلومات ترتبط بصورة فعلية بالغرض الذي صُمم النموذج من أجله.
  • التحقق من التصنيفات والمرجع الصحيح. ويضمن التحقق من صحة التصنيفات أن تمثل هذه التصنيفات النتيجة المستهدفة بدقة وملاءمة واتساق. كما يحدد المعيار المرجعي، أي أفضل أساس متاح يمكن الاستناد إليه لتحديد ما هو صحيح.

تحليل النتائج

يخدم تحليل النتائج غرضين رئيسيين. أولًا، يحدد ما إذا كانت مخرجات النموذج تتوافق مع الظروف الفعلية التي يدّعي النموذج قدرته على التنبؤ بها. ثانيًا، يبحث تحليل النتائج فيما إذا كان استخدام هذه المخرجات يساعد الشركة بالفعل على تحقيق الهدف المنشود من دون التسبب في أضرار أو تكاليف أو مخاطر غير مقبولة. وقد يتطلب تحليل النتائج من الفرق ما يلي:

  • مقارنة التنبؤات بالنتائج الفعلية. ينتظر تحليل النتائج توافر المعيار المرجعي للنموذج، أو يجمع البيانات اللازمة لتحديده، ثم يقارنه بمخرجات النموذج.
  • استخدام الاختبار الرجعي. يطبّق الاختبار الرجعي النموذج على حالات سابقة باستخدام المعلومات التي كانت متاحة فقط في ذلك الوقت، ثم يقارن تنبؤات النموذج بما حدث فعليًا.
  • فحص معدل الاستدعاء وأخطاء التنبؤ. قد تنتج النماذج التي تعاني من مشكلات نتائج إيجابية كاذبة ونتائج سلبية كاذبة. وتقيس تحليلات النتائج كلا النوعين من الأخطاء، وتقيّم الآثار المترتبة عليهما، وتحدد ما إذا كانا يتجاوزان حد المخاطر المعتمد لدى المؤسسة.
  • التحقق من المعايرة. تتحقق المعايرة مما إذا كانت الاحتمالات التي يحددها النموذج تتوافق مع المعدلات الملحوظة فعليًا. فعلى سبيل المثال، إذا حدّد النموذج احتمالًا للاحتيال قدره 70% لعدد 1,000 معاملة، فمن المفترض أن يتبين في النهاية أن نحو 700 من هذه المعاملات احتيالية بالفعل. أما إذا تأكد أن 250 معاملة فقط احتيالية، أو أن العدد بلغ 850 معاملة، فهذا يعني أن النموذج لا يقدّر المخاطر تقديرًا صحيحًا.
  • تقييم الأثر على الأعمال والعمليات. يبحث تحليل النتائج فيما إذا كان النموذج يسهم فعليًا في تحقيق الهدف الذي نُشر من أجله.

تحليل المتانة والحساسية

يساعد التحقق من متانة النموذج وحساسيته على ضمان استمرار النموذج في العمل بموثوقية عندما تكون الظروف غير مثالية أو غير معتادة أو معادية عن قصد.

ولا تُعد الحساسية أمرًا سلبيًا في حد ذاتها. فمن الطبيعي أن يكون لبعض المدخلات تأثير كبير في مخرجات النموذج. فعلى سبيل المثال، من المنطقي أن يؤدي تغيير حديث في حساب ذي امتيازات إلى تغيير درجة مخاطر الأمن السيبراني الخاصة بذلك الحساب. وتكمن المشكلة في الحساسية غير المبررة، حيث تؤدي تغييرات طفيفة أو غير ذات صلة أو روتينية إلى تأثير مفرط في سلوك النموذج.

ويمكن للفرق اختبار النموذج باستخدام ما يلي:

  • مدخلات مشوشة وغير مكتملة.تحاكي اختبارات المتانة ظروفًا مثل فقدان بعض البيانات ووجود مدخلات خاطئة، لمعرفة مدى تأثير البيانات غير المنضبطة في أداء النموذج واستجاباته. ويساعد ذلك على تجنب نقص التوافق، حيث لا يتعلم النموذج بالقدر الكافي من بيانات التدريب، ومن ثم يعجز عن التعرّف على الأنماط، وفرط التوافق، حيث يحفظ النموذج قدرًا مفرطًا من بيانات التدريب، بما في ذلك البيانات المشوشة.
  • التغييرات في الظروف. يجب أن تكون نماذج التعلم الآلي قادرة على التعامل مع تحولات التوزيع، مثل السياسات الجديدة وانقطاعات الخدمة وانحراف المفهوم، وهي الحالات التي لم تعد فيها بيانات بيئة الإنتاج تشبه البيانات المستخدمة خلال مرحلة التطوير. وقد يستخدم المراجعون بيانات من فترات زمنية لاحقة، أو بيئات جديدة، أو حالات أُنشئت عمدًا من خارج التوزيع، لمعرفة ما إذا كان أداء النموذج يتراجع إلى ما دون المستويات المقبولة.
  • الحالات الحدّية وعدم اليقين.غالبًا ما تكشف الحالات الحدّية عن افتراضات خفية يقوم عليها النموذج. ويتيح فحص استجابة النموذج لهذه السيناريوهات للفرق معرفة ما إذا كان النموذج يدرك حالات عدم اليقين ويستخدم آلية احتياطية مناسبة عند الحاجة.
  • المدخلات العدائية. يختبر التحقق من المدخلات العدائية مدى إمكانية التلاعب بالنموذج عمدًا لحمله على إصدار مخرجات خاطئة أو غير آمنة أو غير مصرّح بها أو مضللة.
  • انحراف النموذج. يمكن للفرق استخدام محاكاة الانحراف لإنشاء سيناريوهات تتغير فيها عمدًا بيانات بيئة الإنتاج أو سلوك المستخدمين أو العلاقة بين المدخلات والنتائج، ثم التحقق من مدى قدرة النموذج على التعامل مع هذا التغير بصورة منضبطة، وما إذا كانت الضوابط تستجيب على النحو المطلوب.

المقارنة المرجعية واختبارات التحدي

تقيّم المقارنة المرجعية واختبارات التحدي ما إذا كان النموذج يحقق قيمة حقيقية، وذلك بمقارنته ببدائل موثوقة. وتستخدم المؤسسات هذه الممارسات لمعرفة ما إذا كان أداء النموذج أفضل بدرجة ملموسة من أسلوب أبسط، أو نموذج سابق، أو إجراء بشري، أو نموذج منافس طُوّر بصورة مستقلة أو اختير خصيصًا للتحقق من سلوك النموذج المرشح.

  • وتُعد المعايير المرجعية، مثل النماذج السابقة المستخدمة في بيئة الإنتاج أو النماذج المنافسة، نقاطًا مرجعية لتقييم نماذج التعلم الآلي. ولا يلزم أن يتفوق النموذج الأساسي على جميع البدائل في كل مقياس من مقاييس الأداء. وإنما يتعين على الفرق فهم أوجه المفاضلة بينها حتى تتمكن من تبرير اختيار النموذج المناسب.
  • يشير اختبار التحدي إلى ممارسة أوسع نطاقًا تهدف إلى محاولة إثبات عدم ملاءمة النموذج للاستخدام المقصود منه. فإلى جانب اختبار الظروف التي يُتوقع أن يعمل فيها النموذج بكفاءة، تتناول اختبارات التحدي أيضًا أكثر سيناريوهات الإخفاق احتمالًا.

فحوصات السلامة والأمان والخصوصية

تقيّم اختبارات السلامة والأمن والخصوصية مختلف المخاطر التي قد ينشئها النموذج، غير أن كثيرًا من مواطن الضعف قد يكمن في عمليات التكامل المحيطة بنموذج التعلم الآلي لا في النموذج نفسه.

فعلى سبيل المثال، قد يتضمن النموذج ضوابط داخلية صارمة تمنعه من الكشف عن المعلومات السرية، ومع ذلك قد يكشف التطبيق مستندات خاصة إذا أخفق نظام الاسترجاع في تطبيق أذونات الوصول إلى المستندات. وبالمثل، قد يكون النموذج قادرًا على مقاومة محاولة بسيطة لكسر الحماية، لكن وكيلًا مبنيًا حوله قد ينفذ إجراءً غير آمن إذا احتوت صفحة ويب جرى استرجاعها على حقن غير مباشر للموجِّهات.

ولذلك، يتطلب التحقق الفعّال تقييم النموذج والمنظومة المحيطة به بالكامل.

التوثيق وقابلية إعادة الإنتاج

يجعل كل من التوثيق وقابلية إعادة الإنتاج عملية التحقق قائمة على أدلة يمكن تدقيقها، بدلًا من أن تقتصر على ادعاء غير رسمي بأن النموذج "يعمل".

ويمتد التوثيق على مدار دورة حياة نموذج التعلم الآلي بأكملها، بدءًا من مبررات الأعمال الأولية، ومرورًا بالتطوير والتحقق والنشر والمراقبة والتغييرات الجوهرية، وصولًا إلى سحب النموذج من الاستخدام في نهاية المطاف. ويشمل ذلك توثيق مسار تطور النموذج والحفاظ على إدارة واضحة للإصدارات، بما يتيح للمراجعين فهم كيفية تغير النموذج بمرور الوقت.

تساعد قابلية إعادة الإنتاج على ضمان قدرة مراجع مستقل ومؤهل على استخدام المواد الموثقة لإعادة تنفيذ عملية تطوير النموذج أو التحقق منه والحصول على نتائج مماثلة إلى حد كبير.

أكاديمية الذكاء الاصطناعي

توحيد الأمن والحوكمة من أجل مستقبل الذكاء الاصطناعي

بينما ترتكز هذه الحلقة من أكاديمية الذكاء الاصطناعي على أحدث التوجهات اليوم، وهو الذكاء الاصطناعي الوكيل، فإنها تستعرض حالة "شد وجذب" يعيشها قادة المخاطر والضمان بين الحوكمة والأمن. فمن الضروري إيجاد توازن وإعطاء الأولوية لعلاقة عمل تكاملية بينهما، وذلك للحصول على بيانات وذكاء اصطناعي أكثر دقة وموثوقية يمكن لمؤسستك التوسع في استخدامهما.

التحقق من صحة النموذج مقابل اختبار النموذج ومراقبته

وترتبط عملية التحقق من صحة النموذج واختباره ومراقبته ببعضها بوصفها ممارسات لضمان الجودة، لكنها تجيب عن أسئلة مختلفة في مراحل مختلفة من دورة حياة نموذج التعلم الآلي:

  • يسأل التحقق من صحة النموذج السؤال التالي: "هل النموذج ملائم وموثوق ومصمم على النحو المناسب للاستخدام المقصود منه؟"
  • أما اختبار النموذج فيسأل: "هل يستوفي النموذج في صورته النهائية معايير القبول التقنية والتجارية ومتطلبات السلامة والتشغيل المحددة مسبقًا؟"
  • أما المراقبة فتطرح السؤال: "هل يواصل النموذج بعد نشره أداءه على النحو المتوقع عند التعامل مع بيانات فعلية وفي ظروف تشغيل واقعية؟"

يُجرى اختبار النموذج على امتداد عملية التطوير، لكن التقييم الرسمي باستخدام مجموعة الاختبار يتم عادةً بعد أن تستقر الفرق على الخيارات الرئيسية لتصميم النموذج وقرارات ضبطه. وغالبًا ما يتولى الاختبار شخص لم يشارك في اتخاذ القرارات المتعلقة بتطوير النموذج. وفي الأساليب التي تستخدم train_test_split، تُستخدم أيضًا مجموعة بيانات اختبار منفصلة لم تدخل في التدريب أو ضبط المعلمات الفائقة أو اختيار عتبة القرار أو اختيار النموذج. ويتيح ذلك الحصول على تقدير موثوق وغير متحيز لكيفية أداء النموذج النهائي عند التعامل مع بيانات لم يسبق له الاطلاع عليها.

يمكن للشركات الاختيار من بين عدة أساليب لتقييم النماذج.

ففي أسلوب مجموعات الاستبعاد، على سبيل المثال، يُفصل جزء من البيانات عن مرحلتي التدريب وتطوير النموذج، ثم يُستخدم لتقييم أداء النموذج النهائي على حالات جديدة لم يسبق له التعامل معها. ويمكن للفرق استخدام التحقق المتقاطع من نوع k-fold، حيث يُدرَّب النموذج ويُختبر k مرات على أجزاء مختلفة من البيانات، ثم يُحسب متوسط النتائج. ولإجراء تحقق متقاطع أكثر صرامة، يمكن للفريق استخدام التحقق المتقاطع بترك عينة واحدة خارجًا (LOOCV)، بحيث يشمل الاختبار كل نقطة بيانات على حدة. وبصرف النظر عن الأسلوب المستخدم، يهدف اختبار النموذج إلى تقدير جودة أداء نموذج التعلم الآلي في بيئة الاستخدام الفعلية قبل نشره.

بينما يركز الاختبار على تقييم جودة النموذج، تركز المراقبة على التأكد من أن النموذج المدرَّب والمنظومة المحيطة به يواصلان العمل على النحو المتوقع بعد النشر. وتتابع المراقبة، سواء أُجريت بصورة مستمرة أو وفق جدول زمني محدد مسبقًا، مدخلات النموذج قيد التشغيل ومخرجاته وسلوكه التشغيلي. ويتيح ذلك لفرق إدارة المخاطر اكتشاف التغيرات مبكرًا، قبل أن تتفاقم إلى تراجع في الأداء أو، في أسوأ الحالات، إلى فشل.

توفر المراقبة للشركات نظام إنذار مبكرًا بشأن السلوك غير السليم للنموذج، لكنها لا تغني عن التحقق من صحة النموذج. فالتحقق من صحة النموذج عملية تقييم تكرارية تُجرى عادةً أثناء بناء فرق التطوير للنموذج. ويمكن أيضًا إجراؤها بصورة مستقلة قبل اعتماد النموذج، ثم بصورة دورية بعد ذلك.

ورغم أن التحقق من الصحة والاختبار والمراقبة عمليات منفصلة، فإن الشركات تحتاج عادةً إلى العمليات الثلاث لتحسين أداء نماذج التعلم الآلي وموثوقيتها طوال دورة حياتها.

التحقق من صحة الذكاء الاصطناعي التوليدي ووكلاء الذكاء الاصطناعي

يتطلب الذكاء الاصطناعي التوليدي (gen AI) ووكلاء الذكاء الاصطناعي ممارسات التحقق الأساسية نفسها التي تتطلبها أنظمة التعلم الآلي الأخرى. لكن هذه الأدوات قد تنطوي على مخاطر لا يمكن للتحقق من صحة النماذج التنبؤية أن يغطيها بالكامل. فتنتج أنظمة الذكاء الاصطناعي التوليدي مخرجات لا تقتصر على إجابة محددة، ويمكن للوكلاء استخدام هذه المخرجات للتخطيط لإجراءات وتنفيذها عبر أنظمة مترابطة.

وفي التعلم الآلي التقليدي، يمكن غالبًا تقييم نتيجة النموذج مباشرةً بمقارنتها بتصنيف مرجعي يمثل النتيجة الفعلية. فعلى سبيل المثال، إذا صنّف نموذج لكشف الاحتيال معاملةً بأنها "احتيال"، ثم أكد التحقيق لاحقًا وقوع الاحتيال، يكون تنبؤ النموذج صحيحًا. وإذا توقع نموذج للتنبؤ بالطلب طلبًا قدره 1150 وحدة، بينما بلغ الطلب الفعلي 1600 وحدة، فيمكن للفرق استخدام متوسط مربع الخطأ، وهو مقياس للانحدار يقيّم مدى قرب تنبؤات النموذج من القيم الفعلية، لقياس هذا الفرق بدقة.

أما مخرجات الذكاء الاصطناعي التوليدي، فلا تكون لها عادةً صياغة صحيحة واحدة، وقد لا يوجد لها جواب واحد كامل يمكن اعتباره صحيحًا. ومع ذلك، يمكن تقييم بعض المهام المقيدة، مثل الاستخراج المنظم واختيار الأدوات، بمقارنتها بمخرجات متوقعة ومحددة بوضوح. لكن بوجه عام، يعتمد سلوك النموذج بدرجة كبيرة على سياق التشغيل، الذي قد يختلف من تفاعل إلى آخر. وقد يتعرض الذكاء الاصطناعي التوليدي أيضًا للهلوسة، فيقدّم بثقة معلومات زائفة أو خاطئة استجابةً لموجّه.

لذلك، يتطلب التحقق من صحة الذكاء الاصطناعي التوليدي أن تستخدم الفرق مجموعة تقييم تضم موجّهات واقعية، ومواد مصدر معتمدة، وعناصر يُتوقع تضمينها في الإجابة، ومعايير واضحة للتقييم وإسناد الدرجات. وتتيح معايير التقييم للنموذج تقديم أكثر من إجابة مقبولة، مع اشتراط أن تتضمن كل إجابة حقائق محددة، وأن تتجنب الادعاءات غير المدعومة، وأن توضّح مواضع عدم اليقين عند وجودها.

يمكن لوكلاء الذكاء الاصطناعي وضع الخطط، ومنح صلاحيات الوصول، وتعديل السجلات، وإرسال الرسائل، وإطلاق مهام سير عمل جديدة بالكامل، بما في ذلك مهام تستعين بوكلاء جدد. ولذلك، تخضع مخرجات وكلاء الذكاء الاصطناعي لعمليات التحقق نفسها التي تخضع لها مخرجات الذكاء الاصطناعي التوليدي، مع ضرورة أن يتحقق المطورون أيضًا من صحة القرارات والإجراءات المترتبة على هذه المخرجات. وينبغي أن يستدعي أي تغيير جوهري إعادة التحقق من الصحة، مثل تغيير نموذج الأساس الذي يعتمد عليه الوكيل أو ربطه بمستودع استرجاع جديد.

مؤلف

Chrystal R. China

Staff Writer, Automation & ITOps

IBM Think

حلول ذات صلة
IBM watsonx.governance

يمكنك إدارة نماذج الذكاء الاصطناعي من أي مكان ونشرها على السحابة أو بشكل محلي باستخدام IBM® watsonx.governance®.

اكتشف watsonx.governance
حلول حوكمة الذكاء الاصطناعي

اكتشف كيف يمكن لحوكمة الذكاء الاصطناعي أن تساعد على زيادة ثقة موظفيك في الذكاء الاصطناعي وتسريع الاعتماد عليه وتعزيز الابتكار، بالإضافة إلى تحسين ثقة العملاء.

اكتشف حلول حوكمة الذكاء الاصطناعي
خدمات استشارات إدارة الذكاء الاصطناعي

تمكَّن من الاستعداد لقانون الذكاء الاصطناعي في الاتحاد الأوروبي ووضع نهج حوكمة مسؤول للذكاء الاصطناعي بمساعدة IBM Consulting.

اكتشف خدمات إدارة الذكاء الاصطناعي
اتخذ الخطوة التالية

وجّه الذكاء الاصطناعي الخاص بك وأدِره وراقبه من خلال محفظة حلول موحدة—ما يسرِّع الوصول إلى نتائج مسؤولة وشفافة وقابلة للتفسير.

  1. استكشف watsonx.governance®
  2. احجز عرضًا توضيحيًا مباشرًا