التحقق من صحة النموذج هو عملية منظمة لتحديد ما إذا كان نموذج التعلم الآلي (ML) ملائمًا للاستخدام المقصود منه.
وبدلًا من الاكتفاء بالسؤال: "هل ينتج النموذج إجابة؟"، تبحث عملية التحقق من صحة النموذج في مدى موثوقية تصميم النموذج وافتراضاته وبياناته وتنفيذه ومخرجاته وقيوده وسلوكه المستمر، بما يكفي للاعتماد عليه في القرارات التي سيتخذها الأشخاص استنادًا إليه.
يساعد التحقق من صحة النموذج الشركات على الحد من مخاطر النموذج، أي مخاطر أن ينتج النموذج نتائج غير دقيقة أو متحيزة أو غير مستقرة أو غير آمنة، أو أن يُساء استخدام نتائجه، وذلك من خلال التقييم الاستباقي لمدى كفاءة النموذج في أداء المهام المنوطة به.
وفي أبسط صور التحقق من الصحة، يمكن لمطوري النماذج أثناء مرحلة التطوير تقييم النموذج المرشح باستخدام مجموعة التحقق من الصحة، وهي مجموعة من الأمثلة يستخدمها مهندسو التعلم الآلي وعلماء البيانات للتحقق من مدى جودة تعلّم النموذج.
أما على مستوى إدارة مخاطر النماذج، فإن التحقق من صحة النموذج يكون أشمل بكثير. فعادةً ما يكون التحقق من صحة النماذج في المؤسسات تقييمًا مستقلًا يغطي دورة حياة النموذج بالكامل. إذ يراجع نموذج التعلم الآلي أشخاص لم يشاركوا في إنشائه، وتشمل المراجعة كيفية تطوير النموذج وإطلاقه واستخدامه ومراقبته وتعديله، وصولًا إلى إيقافه عن العمل في نهاية المطاف.
وتُثبت عملية التحقق الناجحة خمسة أمور رئيسية.
وتتناسب عادةً درجة الصرامة في عملية التحقق من صحة النموذج مع الغرض الذي يُستخدم من أجله. فأداة داخلية محدودة التأثير للتنبؤ لا تستدعي مستوى التدقيق نفسه الذي يتطلبه نموذج يُستخدم للموافقة على القروض العقارية أو لاكتشاف معاملات مصرفية احتيالية.
والأهم أن التحقق من صحة النموذج ليس عملية موافقة تُجرى مرة واحدة وتنتهي. فحتى النماذج التي تحقق أداءً جيدًا في البداية قد تتعرض للانحراف ويتراجع أداؤها بعد إطلاقها. لذلك، غالبًا ما يكون التحقق المستمر من صحة نماذج التعلم الآلي جزءًا أساسيًا من ممارسات حوكمة الذكاء الاصطناعي (AI) في المؤسسات.
ووفقًا لإطار عمل إدارة مخاطر الذكاء الاصطناعي الصادر عن المعهد الوطني للمعايير والتقنية (NIST)، تشمل ركائز الثقة في النماذج: الصلاحية والموثوقية، والسلامة، والأمن والمرونة، والمساءلة والشفافية، وقابلية الشرح والتفسير، وتعزيز الخصوصية، والإنصاف وإدارة التحيز.
يساعد التحقق من صحة نماذج التعلم الآلي على بناء الثقة في النموذج والحفاظ عليها، والمقصود بها مستوى الثقة المبررة في أن النموذج سيتصرف على النحو الملائم. وتتخذ الشركات قرارات استنادًا إلى مخرجات نماذج التعلم الآلي، لذلك لا تقتصر الثقة في النموذج على كونها هدفًا مرتبطًا بالسمعة فحسب. بل إنها أساس لاستخدام الذكاء الاصطناعي بصورة آمنة وفعالة وقابلة للتوسع. وفي الواقع، كثيرًا ما تسهم الأهداف المتعلقة بالثقة في النموذج في تحديد ممارسات التحقق من صحته.
علاوةً على ذلك، لا يمكن اعتبار النموذج جديرًا بالثقة لمجرد أن مطوره يصفه بأنه "ذكاء اصطناعي مسؤول". بل يجب أن يكون النموذج قادرًا على أداء مهامه بموثوقية، وحماية الأشخاص والبيانات، والصمود أمام إساءة الاستخدام، وأن يكون مفهومًا وخاضعًا للحوكمة. لا بد من اكتساب هذا المستوى من الثقة من خلال ضوابط يمكن إثباتها، وجمع الأدلة بصورة مستمرة أثناء التحقق من صحة نماذج الذكاء الاصطناعي.
ومن الأطر واسعة الاستخدام لفهم ركائز الثقة في النماذج إطار عمل إدارة مخاطر الذكاء الاصطناعي الصادر عن المعهد الوطني للمعايير والتقنية (NIST). ويحدد الإطار سبع خصائص مترابطة للذكاء الاصطناعي الجدير بالثقة.
يجب أن يكون النموذج الجدير بالثقة صالحًا لأداء المهمة المقصودة، وأن يحافظ على موثوقية أدائه بمرور الوقت وفي مختلف الظروف المتوقعة. وتتعلق الصلاحية بما إذا كان النموذج يقيس أو يتنبأ أو يصنّف أو يولّد بالفعل ما يدّعي أنه يقوم به.
أما الموثوقية فتتعلق بمدى قدرة النموذج على تقديم أداء متسق ويمكن الاعتماد عليه عند تلقي مدخلات متشابهة، بما في ذلك المدخلات الواردة من مستخدمين وبيئات ومصادر بيانات وفترات زمنية مختلفة.
تركز ركيزة السلامة على ما إذا كان النموذج قد يتسبب في إلحاق ضرر بالأشخاص أو الممتلكات أو المؤسسات أو المجتمع، حتى عندما يكون، من الناحية التقنية، يعمل على النحو الذي صُمم من أجله.
فقد يكون النموذج دقيقًا، لكنه غير آمن في الوقت نفسه. فعلى سبيل المثال، قد يتمكن برنامج دردشة آلي لخدمة العملاء من استرجاع معلومات الحساب بصورة صحيحة، ولكن إذا أمكن التلاعب به للكشف عن بيانات حساسة، فإنه يظل غير آمن للاستخدام الفعلي. وتتطلب السلامة من الفرق تحديد الأضرار التي يمكن توقعها قبل نشر النموذج، ومعالجتها بصورة استباقية من خلال تصميم النظام.
أما الأمن فيهدف إلى حماية النموذج وبياناته وواجهاته والتطبيق المحيط به من الوصول الضار أو التلاعب. وفي أنظمة الذكاء الاصطناعي الحديثة، يمتد سطح الهجوم إلى ما هو أبعد بكثير من أوزان النموذج. فهو يشمل أيضًا بيانات التدريب، ومصادر الاسترجاع، والمطالبات، وواجهات برمجة التطبيقات (APIs)، والمكونات الإضافية، وهويات المستخدمين، والبنية الأساسية للنشر، والسجلات، وسلاسل توريد النماذج. ولذلك، يجب أن تكون ضوابط الأمن قادرة على إدارة سطح الهجوم بأكمله.
وتشير المرونة إلى قدرة النموذج على مواصلة العمل بأمان، أو التعافي بالشكل المناسب، أو التوقف بصورة آمنة ومنضبطة إذا حدث خلل ما. ويعني ذلك التحقق من قدرة النماذج على التعامل مع الاضطرابات غير المتعمدة، إلى جانب الهجمات الإلكترونية. وفي السياقات ذات التأثير الكبير، غالبًا ما تكون القدرة على التوقف بأمان أهم من مجرد استمرار توفر النظام.
وتعني المساءلة وجود مسؤولين محددين يتحملون مسؤولية تصميم النموذج ونشره ونتائجه والإجراءات التصحيحية المتعلقة به. فمن دون المساءلة، قد تلجأ المؤسسة ببساطة إلى القول: "الذكاء الاصطناعي هو الذي اتخذ القرار" عند حدوث مشكلة.
أما الشفافية فتعني إتاحة جميع المعلومات ذات الصلة بالنظام ومخرجاته وقيوده وحوكمته للأشخاص الذين يحتاجون إليها. ولا تقتضي الشفافية أن تكشف الشركات عن الشيفرة المصدرية المملوكة لها أو عن التفاصيل الأمنية الحساسة. بل تعني توفير قدر كافٍ من المعلومات الدقيقة والقابلة للاستخدام بما يمكّن الأطراف المعنية من فهم النظام بكامل نطاقه.
وتساعد قابلية الشرح وقابلية التفسير الأشخاص على فهم كيفية عمل النموذج، ومعنى مخرجاته في سياق قرار فعلي. وبصياغة مبسطة، تجيب قابلية الشرح عن السؤال: "ما العوامل أو العمليات التي أدت إلى هذه النتيجة؟" بينما تجيب قابلية التفسير عن السؤال: "ماذا تعني هذه النتيجة، وكيف ينبغي للشخص استخدامها؟"
وتزداد أهمية هذه الركيزة عندما تكون القرارات ذات تبعات كبيرة، أو محل نزاع، أو خاضعة للتنظيم، أو يصعب التراجع عنها، كما في نمذجة مخاطر الائتمان على سبيل المثال.
ترتبط الخصوصية ارتباطًا وثيقًا بالأمن، لكنهما مفهومان مختلفان. فالأمن يمنع الجهات غير المصرح لها من الوصول إلى البيانات، بينما تساعد الخصوصية على ضمان جمع البيانات واستخدامها وتخزينها ومشاركتها بالشكل المناسب.
وقد تنشأ عن النماذج مخاطر تتعلق بالخصوصية حتى إذا لم تكن مصممة صراحةً لمعالجة البيانات الشخصية. فقد تتضمن مجموعات البيانات المستخدمة في تدريب النموذج معلومات حساسة، كما قد تحتفظ السجلات ببيانات المستخدمين التي كان من المفترض تخزينها بصورة مؤقتة فقط. وتساعد ممارسات التحقق من صحة النماذج الشركات على ضمان أن تكون أدوات الذكاء الاصطناعي آمنة وملتزمة في الوقت نفسه بمتطلبات الخصوصية.
ويتطلب الإنصاف من المؤسسة تحديد أوجه التحيز الضارة وقياسها والحد منها ومراقبتها. ولا يعني ذلك بالضرورة أن يحصل كل شخص على النتيجة نفسها في جميع الحالات. بل يجب أن تكون أي اختلافات في المعاملة أو النتائج مبررة وقانونية وذات صلة بالمهمة، وألا تنتج عن تحيز يمكن تجنبه أو ينطوي على ضرر.
احصل على رؤى منسقة حول أهم أخبار الذكاء الاصطناعي وأكثرها إثارةً للاهتمام. اشترِك في خدمة رسائل Think الإخبارية الأسبوعية. راجع بيان الخصوصية لشركة IBM.
وعادةً ما يتضمن التحقق من صحة النموذج مجموعة متنوعة من عمليات الفحص وأساليب التحقق.
ويقيّم سلامة الأساس المفاهيمي المنطق والتصميم اللذين يقوم عليهما النموذج. ويبحث هذا التقييم في مدى ملاءمة المنهجية والمدخلات والافتراضات والأحكام النوعية وخيارات التصميم للقرارات التي يُفترض أن يدعمها النموذج. وتشمل عمليات التحقق من سلامة الأساس المفاهيمي ما يلي:
يساعد التحقق من صحة البيانات الفرق على تحديد ما إذا كانت البيانات المستخدمة في إنشاء النموذج وضبطه واختباره وتشغيله جديرة بالثقة. تشمل عملية التحقق من صحة البيانات ما يلي:
يخدم تحليل النتائج غرضين رئيسيين. أولًا، يحدد ما إذا كانت مخرجات النموذج تتوافق مع الظروف الفعلية التي يدّعي النموذج قدرته على التنبؤ بها. ثانيًا، يبحث تحليل النتائج فيما إذا كان استخدام هذه المخرجات يساعد الشركة بالفعل على تحقيق الهدف المنشود من دون التسبب في أضرار أو تكاليف أو مخاطر غير مقبولة. وقد يتطلب تحليل النتائج من الفرق ما يلي:
يساعد التحقق من متانة النموذج وحساسيته على ضمان استمرار النموذج في العمل بموثوقية عندما تكون الظروف غير مثالية أو غير معتادة أو معادية عن قصد.
ولا تُعد الحساسية أمرًا سلبيًا في حد ذاتها. فمن الطبيعي أن يكون لبعض المدخلات تأثير كبير في مخرجات النموذج. فعلى سبيل المثال، من المنطقي أن يؤدي تغيير حديث في حساب ذي امتيازات إلى تغيير درجة مخاطر الأمن السيبراني الخاصة بذلك الحساب. وتكمن المشكلة في الحساسية غير المبررة، حيث تؤدي تغييرات طفيفة أو غير ذات صلة أو روتينية إلى تأثير مفرط في سلوك النموذج.
ويمكن للفرق اختبار النموذج باستخدام ما يلي:
تقيّم المقارنة المرجعية واختبارات التحدي ما إذا كان النموذج يحقق قيمة حقيقية، وذلك بمقارنته ببدائل موثوقة. وتستخدم المؤسسات هذه الممارسات لمعرفة ما إذا كان أداء النموذج أفضل بدرجة ملموسة من أسلوب أبسط، أو نموذج سابق، أو إجراء بشري، أو نموذج منافس طُوّر بصورة مستقلة أو اختير خصيصًا للتحقق من سلوك النموذج المرشح.
تقيّم اختبارات السلامة والأمن والخصوصية مختلف المخاطر التي قد ينشئها النموذج، غير أن كثيرًا من مواطن الضعف قد يكمن في عمليات التكامل المحيطة بنموذج التعلم الآلي لا في النموذج نفسه.
فعلى سبيل المثال، قد يتضمن النموذج ضوابط داخلية صارمة تمنعه من الكشف عن المعلومات السرية، ومع ذلك قد يكشف التطبيق مستندات خاصة إذا أخفق نظام الاسترجاع في تطبيق أذونات الوصول إلى المستندات. وبالمثل، قد يكون النموذج قادرًا على مقاومة محاولة بسيطة لكسر الحماية، لكن وكيلًا مبنيًا حوله قد ينفذ إجراءً غير آمن إذا احتوت صفحة ويب جرى استرجاعها على حقن غير مباشر للموجِّهات.
ولذلك، يتطلب التحقق الفعّال تقييم النموذج والمنظومة المحيطة به بالكامل.
يجعل كل من التوثيق وقابلية إعادة الإنتاج عملية التحقق قائمة على أدلة يمكن تدقيقها، بدلًا من أن تقتصر على ادعاء غير رسمي بأن النموذج "يعمل".
ويمتد التوثيق على مدار دورة حياة نموذج التعلم الآلي بأكملها، بدءًا من مبررات الأعمال الأولية، ومرورًا بالتطوير والتحقق والنشر والمراقبة والتغييرات الجوهرية، وصولًا إلى سحب النموذج من الاستخدام في نهاية المطاف. ويشمل ذلك توثيق مسار تطور النموذج والحفاظ على إدارة واضحة للإصدارات، بما يتيح للمراجعين فهم كيفية تغير النموذج بمرور الوقت.
تساعد قابلية إعادة الإنتاج على ضمان قدرة مراجع مستقل ومؤهل على استخدام المواد الموثقة لإعادة تنفيذ عملية تطوير النموذج أو التحقق منه والحصول على نتائج مماثلة إلى حد كبير.
وترتبط عملية التحقق من صحة النموذج واختباره ومراقبته ببعضها بوصفها ممارسات لضمان الجودة، لكنها تجيب عن أسئلة مختلفة في مراحل مختلفة من دورة حياة نموذج التعلم الآلي:
يُجرى اختبار النموذج على امتداد عملية التطوير، لكن التقييم الرسمي باستخدام مجموعة الاختبار يتم عادةً بعد أن تستقر الفرق على الخيارات الرئيسية لتصميم النموذج وقرارات ضبطه. وغالبًا ما يتولى الاختبار شخص لم يشارك في اتخاذ القرارات المتعلقة بتطوير النموذج. وفي الأساليب التي تستخدم train_test_split، تُستخدم أيضًا مجموعة بيانات اختبار منفصلة لم تدخل في التدريب أو ضبط المعلمات الفائقة أو اختيار عتبة القرار أو اختيار النموذج. ويتيح ذلك الحصول على تقدير موثوق وغير متحيز لكيفية أداء النموذج النهائي عند التعامل مع بيانات لم يسبق له الاطلاع عليها.
يمكن للشركات الاختيار من بين عدة أساليب لتقييم النماذج.
ففي أسلوب مجموعات الاستبعاد، على سبيل المثال، يُفصل جزء من البيانات عن مرحلتي التدريب وتطوير النموذج، ثم يُستخدم لتقييم أداء النموذج النهائي على حالات جديدة لم يسبق له التعامل معها. ويمكن للفرق استخدام التحقق المتقاطع من نوع k-fold، حيث يُدرَّب النموذج ويُختبر k مرات على أجزاء مختلفة من البيانات، ثم يُحسب متوسط النتائج. ولإجراء تحقق متقاطع أكثر صرامة، يمكن للفريق استخدام التحقق المتقاطع بترك عينة واحدة خارجًا (LOOCV)، بحيث يشمل الاختبار كل نقطة بيانات على حدة. وبصرف النظر عن الأسلوب المستخدم، يهدف اختبار النموذج إلى تقدير جودة أداء نموذج التعلم الآلي في بيئة الاستخدام الفعلية قبل نشره.
بينما يركز الاختبار على تقييم جودة النموذج، تركز المراقبة على التأكد من أن النموذج المدرَّب والمنظومة المحيطة به يواصلان العمل على النحو المتوقع بعد النشر. وتتابع المراقبة، سواء أُجريت بصورة مستمرة أو وفق جدول زمني محدد مسبقًا، مدخلات النموذج قيد التشغيل ومخرجاته وسلوكه التشغيلي. ويتيح ذلك لفرق إدارة المخاطر اكتشاف التغيرات مبكرًا، قبل أن تتفاقم إلى تراجع في الأداء أو، في أسوأ الحالات، إلى فشل.
توفر المراقبة للشركات نظام إنذار مبكرًا بشأن السلوك غير السليم للنموذج، لكنها لا تغني عن التحقق من صحة النموذج. فالتحقق من صحة النموذج عملية تقييم تكرارية تُجرى عادةً أثناء بناء فرق التطوير للنموذج. ويمكن أيضًا إجراؤها بصورة مستقلة قبل اعتماد النموذج، ثم بصورة دورية بعد ذلك.
ورغم أن التحقق من الصحة والاختبار والمراقبة عمليات منفصلة، فإن الشركات تحتاج عادةً إلى العمليات الثلاث لتحسين أداء نماذج التعلم الآلي وموثوقيتها طوال دورة حياتها.
يتطلب الذكاء الاصطناعي التوليدي (gen AI) ووكلاء الذكاء الاصطناعي ممارسات التحقق الأساسية نفسها التي تتطلبها أنظمة التعلم الآلي الأخرى. لكن هذه الأدوات قد تنطوي على مخاطر لا يمكن للتحقق من صحة النماذج التنبؤية أن يغطيها بالكامل. فتنتج أنظمة الذكاء الاصطناعي التوليدي مخرجات لا تقتصر على إجابة محددة، ويمكن للوكلاء استخدام هذه المخرجات للتخطيط لإجراءات وتنفيذها عبر أنظمة مترابطة.
وفي التعلم الآلي التقليدي، يمكن غالبًا تقييم نتيجة النموذج مباشرةً بمقارنتها بتصنيف مرجعي يمثل النتيجة الفعلية. فعلى سبيل المثال، إذا صنّف نموذج لكشف الاحتيال معاملةً بأنها "احتيال"، ثم أكد التحقيق لاحقًا وقوع الاحتيال، يكون تنبؤ النموذج صحيحًا. وإذا توقع نموذج للتنبؤ بالطلب طلبًا قدره 1150 وحدة، بينما بلغ الطلب الفعلي 1600 وحدة، فيمكن للفرق استخدام متوسط مربع الخطأ، وهو مقياس للانحدار يقيّم مدى قرب تنبؤات النموذج من القيم الفعلية، لقياس هذا الفرق بدقة.
أما مخرجات الذكاء الاصطناعي التوليدي، فلا تكون لها عادةً صياغة صحيحة واحدة، وقد لا يوجد لها جواب واحد كامل يمكن اعتباره صحيحًا. ومع ذلك، يمكن تقييم بعض المهام المقيدة، مثل الاستخراج المنظم واختيار الأدوات، بمقارنتها بمخرجات متوقعة ومحددة بوضوح. لكن بوجه عام، يعتمد سلوك النموذج بدرجة كبيرة على سياق التشغيل، الذي قد يختلف من تفاعل إلى آخر. وقد يتعرض الذكاء الاصطناعي التوليدي أيضًا للهلوسة، فيقدّم بثقة معلومات زائفة أو خاطئة استجابةً لموجّه.
لذلك، يتطلب التحقق من صحة الذكاء الاصطناعي التوليدي أن تستخدم الفرق مجموعة تقييم تضم موجّهات واقعية، ومواد مصدر معتمدة، وعناصر يُتوقع تضمينها في الإجابة، ومعايير واضحة للتقييم وإسناد الدرجات. وتتيح معايير التقييم للنموذج تقديم أكثر من إجابة مقبولة، مع اشتراط أن تتضمن كل إجابة حقائق محددة، وأن تتجنب الادعاءات غير المدعومة، وأن توضّح مواضع عدم اليقين عند وجودها.
يمكن لوكلاء الذكاء الاصطناعي وضع الخطط، ومنح صلاحيات الوصول، وتعديل السجلات، وإرسال الرسائل، وإطلاق مهام سير عمل جديدة بالكامل، بما في ذلك مهام تستعين بوكلاء جدد. ولذلك، تخضع مخرجات وكلاء الذكاء الاصطناعي لعمليات التحقق نفسها التي تخضع لها مخرجات الذكاء الاصطناعي التوليدي، مع ضرورة أن يتحقق المطورون أيضًا من صحة القرارات والإجراءات المترتبة على هذه المخرجات. وينبغي أن يستدعي أي تغيير جوهري إعادة التحقق من الصحة، مثل تغيير نموذج الأساس الذي يعتمد عليه الوكيل أو ربطه بمستودع استرجاع جديد.
يمكنك إدارة نماذج الذكاء الاصطناعي من أي مكان ونشرها على السحابة أو بشكل محلي باستخدام IBM® watsonx.governance®.
اكتشف كيف يمكن لحوكمة الذكاء الاصطناعي أن تساعد على زيادة ثقة موظفيك في الذكاء الاصطناعي وتسريع الاعتماد عليه وتعزيز الابتكار، بالإضافة إلى تحسين ثقة العملاء.
تمكَّن من الاستعداد لقانون الذكاء الاصطناعي في الاتحاد الأوروبي ووضع نهج حوكمة مسؤول للذكاء الاصطناعي بمساعدة IBM Consulting.