ما المقصود بتصوُّر البيانات في التعلم الآلي؟

تاريخ النشر 4 مايو 2026
By Jobit Varughese

شرح تصوُّر البيانات

تصوُّر البيانات هو تمثيل البيانات بصريًا باستخدام عناصر مثل المخططات والرسوم البيانية ولوحات المعلومات. ويساعد على توضيح البيانات المعقدة للأطراف المعنية أو للجمهور غير المتخصص، ما يُتيح لهم الاستفادة منها في اتخاذ القرارات.

في التعلم الآلي (ML)، يتجاوز الأمر مجرد إنشاء لوحة معلومات أو تقرير. فهو يشمل إنشاء نماذج التعلم الآلي وتصحيح أخطائها وتحسينها. ويُستخدم لفحص البيانات وتحليلها قبل التدريب، ومراقبة ما يحدث أثناء التدريب، وتشخيص ما سار على نحو صحيح أو خطأ بعد التقييم. فهو يركِّز على التحليل والاستقصاء أكثر من مجرد عرض البيانات. 

لكن في الممارسة العملية، يتداخل الجانبان. يستخدم الممارس المتمرس في مجال التعلم الآلي أو المتخصص في علم البيانات تصوُّر البيانات لاكتشاف المشكلات وتحسين النماذج، كما يستخدمه لتوضيح النتائج للآخرين وتعزيز الثقة في مخرجات النماذج.

أهمية تصوُّر البيانات في التعلم الآلي

يؤثِّر تصور البيانات في التعلم الآلي بشكل مباشر في جودة نماذجك والقرارات التي تتخذها ومدى فهم الآخرين لعملك.

  • يكتشف مشكلات البيانات مبكرًا: قبل إنشاء أي نموذج، يجب أن تكون بياناتك نظيفةً وموثوقًا بها. تكمن المشكلة في أن معظم مشكلات جودة البيانات لا تظهر بوضوح في جداول البيانات، لكنها تصبح واضحةً عند عرضها في مخطط.
  • يكشف العلاقات التي لا تظهرها الإحصاءات الموجزة: لا تقدِّم الأرقام، مثل المتوسطات ومعاملات الارتباط، سوى جزء من الصورة. قد يكون لمتغيرين مُعامل الارتباط نفسه، بينما يختلف سلوكهما تمامًا في الواقع. يكشف تصوُّر البيانات شكل العلاقات، وليس قوتها فحسب.
  • يدعم قرارات اختيار الميزات وهندسة الميزات: يُعَد تحديد الميزات التي ينبغي الاحتفاظ بها أو تحويلها أو استبعادها من أهم جوانب التعلم الآلي وأكثرها صعوبةً. يساعد تصوُّر البيانات على اتخاذ هذه القرارات استنادًا إلى أسس أكثر وضوحًا وموضوعيةً.
  • يكشف أوجه قصور النماذج: قد يحقق النموذج دقةً تبلغ 97% ومع ذلك يظل غير موثوق به تمامًا، وهو أمر لن يكشفه مقياس واحد بمفرده. تتجاوز أدوات تصوُّر البيانات الأرقام الإجمالية التي قد تكون مضللةً، وتكشف بدقة مواضع قصور النموذج وكيفية حدوثه.
  • يساعد الفِرق غير التقنية على اتخاذ قرارات مدروسة: لن يتولى المسؤولون التنفيذيون وقادة المنتجات والعملاء التدقيق في مخططات الخسارة أو تقارير المقاييس التفصيلية. إنهم بحاجة إلى معلومات يمكنهم استيعابها بسرعة. تحوِّل التصورات الجيدة أداء النموذج إلى رسوم مرئية واضحة وسهلة الفهم يمكن استيعابها بسهولة. ولهذا تكتسب لوحات المعلومات والملخصات المرئية البسيطة أهميةً كبيرةً.

ما دور تصوُّر البيانات في سير عمل التعلم الآلي (ML)؟

يمتد تصوُّر البيانات عبر سير عمل التعلم الآلي (ML) بالكامل، بدءًا من لحظة استلام البيانات الأوَّلية وحتى التقييم النهائي للنموذج. إليك كيفية استخدامه في كل مرحلة. ستتم مناقشة تقنيات تصوُّر البيانات المذكورة في كل خطوة بالتفصيل في الأقسام اللاحقة.

جمع البيانات وفحوصات الجودة الأوَّلية

قبل البدء بأي تحليل، عليك أولًا فهم طبيعة البيانات التي تتعامل معها. ويعني ذلك التحقق من القيم المفقودة وأنواع البيانات غير المتسقة والسجلات المكررة، لأن أي مشكلة هيكلية في البيانات في هذه المرحلة قد تؤثِّر سلبًا في جميع المراحل اللاحقة دون أن تكون واضحةً. توفِّر الخرائط الحرارية للقيم المفقودة ومخططات توزيع أنواع البيانات ومخططات تكرار السجلات صورةً سريعةً وموثوقًا بها عن جودة البيانات قبل استثمار الوقت في بناء النماذج استنادًا إليها.

التحليل الاستكشافي للبيانات (EDA)

يساعد التحليل الاستكشافي للبيانات على فهم بنية مجموعة البيانات وتوزيعاتها والعلاقات بينها قبل البدء في بناء أي نموذج، وذلك باستخدام المدرجات التكرارية ومخططات التشتت ومصفوفات الارتباط ومخططات الصندوق ومخططات الأزواج للكشف عن الأنماط والحالات الشاذة والعلاقات التي لا يمكن للأرقام الأوَّلية وحدها إظهارها.  يتسم التحليل الاستكشافي للبيانات (EDA) بطبيعته بالتكرار: إذ تتصور جانبًا من البيانات، وتضع فرضيةً، وتختبرها، ثم تُعيد تصوُّر البيانات حتى تصل إلى فهم حقيقي لما تكشفه.

هندسة الميزات

بعد فهم البيانات الأوَّلية، تبدأ في تحويل الميزات واختيار المناسب منها للنموذج. يُتيح لك تصوُّر البيانات في هذه المرحلة التحقق من أن عمليات التحويل تحقق النتائج المتوقعة، ويساعدك على تحديد الميزات المفيدة فعليًا. يساعد فهم مخططات التوزيع ومخططات أهمية الميزات أو كيفية سلوك الميزات عبر المجموعات المستهدفة المختلفة على تحويل المعالجة المسبقة من إجراءات عشوائية إلى خيارات تستند إلى مبررات واضحة.

تدريب النماذج

أثناء تدريب نموذج التعلم الآلي، يتحول دور التصور من فحص البيانات إلى تتبُّع عملية تعلم النموذج. تكشف المخططات، مثل منحنيات التعلم أو الخسارة، ما إذا كان أداء النموذج يتحسن أو يستقر أو يعاني من فرط التخصيص. تُتيح لك هذه المعلومات ضبط المَعلمات الفائقة بدقة أو تعديل التنظيم أو تغيير مدة التدريب قبل اكتمال المهمة.

تقييم النماذج

بعد التدريب، يُتيح لك التصور تجاوز الاعتماد على قيمة واحدة للدقة والوصول إلى فهم حقيقي لأداء النموذج. تكشف مصفوفات الالتباس ومنحنيات ROC ومنحنيات الدقة/الاستدعاء ومخططات القيم المتبقية جوانب مختلفة من سلوك النموذج. فهي توضِّح تفاصيل الأداء حسب الفئة وعبر العتبات ونطاق القيم المتوقعة، بحيث لا تعرف مستوى أداء النموذج فحسب، بل أيضًا مواضع نجاحه وأوجه قصوره.

أنواع تقنيات تصوُّر البيانات في التعلم الآلي 

يتطلب فهم أنواع تصوُّر البيانات المستخدمة في التعلم الآلي التفكير من منظور حالات الاستخدام، وليس مجرد أسماء المخططات. فيما يلي عرض منظم لهذه الأنواع.

تصورات التحليل الاستكشافي للبيانات (EDA)

المدرجات التكرارية

يوضِّح المدرج التكراري كيفية توزيع ميزة رقمية واحدة. فهو يقسِّم القيم إلى فئات على المحور x، ويعرض عدد نقاط البيانات التي تقع ضمن كل فئة على المحور y. في Python، يُتيح رسم مدرج تكراري باستخدام أدوات مثل Matplotlib أو Seaborn معرفة إذا ما كان توزيع الميزة طبيعيًا أو منحرفًا إلى اليمين أو ثنائي المنوال أو قريبًا من التوزيع المنتظم.

يشير كل نمط إلى خطوة مختلفة من خطوات المعالجة المسبقة. فعلى سبيل المثال، قد ترسم مدرجًا تكراريًا لأسعار المنتجات وتجد أن معظمها يقل عن 50 دولارًا أمريكيًا، مع امتداد طويل للتوزيع يصل إلى 500 دولار أمريكي. يشير هذا النمط إلى أن تطبيق تحويل لوغاريتمي على الميزة قبل استخدامها في النموذج قد يؤدي إلى نتائج أفضل.

مخططات التشتت

تعرض مخططات التشتت متغيرين رقميين على المحورين x وy، بحيث يتم تمثيل كل نقطة بيانات بنقطة على المخطط. تفيد هذه المخططات في اكتشاف الأنماط الخطية وغير الخطية، وتحديد مواضع تشكِّل التجمعات، ورصد القيم المتطرفة التي تقع بعيدًا عن بقية البيانات. فعلى سبيل المثال، قد يُظهر رسم حجم المنزل مقابل سعر البيع اتجاهًا تصاعديًا واضحًا حتى الوصول إلى حد معين للحجم، ثم تستقر الأسعار بعد ذلك، وهو نمط يستحق التحليل قبل التدريب.

مصفوفة الارتباط (الخريطة الحرارية)

مصفوفة الارتباط تعرض الارتباط الثنائي بين كل ميزتين رقميتين في مجموعة البيانات. وعند عرضها في صورة خريطة حرارية، حيث يشير لون كل خلية إلى قوة الارتباط، فإنها تُتيح اكتشاف التعدد الخطي بنظرة سريعة. غالبًا ما تكون الميزات التي يبلغ مُعامل الارتباط بينها 0.95 أو أكثر مرشحةً للاستبعاد أثناء اختيار الميزات، لأنها تتضمن معلومات متكررة. 

لا يقيس الارتباط سوى العلاقات الخطية، لذلك فإن مُعامل الارتباط القريب من الصفر لا يعني أن الميزتين مستقلتان عن بعضهما. فعلى سبيل المثال، غالبًا ما تُظهر ميزتا "إجمالي عدد الغرف" و"إجمالي عدد غرف النوم" في مجموعة بيانات خاصة بالمساكن ارتباطًا مرتفعًا للغاية، ولا يضيف الاحتفاظ بهما معًا أي معلومات جديدة إلى النموذج.

مخططات الصندوق

تقدِّم مخططات الصندوق ملخصًا سريعًا لكيفية توزيع المتغير من خلال عرض الوسيط والنطاق الرئيسي للبيانات (المدى الربيعي) وأي قيم خارجية. وتكون مفيدةً بشكل خاص في التعلم الآلي لمقارنة الاختلاف في ميزة رقمية بين مجموعات مستهدفة مختلفة، مثل مقارنة دخل الأشخاص الذين تعثروا في سداد قرض بدخل الأشخاص الذين لم يتعثروا في السداد.

مخططات الأزواج

تنشئ مخططات الأزواج شبكةً من مخططات التشتت لكل مجموعة ثنائية من الميزات الرقمية في مجموعة البيانات، مع عرض مدرجات تكرارية أو مخططات كثافة على طول القطر. تُنشئ الدالة pairplot() في Seaborn هذه المخططات باستخدام سطر واحد فقط من التعليمات البرمجية. بالنسبة إلى مجموعات البيانات التي تضم ما يصل إلى 10 إلى 15 ميزةً، توفِّر مخططات الأزواج نظرةً عامةً سريعةً متعددة المتغيرات، كان سيتطلب الحصول عليها إنشاء العديد من المخططات المنفردة. 

تُشير الميزات، في هذا السياق، ببساطة إلى الأعمدة الفردية في مجموعة البيانات، مثل العمر أو الدخل أو معدل تكرار الشراء. فعلى سبيل المثال، قد يكشف مخطط الأزواج لمجموعة بيانات المبيعات بسرعة أن الإيرادات وعدد الوحدات المباعة يتغيران بشكل متقارب، في حين أن معدل الخصم لا يرتبط كثيرًا بأيٍّ منهما. يمكن لمثل هذه الرؤى أن تساعدك على تحديد الميزات التي تستحق الاحتفاظ بها.

مخططات الكثافة

تشبه مخططات الكثافة المدرجات التكرارية، لكنها تقدِّم تمثيلًا أكثر سلاسةً لتوزيع البيانات. وهي مفيدة لمقارنة كيفية توزيع إحدى الميزات بين مجموعتين. عندما تكون المنحنيات متباعدةً بوضوح، تكون للميزة عادةً قدرة تنبؤية قوية. أما إذا تداخلت المنحنيات، فتكون الميزة أقل فائدةً في التنبؤ.

فعلى سبيل المثال، إذا رسمت مخطط كثافة "معدل تكرار الشراء" للعملاء الأوفياء مقارنةً بالعملاء الذين توقفوا عن التعامل مع الشركة، وشكَّل الخطان قمَّتين منفصلتين بوضوح، فهذه إشارة جيدة إلى أن هذه الميزة ستكون مفيدةً في نموذج للتنبؤ بتوقف العملاء عن التعامل مع الشركة.

تصورات هندسة الميزات

مخططات أهمية الميزات

يمكنك استخراج درجات أهمية الميزات بعد تدريب النموذج وعرضها في مخطط شريطي لمعرفة الميزات الأكثر أهميةً. تُعَد النماذج القائمة على أشجار القرار مثالًا شائعًا على ذلك، إذ توفِّر درجات الأهمية هذه بشكل مباشر. غالبًا ما تكون الميزات ذات الأهمية المنخفضة للغاية مرشحةً جيدةً للاستبعاد، ويمكن للأدوات مثل Plotly أو Matplotlib إنشاء هذه المخططات بسهولة حتى عند وجود عدد كبير من الميزات. 

مخططات مقارنة التوزيعات

تقارن هذه المخططات توزيع الميزة قبل إجراء التحويل وبعده (التحجيم أو الترميز أو التحويل اللوغاريتمي)، وتتحقق مما إذا كانت خطوة المعالجة المسبقة قد حققت التأثير المطلوب. تكتسب هذه المقارنة أهميتها لأن إدخال ميزة لم يتم تحويلها بالشكل المناسب إلى النموذج قد يؤدي إلى تحيُّز التنبؤات، ويمكن لمخطط بسيط يعرض التوزيعين جنبًا إلى جنب اكتشاف هذه المشكلة قبل الوصول إلى مرحلة التدريب. 

تصورات تدريب النماذج

منحنيات التعلم

منحنى التعلم هو أحد أنواع تصورات تدريب النماذج، ويعرض أداء النموذج (الدقة أو الخسارة) على المحور y مقابل حجم مجموعة التدريب أو تكرارات التدريب على المحور السيني، مع استخدام خطين منفصلين للتدريب والتحقق من الصحة.

يُتيح هذا التصور وحده تشخيص أكثر حالتين شيوعًا لقصور نماذج التعلم الآلي (ML): فرط التخصيص (وجود فجوة كبيرة بين أداء التدريب وأداء التحقق من الصحة) ونقص التخصيص (انخفاض كِلا الخطين وتقاربهما بسرعة). بعد الاطِّلاع على منحنى التعلم، يصبح من الممكن تعديل درجة تعقيد النموذج أو التنظيم أو حجم بيانات التدريب بشكل مدروس بدلًا من الاعتماد على التخمين. 

منحنيات الخسارة

بالنسبة إلى نماذج التعلم العميق، يُعَد رسم خسارة التدريب وخسارة التحقق من الصحة على مدار دورات التدريب ممارسةً قياسيةً. عندما تتوقف خسارة التحقق من الصحة عن التحسن أو تبدأ في الارتفاع بينما تستمر خسارة التدريب في الانخفاض، فهذه إشارة إلى ضرورة إيقاف التدريب مبكرًا. عادةً ما يتم إنشاء هذه المخططات في الوقت الفعلي أثناء التدريب باستخدام أدوات مثل TensorBoard.

المخططات الخطية

بشكل أعم، توفِّر المخططات الخطية التي تتتبع أي مقياس (مثل الدقة أو درجة F1 أو المساحة تحت المنحنى) على مدار تكرارات التدريب صورةً مستمرةً لكيفية تطور النموذج. وهي توفِّر معلومات أكثر من مقياس واحد في نهاية التدريب، لأنها توضِّح مسار تطور النموذج وليس النتيجة النهائية فحسب. 

تصورات تقييم النماذج

مصفوفة الالتباس

مصفوفة الالتباس هي أحد أنواع تصورات تقييم النماذج، وتعرض في شبكة جميع حالات المقارنة بين تسميات الفئات الفعلية والمتوقعة، بما في ذلك النتائج الإيجابية الصحيحة والنتائج السلبية الصحيحة والنتائج الإيجابية الخطأ والنتائج السلبية الخطأ، بحيث يمكنك معرفة المواضع التي يقدم فيها النموذج تنبؤات صحيحة والمواضع التي يخطئ فيها بدقة. 

وهي الأساس لمعظم مقاييس التصنيف؛ إذ تُشتق منها الدقة الإيجابية والاستدعاء ودرجة F1. وعند عرضها في صورة خريطة حرارية تتضمن توضيحات للأعداد أو النِسب المئوية، فإنها تكشف على الفور أوجه القصور في أداء النموذج على مستوى كل فئة. قد يبدو النموذج "جيدًا" من حيث الدقة الإجمالية، لكن إذا ظهر صف فارغ لفئة بالغة الأهمية، فستكشف مصفوفة الالتباس هذا القصور على الفور. 

منحنيات خاصية تشغيل المستقبِل (ROC)

ترسم منحنيات ROC معدل النتائج الإيجابية الصحيحة مقابل معدل النتائج الإيجابية الخطأ عند كل عتبة تصنيف ممكنة، من 0 إلى 1. تلخِّص المساحة تحت المنحنى (AUC) القدرة الإجمالية للنموذج على التمييز في قيمة واحدة: تُشير القيمة 0.5 إلى تخمين عشوائي، بينما تُشير القيمة 1.0 إلى تمييز مثالي. تكون منحنيات ROC مفيدةً بشكل خاص عند مقارنة نماذج متعددة أو عندما تختلف تكلفة النتائج الإيجابية الخطأ عن تكلفة النتائج السلبية الخطأ. توفِّر أدوات مثل scikit-learn وPlotly دعمًا مدمجًا لإنشاء هذه المنحنيات. 

منحنيات الدقة/الاستدعاء

عندما تكون مجموعة البيانات غير متوازنة بشكل كبير، توفِّر منحنيات الدقة/الاستدعاء صورةً أكثر واقعيةً بكثير لأداء النموذج مقارنةً بمنحنيات ROC. يتجه أداء المصنِّف القوي نحو الجزء العلوي الأيمن من المخطط، مع الحفاظ على مستوى مرتفع من الدقة الإيجابية دون التضحية بالاستدعاء. يعرض هذا المنحنى الدقة الإيجابية على المحور y مقابل الاستدعاء على المحور x عبر عتبات قرار مختلفة.

في المجالات بالغة الأهمية مثل التشخيص الطبي أو اكتشاف الاحتيال، حيث قد تكون عواقب عدم اكتشاف حالة نادرة أشد بكثير من عواقب الإنذار الخطأ، غالبًا ما يوفر هذا المنحنى معلومات أكثر فائدةً من أي طريقة أخرى. 

مخططات القيم المتبقية

بالنسبة إلى نماذج الانحدار، يعرض مخطط القيم المتبقية الفرق بين القيم المتوقعة والفعلية (القيمة المتبقية) على المحور y مقابل القيمة المتوقعة على المحور x. ينبغي أن تتوزع القيم المتبقية عشوائيًا حول الصفر دون ظهور نمط واضح. إذا اتخذت القيم المتبقية شكلًا مروحيًا أو ظهرت في صورة منحنى منتظم أو تجمعت في مجموعات، فهذا يشير إلى وجود مشكلة بنيوية في النموذج، إذ إنه لا يلتقط أحد جوانب العلاقة الموجودة في البيانات. 

أدوات تصوُّر البيانات الشائعة في التعلم الآلي

تُعَد Matplotlib الأساس مفتوح المصدر الذي بُنيت عليه الأدوات الأخرى. تدعم الوحدة "pyplot" فيها (التي يتم استيرادها باسم "plt") مجموعةً كاملةً من المخططات القياسية، بما في ذلك المدرجات التكرارية ومخططات التشتت والمخططات الخطية والمخططات الشريطية وغيرها. تتطلب Matplotlib تعليمات برمجية أكثر تفصيلًا مقارنةً بالمكتبات الأحدث، لكن هذا المستوى من التفصيل يمنحك تحكمًا دقيقًا في كل عنصر، بما في ذلك التعليقات التوضيحية وتسميات المحاور وتخطيط الشكل وحجمه.

تعتمد Seaborn على Matplotlib وتقلل بشكل كبير من حجم التعليمات البرمجية المتكررة. فيمكن إنشاء خريطة حرارية أو مخطط أزواج أو مخطط صندوقي في Seaborn بسطر أو سطرين فقط، بينما قد يتطلب إنشاء المخطط نفسه نحو 15 سطرًا في Matplotlib. تقرأ البيانات مباشرةً من إطارات بيانات pandas، ما يجعلها الخيار المفضل للتحليل الاستكشافي للبيانات (EDA) في بيئات Jupyter Notebook. 

تُعَد Plotly الخيار المناسب عندما تحتاج إلى مخرجات تفاعلية. تُعرض المخططات بتنسيق HTML، ما يُتيح للمستخدمين تمرير المؤشر فوق نقاط البيانات والتكبير وإظهار سلاسل البيانات أو إخفاءها، وهو ما يجعلها أكثر فائدةً بكثير من الصور الثابتة عند عرض النتائج على الأطراف المعنية من خلال لوحات المعلومات أو تقارير الويب.

لا تُعَد NumPy أداةً لتصوُّر البيانات في حد ذاتها، لكنها تشكِّل أساس معظم عمليات تصوُّر البيانات، إذ تتولى معالجة المصفوفات وإعداد بيانات المحورين x وy التي تعتمد عليها Matplotlib وSeaborn. 

تم تصميم Yellowbrick خصوصًا لتقييم نماذج التعلم الآلي (ML). وهي تعتمد على scikit-learn لإنشاء مصفوفات الالتباس ومنحنيات ROC ومنحنيات التعلم ومخططات أهمية الميزات باستدعاء دالة واحدة، دون الحاجة إلى الإعداد اليدوي الذي تتطلبه Matplotlib.

تتولى TensorBoard جانب التعلم العميق. فهي تعرض مقاييس التدريب ومنحنيات الخسارة والرسوم البيانية للنماذج في الوقت الفعلي أثناء التدريب، وهو أمر ضروري لمراقبة مجموعات البيانات الكبيرة ومهام الشبكات العصبية التي تستغرق وقتًا طويلًا. 

الأخطاء الشائعة في تصوُّر البيانات للتعلم الآلي

لا يقتصر التصور الفعَّال للبيانات على اختيار المخطط المناسب فحسب، بل يتعلق أيضًا بتجنُّب الأنماط التي قد تكون مضللةً دون أن تبدو كذلك.

  • تصوُّر مجموعة الاختبار أثناء التحليل الاستكشافي للبيانات (EDA): حتى استكشاف توزيعات مجموعة الاختبار بشكل عابر قبل التدريب يكفي لتسريب معلومات تؤثِّر في قرارات المعالجة المسبقة. يجب إجراء التحليل الاستكشافي للبيانات (EDA) على مجموعة التدريب فقط، بعد تقسيم البيانات.
  • الاعتماد على قيمة واحدة للدقة: تُعَد الدقة الإجمالية من أكثر المقاييس التي قد تكون مضللةً في التعلم الآلي (ML)، خاصةً مع مجموعات البيانات غير المتوازنة. قد يحقق النموذج دقةً تبلغ 95% بينما يفشل تمامًا في التعامل مع الفئة الأكثر أهميةً فعليًا. احرص دائمًا على دعم هذا المقياس بمصفوفة التباس توضِّح تفاصيل الأداء لكل فئة.
  • استخدام مخطط غير مناسب لنوع البيانات: تفقد المخططات الدائرية فعاليتها عند استخدامها مع أكثر من عدد محدود من الفئات. تُشير المخططات الخطية إلى الاستمرارية، ما يجعلها غير مناسبة للمقارنات بين البيانات الفئوية. تم تصميم الخرائط الحرارية للارتباط للمتغيرات الرقمية، واستخدامها مع البيانات الفئوية ذات العدد الكبير من القيم الفريدة ينتج عنه تشتُّت بدلًا من تقديم رؤى مفيدة. ينبغي اختيار المخطط وفقًا لطبيعة البيانات، وليس بناءً على التفضيل الشخصي.
  • الخلط بين الارتباط والسببية: يشير الارتباط القوي بين ميزتين إلى أنهما تتغيران معًا. ولا يعني ذلك أن إحداهما تتسبب في تغيُّر الأخرى، وبالتأكيد لا يعني أن أيًا منهما تتسبب في تغيُّر المتغير المستهدف. تعامَل مع مصفوفة الارتباط باعتبارها نقطة بداية للتحليل، وليست نتيجةً نهائيةً.
  • الإفراط في الاعتماد على أهمية الميزات المستمدة من نموذج واحد: تعكس درجات أهمية الميزات مدى فائدة كل ميزة ضمن خوارزمية محددة. قد تكون الميزة التي تحتل مرتبةً متأخرةً في نموذج الغابة العشوائية من أكثر المدخلات قيمةً في نموذج الانحدار اللوجستي. استخدِم هذه المخططات كأحد المدخلات التي تستند إليها في اختيار الميزات، وليس كحكم نهائي عليها.
  • تجاهل مخططات القيم المتبقية في نماذج الانحدار: تكشف مخططات القيم المتبقية ما إذا كانت الأخطاء تتَّبع نمطًا معينًا، وهو ما يشير إلى أن النموذج لا يلتقط جانبًا هيكليًا مهمًا في البيانات. قد لا تظهر المنحنيات المنتظمة أو الأشكال المروحية في المقاييس الإجمالية، لكنها تكون واضحةً في مخطط القيم المتبقية.
  • التخلي عن التصور مع مجموعات البيانات الكبيرة: يُعَد تكدس عناصر الرسم مشكلةً حقيقيةً، لكن الحل ليس التوقف عن تصور البيانات، بل استخدام تقنيات مختلفة. يمكن لمخططات الكثافة أو عينة عشوائية مختارة بعناية أن توفِّر الوضوح التحليلي نفسه دون الحاجة إلى مخطط تشتُّت تصعب قراءته.

الخاتمة

لا يُعَد تصور البيانات في التعلم الآلي خطوةً نهائيةً، بل هو جزء لا يتجزأ من كل مرحلة من مراحل المشروع. فهو الوسيلة التي يستخدمها علماء البيانات لتشخيص المشكلات التي لا تظهر في الجداول، واكتشاف أوجه قصور النماذج التي تخفيها المقاييس، وتوصيل النتائج إلى الأطراف المعنية، واتخاذ قرارات واثقة قائمة على البيانات في كل مرحلة من مراحل سير العمل. 

يُعَد ترسيخ عادة تصوُّر البيانات بشكل مدروس في كل مرحلة من أبسط الممارسات وأكثرها تأثيرًا في تحسين جودة نماذجك ووضوح تفكيرك على حد سواء.

مؤلف

Jobit Varughese

Technical Content Writer

IBM

حلول ذات صلة
IBM watsonx.ai

تدريب الذكاء الاصطناعي التوليدي والتحقق من صحته وضبطه ونشره، وكذلك قدرات نماذج الأساس والتعلم الآلي باستخدام IBM watsonx.ai، وهو استوديو الجيل التالي من المؤسسات لمنشئي الذكاء الاصطناعي. أنشئ تطبيقات الذكاء الاصطناعي بسرعة أكبر وببيانات أقل.

اكتشف watsonx.ai
حلول الذكاء الاصطناعي

استفد من الذكاء الاصطناعي في عملك بالاستعانة بخبرة IBM الرائدة في مجال الذكاء الاصطناعي ومحفظة حلولها المتوفرة لك.

استكشف حلول الذكاء الاصطناعي
الاستشارات والخدمات المتعلقة بالذكاء الاصطناعي

أعدّ ابتكار عمليات ومهام سير العمل الحساسة بإضافة الذكاء الاصطناعي لتعزيز التجارب وصنع القرارات في الوقت الفعلي والقيمة التجارية.

استكشف خدمات الذكاء الاصطناعي
اتخِذ الخطوة التالية

احصل على وصول شامل إلى القدرات التي تغطي دورة حياة تطوير الذكاء الاصطناعي. تمكَّن من إنتاج حلول ذكاء اصطناعي قوية بفضل الواجهات سهلة الاستخدام وعمليات سير العمل السلسة وإمكانية الوصول إلى واجهات برمجة التطبيقات ومجموعات تطوير البرامج القياسية في الصناعة.

  1. استكشف watsonx.ai
  2. احجز عرضًا توضيحيًا مباشرًا