تتيح IBM Netezza الآن إدخال البيانات غير المنظمة إلى مستودع البيانات من خلال مسارات بيانات مؤتمتة تحول الملفات الأولية إلى بيانات جاهزة للتحليلات، وتدعم تطبيقات التوليد المعزز بالاسترجاع (RAG)، وهي متاحة اليوم ضمن المعاينة التقنية الخاصة.
يقدم أحدث إصدار من IBM Netezza ميزة سير عمل البيانات غير المنظمة، التي تتيح للمستخدمين التعامل مع المعلومات المستندة إلى الملفات إلى جانب البيانات العلائقية التقليدية ضمن البيئة التحليلية نفسها. وبدلاً من التعامل مع المحتوى غير المنظم بصفته شيئًا يجب دائمًا معالجته في مكان آخر قبل أن يصبح مفيدًا، تتيح Netezza أن يصبح هذا المحتوى جزءًا من سير العمل التحليلي نفسه.
وبالنسبة إلى فرق البيانات، يعني ذلك أنه يمكنها مواصلة استخدام مهارات SQL والعمليات التحليلية التي تعرفها بالفعل، مع توسيع أنواع البيانات التي يمكنها التعامل معها. وبدلاً من تنسيق أنظمة متعددة لمجرد دمج المستندات مع بيانات الأعمال، يمكن الآن تنفيذ جزء كبير من هذا العمل بالقرب من المكان الذي توجد فيه بيانات المؤسسة الموثوقة بالفعل.
والهدف ليس استبدال منصات معالجة المستندات المتخصصة أو خدمات الذكاء الاصطناعي، وإنما تقليل عدد الخطوات غير الضرورية المطلوبة قبل تحليل المعلومات المنظمة وغير المنظمة معًا.
على مدى عقود، صُممت مستودعات بيانات المؤسسات استنادًا إلى افتراض أساسي واحد: بيانات الأعمال موجودة في جداول. فقد اتبعت سجلات العملاء والمعاملات وتقارير المبيعات والمخزون والبيانات المالية جميعها تنسيقًا منظمًا، ما جعل SQL اللغة العامة للتحليلات. وقد خدم هذا النموذج المؤسسات جيدًا لأنه وفر أداءً موثوقًا وحوكمة واتساقًا لإعداد التقارير ذات المهام الحساسة.
لكن مشهد بيانات المؤسسات اليوم يبدو مختلفًا تمامًا. إذ تنشئ المؤسسات مستندات وسجلات تطبيقات وملفات PDF ورسائل بريد إلكتروني وأدلة تقنية وصورًا وغيرها من المعلومات المستندة إلى الملفات أكثر من أي وقت مضى. ويحتوي جزء كبير من هذا المحتوى على سياق قيّم للأعمال، إلا أنه غالبًا ما يظل منفصلاً عن البيانات المنظمة التي تدعم تحليلات المؤسسات. ونتيجة لذلك، تتطلب الإجابة عن أسئلة الأعمال المباشرة بشكل متزايد نقل البيانات عبر منصات متعددة قبل تحليلها.
وقد تمثلت استجابة القطاع إلى حد كبير في تقديم محركات معالجة إضافية إلى جانب مستودع البيانات. وعلى الرغم من أن ذلك يوسع الوظائف، فإنه يزيد التعقيد أيضًا. فكل محرك جديد يضيف بيئة أخرى يجب تأمينها ومراقبتها وحوكمتها وصيانتها. وبمرور الوقت، تنفق المؤسسات قدرًا من الجهد على إدارة البنية التحليلية يعادل ما تنفقه على استخراج الرؤى منها.
ويغير هذا التحول ما تتوقعه المؤسسات من منصة التحليلات الحديثة. فلم يعد النقاش مقتصرًا على أداء الاستعلامات أو كفاءة التخزين. وبشكل متزايد، تتساءل المؤسسات عما إذا كانت منصة التحليلات لديها قدرة على التطور لدعم نطاق أوسع من أحمال التشغيل من دون الحاجة إلى طبقة أخرى من البنية التحتية.
وهنا يأتي دور أحدث إصدار من IBM Netezza في السوق.
تفتح هذه القدرة أيضًا الباب أمام نمط تصميم مألوف ومثبت للمحتوى غير المنظم: بنية الميدالية. يمكن للعملاء إدخال ملفات PDF والمستندات وغيرها من المحتوى المستند إلى الملفات إلى بحيرة بيانات، ثم إنشاء مسارات بيانات تعمل على أتمتة تدفق البيانات بالكامل. وتتم تنقية الملفات غير المنسقة تدريجيًا، مثل استخراج النص وتنقيته وتوحيده، إلى أن يصبح المحتوى بيانات منسقة وجاهزة للتحليلات يمكن ضمها مباشرة إلى بيانات مستودع البيانات الموثوقة.
ونظرًا إلى أن مسارات البيانات هذه مؤتمتة، فإن تدفق البيانات لا يعتمد على معالجة يدوية لمرة واحدة. فعند وصول مستندات جديدة إلى بحيرة البيانات، يتم التقاطها وتنقيتها تلقائيًا. والنتيجة هي مسار متكرر ومحكوم بالحوكمة ينتقل من محتوى المؤسسة غير المنسق إلى رؤى جاهزة للأعمال، ويتم إنشاؤه وتشغيله ضمن البيئة نفسها التي تدير بالفعل البيانات المنظمة للمؤسسة.
تمتد القدرة نفسها بصورة طبيعية إلى أحمال تشغيل الذكاء الاصطناعي. يمكن للعملاء إنشاء مسارات بيانات تعمل على أتمتة تدفق التوليد المعزز بالاسترجاع من البداية إلى النهاية: تحليل المستندات، وتقسيمها إلى أجزاء، وإنشاء التضمينات، وتحميل هذه التضمينات إلى مخزن المتجهات، وكل ذلك من دون تدخل يدوي. وعند وصول محتوى جديد، يحافظ مسار البيانات على حداثة قاعدة المعرفة، ما يضمن أن تسترجع تطبيقات الذكاء الاصطناعي دائمًا إجابات تستند إلى أحدث معلومات المؤسسة.
وبالاقتران مع قدرات المتجهات الأصلية في Netezza، يعني ذلك أن المؤسسات يمكنها إنشاء تطبيقات التوليد المعزز بالاسترجاع وتشغيلها وصيانتها في بيئة الإنتاج فوق مستودع البيانات الحالي، من دون الحاجة إلى تجميع مجموعة منفصلة من أدوات استيعاب البيانات وخدمات التضمين وقواعد بيانات المتجهات.
ومن خلال تمكين سير عمل البيانات المنظمة وغير المنظمة ضمن المنصة نفسها، تساعد Netezza على تقليل نقل البيانات غير الضروري، مع تبسيط البنية التحليلية الشاملة. وبدلاً من التعامل مع البيانات غير المنظمة بصفتها مشكلة منفصلة، تصبح مصدرًا آخر لرؤى الأعمال يمكن تحليله إلى جانب بيانات مستودع البيانات الموثوقة. كما يوفر هذا النهج أساسًا أقوى للتحليلات المدعومة بالذكاء الاصطناعي، حيث تحتاج سجلات الأعمال المنظمة ومحتوى المؤسسة غير المنظم بشكل متزايد إلى العمل معًا.
يتجه سوق التحليلات إلى ما هو أبعد من المنصات التي تقتصر على تخزين البيانات أو معالجتها. ويعكس أحدث إصدار من Netezza هذا التحول؛ فبدلاً من تقديم البيانات غير المنظمة كقدرة مستقلة، يعمل الإصدار على توسيع نقاط قوة المنصة لدعم سير عمل تحليلي أكثر شمولاً. وسيواصل العملاء الاستفادة من الأداء والحوكمة وتجربة SQL التي يتوقعونها من Netezza، مع اكتساب القدرة على دمج أشكال جديدة من بيانات الأعمال في تحليلاتهم.
ومع استمرار المؤسسات في تحقيق التوازن بين التحديث والكفاءة التشغيلية، ستزداد قيمة القدرة على التعامل مع البيانات المنظمة وغير المنظمة ضمن بيئة موحدة. ويساعد أحدث إصدار من Netezza المؤسسات على بناء أساس تحليلي أبسط وأكثر قدرة لدعم الجيل التالي من أحمال تشغيل المؤسسات.
ويمكن للمؤسسات، التي تتطلع إلى تبسيط طريقة تحليل البيانات المنظمة وغير المنظمة، تجربة هذه القدرة مباشرة من خلال IBM Netezza Private Tech Preview. ويوفر البرنامج فرصة لتقييم سير عمل البيانات غير المنظمة الجديد، وتقديم الملاحظات إلى فريق المنتج، والمساعدة على تشكيل الاتجاه المستقبلي لهذه القدرة قبل إتاحتها بشكل عام.