Illustrazione digitale del supporto per dati non strutturati di Netezza

Oltre i dati strutturati: IBM Netezza introduce i workflow di dati non strutturati nativi

Ora IBM Netezza porta dati non strutturati nel warehouse con pipeline automatizzate che trasformano i file grezzi in dati pronti per l'analytics e supportano applicazioni RAG, disponibili oggi in Private Tech Preview.

L'ultimo rilascio di IBM Netezza include i workflow di dati non strutturati, che consentono agli utenti di lavorare con informazioni basate su file insieme ai dati relazionali tradizionali nello stesso ambiente analitico. Anziché trattare i contenuti non strutturati come qualcosa che deve sempre essere elaborato altrove prima di poter essere utilizzato, Netezza permette di integrarli direttamente nel workflow di analytics.

Per i team di dati, questo significa poter continuare a utilizzare le competenze SQL e i processi analitici già noti, ampliando le tipologie di dati con cui possono lavorare. Invece di orchestrare più sistemi semplicemente per combinare i documenti con i dati aziendali, gran parte di questo lavoro può ora svolgersi più vicino a dove risiedono già dati aziendali affidabili.

L'obiettivo non è sostituire piattaforme specializzate di elaborazione documenti o servizi di AI, ma ridurre il numero di passaggi inutili necessari prima che informazioni strutturate e non strutturate possano essere analizzate insieme.

Ampliamento del warehouse invece dell'architettura

Per decenni, i data warehouse aziendali sono stati progettati attorno a un presupposto fondamentale: i dati aziendali risiedono nelle tabelle. I record dei clienti, le transazioni, i report di vendita, l'inventario e i dati finanziari seguivano tutti un formato strutturato, rendendo SQL il linguaggio universale per l'analytics. Questo modello è stato utile alle organizzazioni perché ha fornito prestazioni, governance e coerenza affidabili per il reporting mission-critical.

Il landscape dei dati aziendali di oggi è molto diverso: le organizzazioni stanno generando più documenti, registri delle applicazioni, PDF, e-mail, manuali tecnici, immagini e altre informazioni basate su file che mai. Gran parte di questo contenuto contiene un prezioso contesto aziendale, ma spesso rimane scollegato dai dati strutturati che guidano l'analytics. Di conseguenza, rispondere anche a semplici domande aziendali richiede sempre più che i dati si spostino su altre piattaforme prima di poter essere analizzati. La risposta del settore è stata principalmente quella di introdurre ulteriori motori di lavorazione accanto al warehouse, ampliando le funzionalità da un lato, ma aumentando la complessità dall'altro. Ogni nuovo motore introduce un nuovo ambiente da proteggere, monitorare, governare e manutenere. Nel tempo, le organizzazioni dedicano tanto impegno alla gestione della propria architettura di analytics quanto a generare insight da essa.

Questo cambiamento ha modificato le aspettative delle aziende nei confronti di una piattaforma di analytics moderna. La conversazione non si limita più alle prestazioni delle query o all'efficienza dello storage: sempre più organizzazioni si chiedono se la loro piattaforma di analytics possa evolversi per supportare una gamma più ampia di workload senza richiedere un ulteriore livello di infrastruttura.

Ed è qui che l'ultima versione di IBM Netezza si inserisce nel mercato.

Dai documenti grezzi all'insight affidabile

Questa funzionalità apre inoltre le porte a un modello di progettazione collaudato e familiare per i contenuti non strutturati: l'architettura a medaglione. I clienti possono portare i loro file PDF, documenti e altri contenuti basati su file in un data lake e poi creare pipeline che automatizzano l'intero flusso di dati. I file non elaborati vengono progressivamente perfezionati man mano che il testo viene estratto, pulito e standardizzato fino a quando il contenuto non si trasforma in dati curati e pronti per l'analytics che possono essere uniti direttamente a dati di warehouse affidabili.

Poiché queste pipeline sono automatizzate, il flusso di dati non dipende da un'elaborazione manuale una tantum: quando nuovi documenti arrivano nel data lake, vengono automaticamente raccolti e perfezionati. Il risultato è un percorso ripetibile e controllato da contenuti aziendali grezzi a insight pronti per l'uso, creati e gestiti all'interno dello stesso ambiente che già gestisce i dati strutturati dell'organizzazione.

Automazione della Retrieval-augmented generation (RAG) con le pipeline

La stessa funzionalità di pipeline si estende naturalmente ai workload dell'AI. I clienti possono creare delle pipeline che automatizzano il flusso RAG end-to-end: analizzando documenti, suddividendoli in blocchi, generando embedding e caricando tali embedding nel database vettoriale, il tutto senza intervento manuale. Con l'arrivo di nuovi contenuti, la pipeline mantiene aggiornata la base di conoscenza, garantendo che le applicazioni AI recuperino sempre risposte basate sulle informazioni aziendali più recenti.

Grazie alla combinazione con le funzionalità di Netezza, le organizzazioni possono implementare e gestire applicazioni di produzione sulla base del data warehouse esistente, senza dover creare uno stack separato di strumenti di acquisizione, servizi di embedding e database vettoriali.

Abilitando workflow di dati strutturati e non strutturati all'interno della stessa piattaforma, Netezza aiuta a ridurre lo spostamento non necessario dei dati semplificando l'architettura di analytics complessiva. Invece di trattare i dati non strutturati come un problema separato, diventano un'altra fonte di insight aziendali che possono essere analizzati insieme ai dati di warehouse attendibili. Questo approccio crea inoltre una base più solida per l'analytics basata su AI, in cui i record aziendali strutturati e i contenuti aziendali non strutturati devono collaborare sempre più.

Supporto dei workflow analitici completi

Il mercato dell'analytics si sta spostando oltre le piattaforme che si limitano a memorizzare o elaborare dati. L'ultima versione di Netezza riflette questo cambiamento: invece di posizionare i dati non strutturati come una funzionalità autonoma, estende i punti di forza della piattaforma per supportare workflow analitici più completi. I clienti continueranno a trarre beneficio dalle prestazioni, dalla governance e dall'esperienza SQL che si aspettano da Netezza, acquisendo la capacità di incorporare nuove forme di dati aziendali nelle loro analisi.

Man mano che le aziende continuano a bilanciare la modernizzazione con l'efficienza operativa, la capacità di lavorare con dati strutturati e non strutturati in un ambiente unificato diventerà sempre più preziosa. L'ultima versione di Netezza aiuta le organizzazioni a costruire una base di analytics più semplice e capace per la nuova generazione di workload aziendali.

Le organizzazioni che desiderano semplificare l'analisi dei dati strutturati e non strutturati possono sperimentare in prima persona questa funzionalità attraverso l'IBM Netezza Private Tech Preview. Il programma offre l'opportunità di valutare i nuovi workflow di dati non strutturati, fornire feedback al team di prodotto e contribuire a definire la direzione futura delle funzionalità prima della disponibilità generale.

Richiedi l'accesso a IBM Netezza Private Tech Preview

John Alexander

Product Marketing Manager, Core Databases - Netezza & Informix