IBM Netezza ahora incorpora datos no estructurados al almacén con canalizaciones automatizadas que convierten archivos en bruto en datos listos para análisis y alimentan aplicaciones RAG, disponibles hoy en Tech Preview.
La versión más reciente de IBM Netezza lanza flujos de trabajo de datos no estructurados, que permiten a los usuarios trabajar con información basada en archivos junto con datos relacionales tradicionales dentro del mismo entorno analítico. En lugar de tratar el contenido no estructurado como algo que siempre debe procesarse en otro lugar antes de que sea útil, Netezza permite que se convierta en parte del propio flujo de trabajo analítico.
Para los equipos de datos, esto significa que pueden continuar utilizando las habilidades SQL y los procesos analíticos que ya conocen mientras amplían los tipos de datos con los que pueden trabajar. En lugar de orquestar varios sistemas simplemente para combinar documentos con datos empresariales, gran parte de ese trabajo puede realizarse ahora más cerca de donde ya residen los datos empresariales de confianza.
El objetivo no es reemplazar las plataformas especializadas de procesamiento de documentos o los servicios de IA, sino reducir el número de pasos innecesarios requeridos antes de poder analizar la información estructurada y no estructurada en conjunto.
Durante décadas, los almacenes de datos empresariales se diseñaron en torno a una suposición fundamental: los datos empresariales viven en tablas. Los registros de clientes, las transacciones, los informes de ventas, el inventario y los datos financieros seguían un formato estructurado, lo que convertía a SQL en el lenguaje universal para análisis. Ese modelo sirvió bien a las organizaciones porque ofrecía un rendimiento, gobierno y coherencia fiables para la elaboración de informes de misión crítica.
El panorama actual de los datos empresariales es muy diferente. Las organizaciones generan más documentos, registros de aplicaciones, PDF, correos electrónicos, manuales técnicos, imágenes y otra información basada en archivos que nunca. Gran parte de este contenido contiene un contexto empresarial valioso, pero a menudo permanece desconectado de los datos estructurados que impulsan los análisis. Como resultado, responder incluso a preguntas empresariales sencillas requiere cada vez más que los datos se muevan a través de múltiples plataformas antes de que puedan analizarse.
La respuesta del sector ha consistido principalmente en introducir motores de procesamiento adicionales junto al almacén. Si bien esto amplía la funcionalidad, también amplía la complejidad. Cada nuevo motor introduce otro entorno para proteger, monitorizar, gobernar y mantener. Con el tiempo, las organizaciones dedican tanto esfuerzo a gestionar su arquitectura de análisis como a generar perspectivas a partir de ella.
Este cambio está modificando lo que las empresas esperan de una plataforma de análisis moderna. La conversación ya no se limita al rendimiento de las consultas o a la eficiencia del almacenamiento. Cada vez más, las organizaciones se preguntan si su plataforma de análisis puede evolucionar para soportar una gama más amplia de cargas de trabajo sin requerir una capa adicional de infraestructura.
Ahí es donde la última versión de IBM Netezza encaja en el mercado.
Esta capacidad también abre la puerta a un patrón de diseño conocido y comprobado para el contenido no estructurado: la arquitectura medallón. Los clientes pueden llevar sus archivos PDF, documentos y otros contenidos basados en archivos a un data lake y, a continuación, crear canalizaciones que automaticen todo el flujo de datos. Los archivos en bruto se refinan progresivamente (mediante la extracción, limpieza y estandarización del texto) hasta que el contenido se convierte en datos curados, listos para análisis que pueden unirse directamente con datos fiables del almacén.
Como estas canalizaciones están automatizadas, el flujo de datos no depende del procesamiento manual y único. A medida que llegan nuevos documentos al data lake, se recogen y refinan automáticamente. El resultado es un camino repetible y gobernado desde el contenido empresarial en bruto hasta las perspectivas listas para el negocio, que se construye y opera dentro del mismo entorno que ya gestiona los datos estructurados de la organización.
La misma capacidad de canalización se extiende de forma natural a las cargas de trabajo de IA. Los clientes pueden crear canalizaciones que automaticen el flujo RAG de extremo a extremo: analizar documentos, dividirlos en fragmentos, generar incrustaciones y cargar esas incrustaciones en el almacén de vectores, todo ello sin intervención manual. A medida que llegan nuevos contenidos, la canalización mantiene actualizada la base de conocimientos, lo que garantiza que las aplicaciones de IA siempre recuperen respuestas basadas en la información empresarial más reciente.
Combinado con las capacidades vectoriales nativas de Netezza, esto significa que las organizaciones pueden levantar y mantener aplicaciones RAG de producción sobre su almacén existente sin unir una pila separada de herramientas de ingesta, servicios de incrustación y bases de datos vectoriales.
Al permitir flujos de trabajo de datos estructurados y datos no estructurados dentro de la misma plataforma, Netezza ayuda a reducir el movimiento innecesario de datos al tiempo que simplifica la arquitectura de análisis general. En lugar de tratar los datos no estructurados como un problema aparte, se convierten en otra fuente de información empresarial que puede analizarse junto con los datos de almacén de confianza. Este enfoque también crea una base más sólida para el análisis impulsado por IA, en el que los registros empresariales estructurados y el contenido empresarial no estructurado necesitan trabajar cada vez más juntos.
El mercado de análisis va más allá de las plataformas que simplemente almacenan o procesan datos. La última versión de Netezza refleja ese cambio: en lugar de posicionar los datos no estructurados como una capacidad independiente, amplía las fortalezas de la plataforma para soportar flujos de trabajo analíticos más completos. Los clientes continuarán beneficiándose del rendimiento, el gobierno y la experiencia en SQL que esperan de Netezza, mientras obtienen la capacidad de incorporar nuevas formas de datos empresariales en su análisis.
A medida que las empresas continúan equilibrando la modernización con la eficiencia operativa, la capacidad de trabajar con datos estructurados y no estructurados en un entorno unificado será cada vez más valiosa. La última versión de Netezza ayuda a las organizaciones a crear una base analítica más sencilla y capaz para la próxima generación de cargas de trabajo empresariales.
Las organizaciones que buscan simplificar la forma en que analizan los datos estructurados y los datos no estructurados pueden experimentar esta capacidad de primera mano a través de la experiencia de IBM Netezza Private Tech Preview. El programa ofrece la oportunidad de evaluar los nuevos flujos de trabajo de datos no estructurados, proporcionar feedback al equipo de producto y ayudar a definir la dirección futura de las capacidades antes de la disponibilidad general.