IBM Netezza ahora lleva datos no estructurados al almacén con pipelines automatizados que convierten los archivos sin procesar en datos listos para analytics y potencian las aplicaciones RAG, disponibles hoy en Private Tech Preview.
La versión más reciente de IBM Netezza, Flujos de trabajo de datos no estructurados, permite a los usuarios trabajar con información basada en archivos junto con datos relacionales tradicionales dentro del mismo entorno analítico. En lugar de tratar el contenido no estructurado como algo que siempre debe procesarse en otro lugar antes de que sea útil, Netezza permite que se convierta en parte del propio flujo de trabajo de analytics.
Para los equipos de datos, esto significa que pueden continuar utilizando las habilidades de SQL y los procesos analíticos que ya conocen mientras amplían los tipos de datos con los que pueden trabajar. En lugar de orquestar múltiples sistemas simplemente para combinar documentos con datos del negocio, gran parte de ese trabajo ahora puede ocurrir más cerca de donde ya residen los datos empresariales de confianza.
El objetivo no es reemplazar las plataformas especializadas de procesamiento de documentos o los servicios de IA, sino reducir el número de pasos innecesarios requeridos antes de que la información estructurada y no estructurada pueda analizarse en conjunto.
Durante décadas, los almacenes de datos empresariales se diseñaron en torno a una suposición fundamental: los datos empresariales residen en tablas. Los registros de clientes, las transacciones, los informes de ventas, el inventario y los datos financieros siguieron un formato estructurado, lo que convirtió a SQL en el lenguaje universal para analytics. Ese modelo sirvió bien a las organizaciones porque ofrecía rendimiento, gobernanza y coherencia confiables para la elaboración de informes de misión crítica.
El escenario actual de datos empresariales es muy diferente. Las organizaciones están generando más que nunca documentos, registros de aplicaciones, PDF, correos electrónicos, manuales técnicos, imágenes y otra información basada en archivos. Gran parte de este contenido posee un contexto empresarial valioso, pero a menudo permanece desconectado de los datos estructurados que impulsan los analytics empresariales. Como resultado, responder incluso a preguntas empresariales sencillas requiere cada vez más que los datos se muevan a través de múltiples plataformas antes de que puedan analizarse.
La respuesta de la industria ha sido en gran medida introducir motores de procesamiento adicionales junto con el almacén. Si bien esto amplía la funcionalidad, también amplía la complejidad. Cada nuevo motor introduce otro entorno para proteger, monitorear, gobernar y mantener. A lo largo del tiempo, las organizaciones dedican tanto esfuerzo a gestionar su arquitectura de analytics como a generar insights a partir de ella.
Este hecho está cambiando lo que las empresas esperan de una plataforma de analytics moderna. La conversación ya no se limita al rendimiento de las consultas o a la eficiencia del almacenamiento. Cada vez más, las organizaciones se preguntan si su plataforma de analytics puede evolucionar para admitir una gama más amplia de cargas de trabajo sin requerir otra capa de infraestructura.
Ahí es donde la última versión de IBM Netezza encaja en el mercado.
Esta capacidad también abre la puerta a un patrón de diseño familiar y probado para contenido no estructurado: la arquitectura medallón. Los clientes pueden llevar sus archivos PDF, documentos y otro contenido basado en archivos a un data lake y luego crear pipelines que automaticen todo el flujo de datos. Los archivos sin procesar se refinan progresivamente, ya que el texto se extrae, limpia y estandariza hasta que el contenido se convierte en datos curados y listos para analytics que se pueden unir directamente con datos de almacén confiables.
Debido a que estos pipelines están automatizados, el flujo de datos no depende del procesamiento manual único. A medida que nuevos documentos llegan a los data lakes, se seleccionan y refinan automáticamente. El resultado es una ruta repetible y gobernada desde el contenido empresarial sin procesar hasta el insight listo para el negocio que se crea y opera dentro del mismo entorno que ya gestiona los datos estructurados de la organización.
La misma capacidad de pipeline se extiende de forma natural a las cargas de trabajo de IA. Los clientes pueden crear pipelines que automaticen el flujo de RAG de extremo a extremo: analizar documentos, dividirlos en fragmentos, generar incorporaciones y cargarlas en el almacén de vectores, todo sin intervención manual. A medida que llega nuevo contenido, el pipeline mantiene actualizada la base de conocimientos, lo que garantiza que las aplicaciones de IA siempre recuperen respuestas basadas en la información empresarial más reciente.
Combinado con las capacidades de Netezza, esto significa que las organizaciones pueden poner en marcha y mantener aplicaciones de producción RAG sobre su almacén existente sin necesidad de unir una pila separada de herramientas de ingesta, servicios de incorporación y bases de datos vectoriales.
Al permitir flujos de trabajo de datos estructurados y no estructurados dentro de la misma plataforma, Netezza ayuda a reducir el movimiento innecesario de datos mientras simplifica la arquitectura de analytics general. En lugar de tratar los datos no estructurados como un problema separado, se convierten en otra fuente de insight que se puede analizar junto con los datos de almacén de confianza. Este enfoque también crea una base más sólida para las analytics impulsadas por IA, donde los registros de negocios estructurados y el contenido empresarial no estructurado necesitan trabajar cada vez más juntos.
El mercado de analytics va más allá de las plataformas que simplemente almacenan o procesan datos. La última versión de Netezza refleja ese cambio: en lugar de posicionar los datos no estructurados como una capacidad independiente, amplía las fortalezas de la plataforma para admitir flujos de trabajo analíticos más completos. Los clientes continuarán beneficiándose del rendimiento, la gobernanza y la experiencia de SQL que esperan de Netezza, al tiempo que obtendrán la capacidad de incorporar nuevas formas de datos empresariales en su análisis. A medida que las empresas continúen equilibrando la modernización con la eficiencia operativa, la capacidad de trabajar con datos estructurados y no estructurados en un entorno unificado será cada vez más valiosa. La última versión de Netezza ayuda a las organizaciones a crear una base de analytics más sencilla y capaz para la próxima generación de cargas de trabajo empresariales.
Las organizaciones que buscan simplificar la forma en que analizan datos estructurados y no estructurados pueden experimentar esta capacidad de primera mano a través de IBM Netezza Private Tech Preview. El programa ofrece la oportunidad de evaluar los nuevos flujos de trabajo de datos no estructurados, proporcionar feedback al equipo de producto y ayudar a definir la dirección futura de la capacidad antes de la disponibilidad general.