Ilustração digital do suporte do Netezza a dados não estruturados

Além dos dados estruturados: o IBM Netezza apresenta fluxos de trabalho nativos para dados não estruturados

O IBM Netezza agora leva os dados não estruturados para dentro do data warehouse: pipelines automatizados transformam os arquivos brutos em dados prontos para análise e alimentam aplicações de RAG, tudo disponível hoje no Private Tech Preview.

A versão mais recente do IBM Netezza traz os fluxos de trabalho para dados não estruturados, que permitem aos usuários trabalhar com informações baseadas em arquivos junto com os dados relacionais tradicionais no mesmo ambiente analítico. Em vez de tratar o conteúdo não estruturado como algo que sempre precisa ser processado em outro lugar antes de se tornar útil, o Netezza permite que ele passe a fazer parte do próprio fluxo de trabalho analítico.

Para as equipes de dados, isso significa que podem continuar usando as habilidades em SQL e os processos analíticos que já dominam, ao mesmo tempo em que ampliam os tipos de dados com que conseguem trabalhar. Em vez de orquestrar vários sistemas apenas para combinar documentos com dados de negócios, boa parte desse trabalho agora pode acontecer mais perto de onde os dados corporativos confiáveis já estão.

O objetivo não é substituir plataformas especializadas de processamento de documentos nem serviços de IA, mas reduzir o número de etapas desnecessárias antes que informações estruturadas e não estruturadas possam ser analisadas em conjunto.

Ampliar o data warehouse, não a arquitetura

Durante décadas, os data warehouses corporativos foram projetados em torno de uma premissa fundamental: os dados de negócios residem em tabelas. Registros de clientes, transações, relatórios de vendas, inventário e dados financeiros seguiam todos um formato estruturado, o que fez do SQL a linguagem universal da análise de dados. Esse modelo atendeu bem às organizações porque oferecia desempenho, governança e consistência confiáveis para a elaboração de relatórios de missão crítica.

O cenário de dados corporativos de hoje é muito diferente. As organizações estão gerando mais documentos, logs de aplicações, PDFs, e-mails, manuais técnicos, imagens e outras informações baseadas em arquivos do que nunca. Boa parte desse conteúdo apresenta um contexto de negócios valioso, mas costuma permanecer desconectada dos dados estruturados que sustentam a análise de dados corporativa. Com isso, responder até mesmo a perguntas de negócios simples exige cada vez mais que os dados percorram várias plataformas antes de poderem ser analisados.

A resposta do setor tem sido, em grande medida, acrescentar novos mecanismos de processamento ao lado do data warehouse. Embora isso amplie a funcionalidade, também amplia a complexidade. Cada novo mecanismo acrescenta mais um ambiente para proteger, monitorar, governar e manter. Com o tempo, as organizações dedicam tanto esforço a gerenciar sua arquitetura de análise de dados quanto a gerar insights a partir dela.

Essa mudança está transformando o que as empresas esperam de uma plataforma moderna de análise de dados. A discussão já não se limita ao desempenho das consultas ou à eficiência do armazenamento. Cada vez mais, as organizações perguntam se sua plataforma de análise de dados pode evoluir para dar suporte a uma gama mais ampla de cargas de trabalho sem exigir mais uma camada de infraestrutura.

É nesse ponto que a versão mais recente do IBM Netezza se encaixa no mercado.

De documentos brutos a insight confiável

Esse recurso também abre caminho para um padrão de projeto conhecido e comprovado para conteúdo não estruturado: a arquitetura medalhão. Os clientes podem levar seus arquivos PDF, documentos e outros conteúdos baseados em arquivos para um data lake e, em seguida, criar pipelines que automatizam todo o fluxo de dados. Os arquivos brutos são refinados progressivamente à medida que o texto é extraído, limpo e padronizado, até que o conteúdo se torne dados selecionados e prontos para análise, que podem ser combinados diretamente com os dados confiáveis do data warehouse.

Como esses pipelines são automatizados, o fluxo de dados não depende de processamento manual e pontual. À medida que novos documentos chegam ao data lake, eles são captados e refinados automaticamente. O resultado é um caminho repetível e governado do conteúdo corporativo bruto ao insight pronto para o negócio, construído e operado no mesmo ambiente que já gerencia os dados estruturados da organização.

Automatizar a geração aumentada de recuperação (RAG) com pipelines

O mesmo recurso de pipeline se estende naturalmente às cargas de trabalho de IA. Os clientes podem criar pipelines que automatizam o fluxo de RAG de ponta a ponta: analisar os documentos, dividi-los em fragmentos, gerar embeddings e carregar esses embeddings no armazenamento de vetores, tudo sem intervenção manual. À medida que chega novo conteúdo, o pipeline mantém a base de conhecimento atualizada, garantindo que as aplicações de IA sempre recuperem respostas fundamentadas nas informações corporativas mais recentes.

Somado aos recursos vetoriais nativos do Netezza, isso significa que as organizações podem colocar em operação e manter aplicações de RAG em produção sobre o data warehouse que já possuem, sem emendar um stack separado de ferramentas de ingestão, serviços de embeddings e bancos de dados de vetores.

Ao viabilizar fluxos de trabalho para dados estruturados e não estruturados dentro da mesma plataforma, o Netezza ajuda a reduzir a movimentação desnecessária de dados e simplifica a arquitetura de análise de dados como um todo. Em vez de serem tratados como um problema à parte, os dados não estruturados passam a ser mais uma fonte de insight de negócios, que pode ser analisada junto com os dados confiáveis do data warehouse. Essa abordagem também cria uma base mais sólida para a análise de dados orientada por IA, em que os registros estruturados de negócios e o conteúdo corporativo não estruturado precisam cada vez mais funcionar em conjunto.

Dar suporte a fluxos de trabalho analíticos abrangentes

O mercado de análise de dados está indo além das plataformas que apenas armazenam ou processam dados. A versão mais recente do Netezza reflete essa mudança: em vez de posicionar os dados não estruturados como um recurso independente, ela estende os pontos fortes da plataforma para dar suporte a fluxos de trabalho analíticos mais abrangentes. Os clientes continuarão a se beneficiar do desempenho, da governança e da experiência de SQL que esperam do Netezza e, ao mesmo tempo, ganharão a capacidade de incorporar novas formas de dados de negócios à sua análise.

À medida que as empresas continuam a equilibrar modernização e eficiência operacional, a capacidade de trabalhar com dados estruturados e não estruturados em um ambiente unificado se tornará cada vez mais valiosa. A versão mais recente do Netezza ajuda as organizações a criar uma base analítica mais simples e com mais recursos para a próxima geração de cargas de trabalho corporativas.

As organizações que buscam simplificar a forma como analisam dados estruturados e não estruturados podem experimentar esse recurso na prática por meio do IBM Netezza Private Tech Preview. O programa oferece a oportunidade de avaliar os novos fluxos de trabalho para dados não estruturados, enviar feedback à equipe de produto e ajudar a definir os rumos futuros do recurso antes da disponibilidade geral.

Solicite acesso ao IBM Netezza Private Tech Preview

John Alexander

Product Marketing Manager, Core Databases - Netezza & Informix