IBM Netezza는 이제 원시 파일을 분석 준비 데이터로 전환하고 RAG 애플리케이션을 지원하는 자동화된 파이프라인을 통해 비정형 데이터를 데이터 웨어하우스로 가져옵니다. 이 기능은 현재 Private Tech Preview로 제공됩니다.
최신 IBM Netezza 릴리스에는 사용자가 동일한 분석 환경에서 기존 관계형 데이터와 함께 파일 기반 정보를 처리할 수 있도록 하는 비정형 데이터 워크플로가 포함되어 있습니다. Netezza는 비정형 콘텐츠를 유용하게 활용하기 전에 반드시 다른 곳에서 처리해야 하는 대상으로 보지 않고, 이를 분석 워크플로 자체의 일부로 활용할 수 있도록 합니다.
데이터 팀의 경우 이는 기존에 사용하던 SQL 기술과 분석 프로세스를 계속 활용하면서 작업할 수 있는 데이터 유형을 확장할 수 있음을 의미합니다. 단순히 문서와 비즈니스 데이터를 결합하기 위해 여러 시스템을 오케스트레이션하는 대신, 이제 이러한 작업의 상당 부분을 신뢰할 수 있는 엔터프라이즈 데이터가 이미 있는 위치와 더 가까운 곳에서 수행할 수 있습니다.
목표는 전문 문서 처리 플랫폼이나 AI 서비스를 대체하는 것이 아니라, 정형 및 비정형 정보를 함께 분석하기 전에 수반되는 불필요한 단계를 줄이는 것입니다.
수십 년 동안 엔터프라이즈 데이터 웨어하우스는 비즈니스 데이터가 테이블에 존재한다는 한 가지 기본 가정을 중심으로 설계되었습니다 고객 기록, 거래, 판매 보고서, 재고 및 재무 데이터는 모두 구조화된 형식을 따랐으며, 이에 따라 SQL은 분석을 위한 공통 언어가 되었습니다. 이 모델은 미션 크리티컬 보고에 필요한 안정적인 성능, 거버넌스 및 일관성을 제공했기 때문에 조직에 효과적으로 활용되었습니다.
오늘날 엔터프라이즈 데이터 환경은 크게 달라졌습니다. 조직은 그 어느 때보다 많은 문서, 애플리케이션 로그, PDF, 이메일, 기술 매뉴얼, 이미지 및 기타 파일 기반 정보를 생성하고 있습니다. 이러한 콘텐츠에는 가치 있는 비즈니스 맥락이 담겨 있지만, 엔터프라이즈 분석을 주도하는 구조화된 데이터와 분리되어 있는 경우가 많습니다. 그 결과, 단순한 비즈니스 질문에도 답하려면 분석 전에 데이터를 여러 플랫폼으로 이동해야 하는 경우가 점점 더 많아지고 있습니다.
업계는 주로 데이터 웨어하우스에 추가 처리 엔진을 도입하는 방식으로 이에 대응해 왔습니다. 이는 기능을 확장하지만 복잡성도 함께 높입니다. 새로운 엔진이 추가될 때마다 보안, 모니터링, 거버넌스 및 유지 관리가 필요한 또 하나의 환경이 생깁니다. 시간이 지날수록 조직은 인사이트를 도출하는 데 들이는 만큼 분석 아키텍처를 관리하는 데에도 많은 노력을 들이게 됩니다.
이러한 변화는 현대적인 분석 플랫폼에 대한 엔터프라이즈의 기대를 바꾸고 있습니다. 이제 논의는 쿼리 성능이나 스토리지 효율성에만 국한되지 않습니다. 조직은 점차 또 다른 인프라 계층을 추가하지 않고도 분석 플랫폼이 더 폭넓은 워크로드를 지원하도록 발전할 수 있는지 묻고 있습니다.
바로 이러한 요구에 IBM® Netezza의 최신 릴리스가 부합합니다.
이 기능은 비정형 콘텐츠에 널리 알려지고 검증된 설계 패턴인 메달리온 아키텍처를 적용할 기회도 열어 줍니다. 고객은 PDF 파일, 문서 및 기타 파일 기반 콘텐츠를 데이터 레이크로 가져온 후 전체 데이터 흐름을 자동화하는 파이프라인을 생성할 수 있습니다. 원시 파일은 텍스트 추출, 정제 및 표준화 등의 과정을 거쳐 점진적으로 개선되며, 콘텐츠는 신뢰할 수 있는 웨어하우스 데이터와 직접 조인할 수 있는 선별된 분석 준비 데이터가 됩니다.
이러한 파이프라인은 자동화되어 있으므로 데이터 흐름이 일회성 수작업 처리에 의존하지 않습니다. 새 문서가 데이터 레이크에 도착하면 자동으로 수집되어 정제됩니다. 그 결과, 원시 엔터프라이즈 콘텐츠에서 비즈니스에 바로 활용할 수 있는 인사이트에 이르는 반복 가능하고 거버넌스가 적용된 경로가 마련되며, 이는 조직의 구조화된 데이터를 이미 관리하는 동일한 환경에서 구축 및 운영됩니다.
동일한 파이프라인 기능은 AI 워크로드에도 자연스럽게 확장됩니다. 고객은 검색 증강 생성(RAG) 전체 흐름을 자동화하는 파이프라인을 구축할 수 있습니다. 문서를 파싱하고, 청크로 분할하며, 임베딩을 생성하고, 생성된 임베딩을 벡터 저장소에 적재하는 모든 과정을 수동 개입 없이 수행할 수 있습니다. 새로운 콘텐츠가 추가되면 파이프라인이 지식 기반을 최신 상태로 유지하여 AI 애플리케이션이 항상 최신 엔터프라이즈 정보를 기반으로 답변을 검색할 수 있도록 합니다.
Netezza의 네이티브 벡터 기능과 결합하면, 조직은 별도의 수집 도구, 임베딩 서비스 및 벡터 데이터베이스 스택을 연결하지 않고도 기존 웨어하우스를 기반으로 프로덕션 RAG 애플리케이션을 구축하고 유지 관리할 수 있습니다.
Netezza는 동일한 플랫폼 내에서 정형 및 비정형 데이터 워크플로를 지원하여 불필요한 데이터 이동을 줄이는 동시에 전체 분석 아키텍처를 간소화합니다 비정형 데이터를 별도의 문제로 다루는 대신, 신뢰할 수 있는 웨어하우스 데이터와 함께 분석할 수 있는 또 하나의 비즈니스 인사이트 소스로 활용할 수 있습니다. 또한 이러한 접근 방식은 구조화된 비즈니스 기록과 비정형 엔터프라이즈 콘텐츠가 점점 더 함께 작동해야 하는 AI 기반 분석을 위한 더욱 탄탄한 기반을 마련합니다.
분석 시장은 단순히 데이터를 저장하거나 처리하는 플랫폼을 넘어 발전하고 있습니다. 최신 Netezza 릴리스는 이러한 변화를 반영합니다. 비정형 데이터를 독립적인 기능으로 제시하는 대신, 플랫폼의 강점을 확장하여 더욱 포괄적인 분석 워크플로를 지원합니다. 고객은 새로운 형태의 비즈니스 데이터를 분석에 통합할 수 있는 역량을 갖추는 동시에 Netezza에서 기대하는 성능, 거버넌스 및 SQL 사용 경험의 이점을 계속 누릴 수 있습니다.
기업이 현대화와 운영 효율성의 균형을 계속 모색함에 따라, 통합된 환경에서 정형 및 비정형 데이터를 처리할 수 있는 기능은 점점 더 중요해질 것입니다. Netezza의 최신 릴리스는 조직이 차세대 엔터프라이즈 워크로드를 위한 더 단순하면서도 강력한 분석 기반을 구축하도록 지원합니다.
정형 및 비정형 데이터를 분석하는 방법을 간소화하려는 조직은 IBM Netezza Private Tech Preview를 통해 이 기능을 직접 경험할 수 있습니다. 이 프로그램은 새로운 비정형 데이터 워크플로를 평가하고, 제품 팀에 피드백을 제공하며, 정식 출시 전에 이 기능의 향후 방향을 함께 만들어 갈 기회를 제공합니다.