Spark SQL에서 외부 메타스토어 사용

Spark SQL은 테이블이나 열과 관련된 모든 메타데이터, 또는 애플리케이션에서 사용하는 모든 파티션 정보를 저장하기 위해 Hive 메타스토어를 사용합니다. 기본적으로 이 메타스토어를 구동하는 데이터베이스는 Spark 클러스터에 포함된 내장형 Derby 인스턴스입니다. 이 메타스토어 데이터베이스를 IBM Cloud Data Engine (구 SQL Query ) 인스턴스로 외부화할 수 있습니다.

메타데이터를 Spark 클러스터 외부에 배치하면, IBM Analytics Engine powered by Apache Spark 전반에 걸쳐 다양한 애플리케이션에서 해당 테이블을 참조할 수 있습니다. 이를 통해 데이터와 메타데이터를 영구적으로 저장할 수 있으며, 서로 다른 Spark 워크로드 간에 이 데이터를 원활하게 활용할 수 있습니다.

Analytics Engine powered by Apache Spark 가 외부 메타스토어에 액세스할 수 있도록 설정

외부 메타스토어에 액세스하려면:

  1. 메타데이터를 저장하기 위해 IBM Cloud Data Engine (이전 명칭: SQL Query ) 인스턴스를 생성합니다.
  2. IBM ( Analytics Engine powered by Apache Spark )가 데이터베이스 인스턴스와 연동되도록 구성하십시오.
  3. 한 Spark 애플리케이션에서 테이블을 생성한 다음, 다른 Spark 애플리케이션에서 이 테이블에 액세스합니다.