Utilizzo di un metastore esterno per Spark SQL
Spark SQL utilizza un metastore di tipo " Hive " per memorizzare tutti i metadati relativi alle tabelle o alle colonne, nonché le informazioni sulle partizioni utilizzate dalle applicazioni. Per impostazione predefinita, il database su cui si basa questo metastore è un'istanza Derby incorporata fornita insieme al cluster Spark. È possibile esternalizzare questo database metastore su un'istanza di IBM Cloud Data Engine (precedentemente SQL Query ).
Posizionando i metadati al di fuori del cluster Spark, potrai fare riferimento alle tabelle in diverse applicazioni all'interno del tuo IBM Analytics Engine powered by Apache Spark. Ciò consente di conservare dati e metadati e permette di lavorare con questi dati in modo trasparente tra diversi carichi di lavoro Spark.
Consentire a Analytics Engine powered by Apache Spark di accedere al metastore esterno
Per abilitare l'accesso a un metastore esterno:
- Crea un'istanza di IBM Cloud Data Engine (precedentemente SQL Query ) per archiviare i metadati.
- Configurare IBM Analytics Engine powered by Apache Spark affinché funzioni con l'istanza del database.
- Creare una tabella in un'applicazione Spark e poi accedervi da un'altra applicazione Spark.