Gerenciando fluxos do Data Refinery

Um fluxo do Data Refinery é um conjunto ordenado de etapas para purificar, modelar e aprimorar dados. À medida que você refina seus dados por aplicando operações a um conjunto de dados, você constrói dinamicamente um fluxo de Data Refinery customizado que você pode modificar em tempo real e economizar para uso futuro.

São ações que você pode fazer enquanto refina seus dados:

Trabalhando com o fluxo Data Refinery

Etapas

Trabalhando com os conjuntos de dados

Ações na página do projeto

Trabalhando com o fluxo Data Refinery

Salvar um fluxo do Data Refinery

Salve um fluxo do " Data Refinery " clicando no ícone Ícone de fluxo do Data Refinery "Salvar fluxo do ' Data Refinery '" na barra de ferramentas do " Data Refinery ". Data Refinery Os fluxos são salvos no projeto em que você está trabalhando. Salve um fluxo do Data Refinery para que seja possível continuar refinando um conjunto de dados posteriormente.

A saída padrão do fluxo Data Refinery é salva como um ativo de dados source-file-name_shaped.csv. Por exemplo, se o arquivo de origem for mydata.csv, o nome padrão e a saída para o fluxo “ Data Refinery ” são mydata_csv_shaped. Você pode editar o nome e adicionar uma extensão alterando o destino de um fluxo do Data Refinery.

Se as pastas estiverem habilitadas no seu projeto, você poderá salvar o fluxo e a saída do seu Data Refinery em pastas. Ícone da área de janela de informaçõesVocê pode editar a localização do fluxo e o destino no painel Ícone da área de janela de informações “Informações da visualização” ou no ícone “Configurações do fluxo ”.

Executar ou agendar uma tarefa para um fluxo do Data Refinery

O Data Refinery suporta conjuntos de dados grandes, que podem ser demorados e difíceis de refinar. Para que você possa trabalhar com rapidez e eficiência, o comando ` Data Refinery ` opera sobre um subconjunto de amostra de linhas do conjunto de dados. O tamanho da amostra é de 1 MB ou 10.000 linhas, o que ocorrer primeiro. Quando você executa uma tarefa no fluxo “ Data Refinery ”, todo o conjunto de dados é processado. Ao executar a tarefa, você seleciona o horário de execução e pode definir uma programação única ou recorrente.

Ícone de tarefas.No programa " Data Refinery ", na barra de ferramentas " Data Refinery ", clique no ícone "Jobs " e, em seguida, selecione "Salvar e criar uma tarefa " ou "Salvar e visualizar tarefas ".

Depois de salvar um fluxo do Data Refinery, você também pode criar uma tarefa para ele na página Projeto. menu overflowVá para a guia "Ativos ", selecione o fluxo " Data Refinery " e escolha "Nova tarefa" no ícone de transbordamento.

Você precisa ter a função de Administrador ou Editor para visualizar os detalhes da tarefa, editá-la ou executá-la. Com a função de Visualizador no projeto, você pode visualizar apenas os detalhes da tarefa.

Para executar tarefas, você precisa de uma chave API de usuário. Normalmente, ele é criado automaticamente quando você cria seu primeiro trabalho. Você também pode criar manualmente uma chave API a partir do seu Perfil e configurações.

Para obter mais informações sobre empregos, consulte Criando empregos em Data Refinery.

Renomear um fluxo do Data Refinery

Ícone da área de janela de informaçõesNa barra de ferramentas do Data Refinery, abra o painel "Exibir informações ". Ou clique no ícone Ícone da área de janela de informações de configurações do Flow e acesse a guia Geral.

Crie fluxos d Data Refinery mente por meio de programação, sem usar a interface do usuário

Você pode criar fluxos d Data Refinery mente por meio de programação, utilizando o atributo ` shaperAPICreated ` na API. Essa funcionalidade permite que você:

  • Use APIs externas para criar fluxos d Data Refinery.
  • Use integrações de terceiros para criar fluxos com operações de modelagem.
  • Use fluxos de trabalho automatizados para criar pipelines de transformação de dados.
  • Use aplicativos personalizados para criar fluxos d Data Refinery s sem utilizar a interface do usuário.

Para obter mais informações, consulte a documentação da API: <hostname:port_number>/v2/data_flow_spark/docs/swagger/index.html

Etapas

Desfazer ou refazer um passo

Clique no ícone ícone de desfazer "Desfazer" ou no ícone ícone de refazer "Refazer" na barra de ferramentas.

Editar, duplicar, inserir ou excluir uma etapa

No painel "Etapas", clique no ícone menu overflow de transbordamento na etapa da operação que você deseja alterar. Selecione a ação (Editar, Duplicar, Inserir etapa antes, Inserir etapa apósou Excluir)

  • Se você selecionar Editar, Data Refinery vai para o modo de edição e ou exibe a operação a ser editada na linha de comando ou na área de janela da Operação. Aplicar a operação editada.

  • Se você selecionar Duplicate, a etapa duplicada será inserida após a etapa selecionada.

Observação:

A ação Duplicar não está disponível para as operações de Junção ou União

Data Refinery atualiza o fluxo Data Refinery para refletir as mudanças e reprises todas as operações.

Visualizar as etapas de fluxo de Data Refinery em uma "visualização instantânea"

Para ver a aparência de seus dados a qualquer momento, clique em uma etapa anterior para colocar o Data Refinery em visualização de captura instantânea. Por exemplo, se você clicar em Fonte de dados, você verá quais seus dados pareciam antes de você começar a refiná-lo. Clique em qualquer etapa de operação para ver a aparência de seus dados depois que a operação foi aplicada. Para deixar a visualização do instantâneo, clique em Viewing step x of y ou clique na mesma etapa que você selecionou para entrar em visualização instantânea.

Exportar os dados de fluxo do Data Refinery para um arquivo CSV

Clique no ícone ícone de exportação Exportar na barra de ferramentas para exportar os dados da etapa atual do seu fluxo do Data Refinery para um arquivo do CSV sem salvar ou executar uma tarefa do fluxo do Data Refinery. Use esta opção, por exemplo, se desejar uma saída rápida de um fluxo de e Data Refinery e que está em andamento. Quando você exporta os dados, um arquivo CSV é criado e baixado para a pasta Downloads do seu computador (ou para o local de download especificado pelo usuário) na etapa atual do fluxo Data Refinery. Se você estiver na visualização instantânea, a saída do arquivo CSV estará na etapa em que você clicou. Se você estiver visualizando uma amostra (subconjunto) dos dados, apenas os dados da amostra estarão na saída.

Observação:

Se o seu arquivo CSV contiver qualquer carga maliciosa (fórmulas, por exemplo) em um campo de entrada, esses itens poderão ser executados.

Você também pode exportar um fluxo de Data Refinery exportando os ativos do projeto. Para obter mais informações, consulte Exportando ativos do projeto.

Trabalhando com os conjuntos de dados

Mudar a origem de um fluxo do Data Refinery

Alterar a origem de um fluxo de Data Refinery . Execute o mesmo fluxo do Data Refinery, mas com um conjunto de dados de origem diferente. Se as pastas estiverem habilitadas no seu projeto, você pode navegar pelas pastas para selecionar um conjunto de dados de origem. Há duas maneiras que você pode alterar a origem:

  • No painel "Etapas ": clique no ícone menu overflow de menu suspenso ao lado de "Fonte de dados ", selecione "Editar " e, em seguida, escolha um conjunto de dados de origem diferente.
    Editar origem

  • Nas configurações do Flow: Você pode usar este método se quiser alterar mais de uma fonte de dados no mesmo lugar. Por exemplo, para uma operação de Join ou de União. Configurações de fluxoNa barra de ferramentas, clique no ícone de configurações do fluxo. Vá até a guia “Conjuntos de dados de origem” e clique no ícone menu overflow de menu suspenso ao lado da fonte de dados. Selecione Substituir origem de dadose, em seguida, escolha um conjunto de dados de origem diferente

Para melhores resultados, o novo conjunto de dados deve ter um esquema que seja compatível ao conjunto de dados original (por exemplo, nomes de colunas, número de colunas e tipos de dados). Se o novo conjunto de dados tiver um esquema diferente, as operações que não forem compatíveis com esse esquema apresentarão erros. É possível editar ou excluir as operações ou mudar a origem para uma que tenha um esquema mais compatível.

Se você escolher uma conexão para um destino, só poderá usar uma conexão da lista de fontes de dados compatíveis com o Data Refinery.

Editar o tamanho da amostra

Quando você executa a tarefa para o fluxo Data Refinery , as operações são realizadas no conjunto de dados completo. No entanto, quando você aplica as operações de forma interativa em Data Refinery, dependendo do tamanho do conjunto de dados, você visualize apenas uma amostra dos dados.

Aumente o tamanho da amostra para ver resultados que estarão mais próximos dos resultados do trabalho de fluxo Data Refinery , mas esteja ciente de que pode demorar mais para visualizar os resultados em Data Refinery. O máximo é uma contagem de topo de linha de 10.000 linhas ou 1 MB, consoante o que vier em primeiro lugar. Diminua o tamanho da amostra para visualizar resultados mais rápidos. Dependendo do tamanho dos dados e do número e da complexidade das operações, você pode desejar experimentar o tamanho da amostra para ver o que funciona melhor para o conjunto de dados.

Configurações de fluxoNa barra de ferramentas, clique no ícone de configurações do fluxo. Vá até a guia “Conjuntos de dados de origem ”, clique no ícone menu overflow de menu suspenso ao lado da fonte de dados e selecione “Editar amostra ”.

Editar as propriedades de origem

As propriedades disponíveis dependem da fonte de dados. Diferentes propriedades estão disponíveis para ativos de dados e para dados de diferentes tipos de conexões. Altere o formato de arquivo apenas se o formato de arquivo inferido estiver incorreto. Se você alterar o formato de arquivo, a origem é lida com o novo formato, mas o arquivo de origem permanece inalterado. Alterar as propriedades de origem do formato pode ser um processo iterativo. Inspecione seus dados depois de aplicar uma opção.

Configurações de fluxoNa barra de ferramentas, clique no ícone de configurações do fluxo. Vá até a guia “Conjuntos de dados de origem ”, clique no ícone menu overflow de mais opções ao lado da fonte de dados e selecione “Editar formato ”.

Importante: Use cuidado se você editar as propriedades de origem. Seleções incorretas podem produzir resultados inesperados quando os dados são lidos ou impar a tarefa de fluxo Data Refinery . Inspecionar os resultados da Data Refinery fluir cuidadosamente.

Alterar o destino de um fluxo do Data Refinery

Por padrão, o alvo da Data Refinery é salvo como um ativo de dados no projeto em que você está trabalhando.

Para alterar o local de destino, clique no ícone Configurações de fluxo Configurações do fluxo na barra de ferramentas. Acesse a guia Conjunto de dados de destino , clique em Selecionar destinoe selecione um local de destino diferente Se as pastas estiverem habilitadas no seu projeto, você pode navegar pelas pastas para selecionar uma pasta de destino.

Se você escolher uma conexão para um destino, só poderá usar uma conexão da lista de fontes de dados compatíveis com o Data Refinery. Algumas dessas conexões só podem ser usadas como fonte para um fluxo Data Refinery.

Editar as propriedades de destino

As propriedades disponíveis dependem da fonte de dados. Diferentes propriedades estão disponíveis para ativos de dados e para dados de diferentes tipos de conexões.

Para alterar as propriedades do conjunto de dados de destino, clique no ícone Configurações de fluxo Configurações do fluxo na barra de ferramentas. Vá para a guia Conjunto de dados de destino e clique em Editar propriedades

Alterar o nome do destino de fluxo Data Refinery

O nome do conjunto de dados de destino está incluído nos campos que você pode alterar quando você editar as propriedades de destino.

Por padrão, o destino do Data Refinery é salvo como um source-file-name_shaped.csv do ativo de dados no projeto, Por exemplo, se a origem for mydata.csv, o nome e a saída padrão para o fluxo do Data Refinery será o ativo de dados mydata_csv_shaped

Diferentes propriedades e convenções de nomenclatura aplicam-se a um conjunto de dados de destino a partir de uma conexão. Por exemplo, se o conjunto de dados estiver em Cloud Object Storage, o conjunto de dados é identificado nos campos Bucket e Nome do arquivo . Se o conjunto de dados estiver em um banco de dados Db2 , o conjunto de dados será identificado nos campos Schema name e Table name .

Importante: Use cuidado se você editar as propriedades de destino. Seleções incorretas podem produzir resultados inesperados ou impar o job flow Data Refinery . Inspecionar os resultados da Data Refinery fluir cuidadosamente.

Para obter mais informações, consulte Opções de conexão de destino.

Ações na página do projeto

Reabrir um fluxo do Data Refinery para continuar trabalhando

Para reabrir um fluxo do Data Refinery e continuar refinando seus dados, acesse a guia Ativos do projeto. Sob Tipos de ativos, expanda Flows, clique em Data Refinery fluir. Clique no nome do fluxo “ Data Refinery ”.

Duplicar um fluxo do Data Refinery

Para criar uma cópia de um fluxo do Data Refinery , acesse a guia Ativos do projeto, expanda Fluxos, clique em Data Refinery. menu overflowSelecione o fluxo “ Data Refinery ” e, em seguida, selecione “Duplicar” no ícone de menu suspenso. O fluxo Data Refinery é adicionado à lista de fluxos Data Refinery como " nome-original cópia 1".

Excluir um fluxo do Data Refinery

Para excluir um fluxo do Data Refinery , acesse a guia Ativos do projeto, expanda Fluxos, clique em Data Refinery menu overflowSelecione o fluxo “ Data Refinery ” e, em seguida, selecione “Excluir” no ícone “Overflow ”.

Promover um fluxo de " Data Refinery " para um espaço

Os espaços de implantação são usados para gerenciar um conjunto de ativos relacionados em um ambiente separado dos seus projetos. Você usa um espaço para preparar dados para um trabalho de implementação. Você pode transferir fluxos do " Data Refinery " de vários projetos para um único espaço. Conclua as etapas do fluxo “ Data Refinery ” antes de promovê-lo, pois o fluxo “ Data Refinery ” não pode ser editado em um espaço.

Para promover um fluxo Data Refinery em um espaço, vá para a guia Assets (Ativos ) do projeto, expanda F lows (Fluxos) e clique em Data Refinery flow (Fluxo ). Selecione o fluxo Data Refinery. Clique no ícone menu overflow de menu de opções do fluxo “ Data Refinery ” e selecione “Promover ”. O arquivo de origem do fluxo “ Data Refinery ” e quaisquer outros dados dependentes também serão promovidos.

menu overflowPara criar ou executar uma tarefa do fluxo “ Data Refinery ” em um espaço, acesse a guia “Ativos” do espaço, role a página até o fluxo “ Data Refinery ” e clique no ícone Ícone de novo emprego “Nova tarefa” no menu de opções adicionais. Para executar trabalhos, você precisa de uma chave de API de usuário. Normalmente, ele é criado automaticamente quando você cria seu primeiro trabalho. Você também pode criar manualmente uma chave de API em seu perfil e configurações. Se você já criou a tarefa, acesse a guia “Tarefas” para editá-la ou visualizar os detalhes da execução. O resultado final do fluxo de trabalho “ Data Refinery ” estará disponível na guia “Ativos” do espaço. Você precisa ter a função de Administrador ou Editor para visualizar os detalhes da tarefa, editá-la ou executá-la. Com a função de Visualizador no projeto, você só pode visualizar os detalhes da tarefa. Você pode usar a saída modelada como dados de entrada para um trabalho.

Restrição:

Quando você promove um fluxo do tipo “ Data Refinery ” de um projeto para um espaço e o destino do fluxo “ Data Refinery ” é um ativo de dados conectado, é necessário promover manualmente o ativo de dados conectado. Essa ação garante que os dados do ativo de dados conectado sejam atualizados quando você executar o trabalho de fluxo “ Data Refinery ” no espaço. Caso contrário, uma execução bem-sucedida da tarefa de fluxo “ Data Refinery ” criará um novo ativo de dados no espaço.

Para obter informações sobre espaços, consulte Espaços de implantação.

Exportar os dados de fluxo da Data Refinery com ativos do projeto

Você também pode exportar um fluxo de Data Refinery exportando os ativos do projeto. Para obter mais informações, consulte Exportando ativos do projeto.