Gerenciando fluxos do Data Refinery

Um fluxo do Data Refinery é um conjunto ordenado de etapas para purificar, modelar e aprimorar dados. À medida que você refina seus dados por aplicando operações a um conjunto de dados, você constrói dinamicamente um fluxo de Data Refinery customizado que você pode modificar em tempo real e economizar para uso futuro.

São ações que você pode fazer enquanto refina seus dados:

Trabalhando com o fluxo Data Refinery

Etapas

Trabalhando com os conjuntos de dados

Ações na página do projeto

Trabalhando com o fluxo Data Refinery

Salvar um fluxo do Data Refinery

Salve um fluxo do " Data Refinery " clicando no ícone Ícone de fluxo do Data Refinery "Salvar fluxo do ' Data Refinery '" na barra de ferramentas do " Data Refinery ". Os fluxos do Data Refinery são salvos no projeto em que você está trabalhando. Salve um fluxo do Data Refinery para que seja possível continuar refinando um conjunto de dados posteriormente.

A saída padrão do fluxo Data Refinery é salva como um ativo de dados source-file-name_shaped.csv. Por exemplo, se o arquivo de origem for mydata.csv, o nome e a saída padrão para o fluxo do Data Refinery serão mydata_csv_shaped. É possível editar o nome e adicionar uma extensão mudando o destino de um fluxo do Data Refinery.

Se as pastas estiverem habilitadas no seu projeto, você poderá salvar o fluxo e a saída do seu Data Refinery em pastas. Ícone da área de janela de informaçõesVocê pode editar a localização do fluxo e o destino no painel Ícone da área de janela de informações “Informações da visualização” ou no ícone “Configurações do fluxo ”.

Executar ou planejar uma tarefa para um fluxo do Data Refinery

O Data Refinery suporta conjuntos de dados grandes, que podem ser demorados e difíceis de refinar. Para que você possa trabalhar de forma rápida e eficiente, o Data Refinery opera em um subconjunto de amostra de linhas no conjunto de dados. O tamanho da amostra é de 1 MB ou 10.000 linhas, o que vier primeiro. Ao executar uma tarefa para o fluxo do Data Refinery, o conjunto de dados inteiro é processado. Ao executar a tarefa, você seleciona o tempo de execução e pode incluir um planejamento único ou repetido.

Ícone de tarefas.No programa " Data Refinery ", na barra de ferramentas " Data Refinery ", clique no ícone "Jobs " e, em seguida, selecione "Salvar e criar uma tarefa " ou "Salvar e visualizar tarefas ".

Depois de salvar um fluxo do Data Refinery, também é possível criar um trabalho para ele na página Projeto. menu overflowVá para a guia "Ativos ", selecione o fluxo " Data Refinery " e escolha "Nova tarefa" no ícone de transbordamento.

É necessário ter a função de Administrador ou Editor para visualizar os detalhes da tarefa ou para editar ou executar a tarefa. Com a função Visualizador para o projeto, é possível apenas visualizar os detalhes da tarefa.

Para executar tarefas, você precisa de uma chave API de usuário. Normalmente, ele é criado automaticamente quando você cria seu primeiro trabalho. Você também pode criar manualmente uma chave API a partir do seu Perfil e configurações.

Para obter mais informações sobre empregos, consulte Criando empregos em Data Refinery.

Renomear um fluxo do Data Refinery

Ícone da área de janela de informaçõesNa barra de ferramentas do Data Refinery, abra o painel "Exibir informações ". Ou clique no ícone Ícone da área de janela de informações de configurações do Flow e acesse a guia Geral.

Crie fluxos d Data Refinery mente por meio de programação, sem usar a interface do usuário

Você pode criar fluxos d Data Refinery mente por meio de programação, utilizando o atributo ` shaperAPICreated ` na API. Essa funcionalidade permite que você:

  • Use APIs externas para criar fluxos d Data Refinery.
  • Use integrações de terceiros para criar fluxos com operações de modelagem.
  • Use fluxos de trabalho automatizados para criar pipelines de transformação de dados.
  • Use aplicativos personalizados para criar fluxos d Data Refinery s sem utilizar a interface do usuário.

Para obter mais informações, consulte a documentação da API: <hostname:port_number>/v2/data_flow_spark/docs/swagger/index.html

Etapas

Desfazer ou refazer um passo

Clique no ícone Ícone Desfazer "Desfazer" ou no ícone Ícone Refazer "Refazer" na barra de ferramentas.

Editar, duplicar, inserir ou excluir uma etapa

No painel "Etapas", clique no ícone menu overflow de transbordamento na etapa da operação que você deseja alterar. Selecione a ação (Editar, Duplicar, Inserir etapa antes, Inserir etapa apósou Excluir)

  • Se você selecionar Editar, Data Refinery vai para o modo de edição e ou exibe a operação a ser editada na linha de comando ou na área de janela da Operação. Aplicar a operação editada.

  • Se você selecionar Duplicate, a etapa duplicada será inserida após a etapa selecionada.

Nota:

A ação Duplicar não está disponível para as operações de Junção ou União

Data Refinery atualiza o fluxo Data Refinery para refletir as mudanças e reprises todas as operações.

Visualizar as etapas de fluxo de Data Refinery em uma "visualização instantânea"

Para ver a aparência de seus dados a qualquer momento, clique em uma etapa anterior para colocar o Data Refinery em visualização de captura instantânea. Por exemplo, se você clicar em Fonte de dados, você verá quais seus dados pareciam antes de você começar a refiná-lo. Clique em qualquer etapa de operação para ver a aparência de seus dados depois que a operação foi aplicada. Para deixar a visualização do instantâneo, clique em Viewing step x of y ou clique na mesma etapa que você selecionou para entrar em visualização instantânea.

Exportar os dados de fluxo do Data Refinery para um arquivo CSV

Clique no ícone Ícone de Exportar Exportar na barra de ferramentas para exportar os dados da etapa atual do seu fluxo do Data Refinery para um arquivo do CSV sem salvar ou executar uma tarefa do fluxo do Data Refinery. Use esta opção, por exemplo, se desejar uma saída rápida de um fluxo de e Data Refinery e que está em andamento. Quando você exporta os dados, um arquivo CSV é criado e baixado para a pasta Downloads do seu computador (ou para o local de download especificado pelo usuário) na etapa atual do fluxo Data Refinery. Se você estiver na visualização instantânea, a saída do arquivo CSV estará na etapa em que você clicou. Se você estiver visualizando uma amostra (subconjunto) dos dados, apenas os dados da amostra estarão na saída.

Nota:

Se o seu arquivo CSV contiver qualquer carga maliciosa (fórmulas, por exemplo) em um campo de entrada, esses itens poderão ser executados.

Você também pode exportar um fluxo de Data Refinery exportando os ativos do projeto. Para obter mais informações, consulte Exportando ativos do projeto.

Trabalhando com os conjuntos de dados

Mudar a origem de um fluxo do Data Refinery

Alterar a origem de um fluxo de Data Refinery . Execute o mesmo fluxo do Data Refinery, mas com um conjunto de dados de origem diferente. Se as pastas estiverem habilitadas no seu projeto, você pode navegar pelas pastas para selecionar um conjunto de dados de origem. Há duas maneiras que você pode alterar a origem:

  • No painel "Etapas ": clique no ícone menu overflow de menu suspenso ao lado de "Fonte de dados ", selecione "Editar " e, em seguida, escolha um conjunto de dados de origem diferente.
    Editar origem

  • Nas configurações do Flow: Você pode usar este método se quiser alterar mais de uma fonte de dados no mesmo lugar. Por exemplo, para uma operação de Join ou de União. Configurações de fluxoNa barra de ferramentas, clique no ícone de configurações do fluxo. Vá até a guia “Conjuntos de dados de origem” e clique no ícone menu overflow de menu suspenso ao lado da fonte de dados. Selecione Substituir origem de dadose, em seguida, escolha um conjunto de dados de origem diferente

Para melhores resultados, o novo conjunto de dados deve ter um esquema que seja compatível ao conjunto de dados original (por exemplo, nomes de colunas, número de colunas e tipos de dados). Se o novo conjunto de dados tiver um esquema diferente, as operações que não funcionarem com o esquema mostrarão erros. É possível editar ou excluir as operações ou mudar a origem para uma que tenha um esquema mais compatível.

Se você escolher uma conexão para um destino, só poderá usar uma conexão da lista de fontes de dados compatíveis com o Data Refinery.

Editar o tamanho da amostra

Quando você executa a tarefa para o fluxo Data Refinery , as operações são realizadas no conjunto de dados completo. No entanto, quando você aplica as operações de forma interativa em Data Refinery, dependendo do tamanho do conjunto de dados, você visualize apenas uma amostra dos dados.

Aumente o tamanho da amostra para ver resultados que estarão mais próximos dos resultados do trabalho de fluxo Data Refinery , mas esteja ciente de que pode demorar mais para visualizar os resultados em Data Refinery. O máximo é uma contagem de topo de linha de 10.000 linhas ou 1 MB, consoante o que vier em primeiro lugar. Diminua o tamanho da amostra para visualizar resultados mais rápidos. Dependendo do tamanho dos dados e do número e da complexidade das operações, você pode desejar experimentar o tamanho da amostra para ver o que funciona melhor para o conjunto de dados.

Configurações de fluxoNa barra de ferramentas, clique no ícone de configurações do fluxo. Vá até a guia “Conjuntos de dados de origem ”, clique no ícone menu overflow de menu suspenso ao lado da fonte de dados e selecione “Editar amostra ”.

Editar as propriedades de origem

As propriedades disponíveis dependem da fonte de dados. Diferentes propriedades estão disponíveis para ativos de dados e para dados de diferentes tipos de conexões. Altere o formato de arquivo apenas se o formato de arquivo inferido estiver incorreto. Se você alterar o formato de arquivo, a origem é lida com o novo formato, mas o arquivo de origem permanece inalterado. Alterar as propriedades de origem do formato pode ser um processo iterativo. Inspecione seus dados depois de aplicar uma opção.

Configurações de fluxoNa barra de ferramentas, clique no ícone de configurações do fluxo. Vá até a guia “Conjuntos de dados de origem ”, clique no ícone menu overflow de mais opções ao lado da fonte de dados e selecione “Editar formato ”.

Importante: Use cuidado se você editar as propriedades de origem. Seleções incorretas podem produzir resultados inesperados quando os dados são lidos ou impar a tarefa de fluxo Data Refinery . Inspecionar os resultados da Data Refinery fluir cuidadosamente.

Alterar o destino de um fluxo do Data Refinery

Por padrão, o alvo da Data Refinery é salvo como um ativo de dados no projeto em que você está trabalhando.

Para alterar o local de destino, clique no ícone Configurações de fluxo Configurações do fluxo na barra de ferramentas. Acesse a guia Conjunto de dados de destino , clique em Selecionar destinoe selecione um local de destino diferente Se as pastas estiverem habilitadas no seu projeto, você pode navegar pelas pastas para selecionar uma pasta de destino.

Se você escolher uma conexão para um destino, só poderá usar uma conexão da lista de fontes de dados compatíveis com o Data Refinery. Algumas dessas conexões só podem ser usadas como fonte para um fluxo Data Refinery.

Editar as propriedades de destino

As propriedades disponíveis dependem da fonte de dados. Diferentes propriedades estão disponíveis para ativos de dados e para dados de diferentes tipos de conexões.

Para alterar as propriedades do conjunto de dados de destino, clique no ícone Configurações de fluxo Configurações do fluxo na barra de ferramentas. Vá para a guia Conjunto de dados de destino e clique em Editar propriedades

Alterar o nome do destino de fluxo Data Refinery

O nome do conjunto de dados de destino está incluído nos campos que você pode alterar quando você editar as propriedades de destino.

Por padrão, o destino do Data Refinery é salvo como um source-file-name_shaped.csv do ativo de dados no projeto, Por exemplo, se a origem for mydata.csv, o nome e a saída padrão para o fluxo do Data Refinery será o ativo de dados mydata_csv_shaped

Diferentes propriedades e convenções de nomenclatura aplicam-se a um conjunto de dados de destino a partir de uma conexão. Por exemplo, se o conjunto de dados estiver em Cloud Object Storage, o conjunto de dados é identificado nos campos Bucket e Nome do arquivo . Se o conjunto de dados estiver em um banco de dados Db2 , o conjunto de dados será identificado nos campos Schema name e Table name .

Importante: Use cuidado se você editar as propriedades de destino. Seleções incorretas podem produzir resultados inesperados ou impar o job flow Data Refinery . Inspecionar os resultados da Data Refinery fluir cuidadosamente.

Para obter mais informações, consulte Opções de conexão de destino.

Ações na página do projeto

Reabrir um fluxo do Data Refinery para continuar trabalhando

Para reabrir um fluxo do Data Refinery e continuar refinando seus dados, acesse a guia Ativos do projeto. Sob Tipos de ativos, expanda Flows, clique em Data Refinery fluir. Clique no nome do fluxo do Data Refinery.

Duplicar um fluxo do Data Refinery

Para criar uma cópia de um fluxo do Data Refinery , acesse a guia Ativos do projeto, expanda Fluxos, clique em Data Refinery. menu overflowSelecione o fluxo “ Data Refinery ” e, em seguida, selecione “Duplicar” no ícone de menu suspenso. O fluxo do Data Refinery é adicionado à lista de fluxos do Data Refinery como "nome original cópia 1".

Excluir um fluxo do Data Refinery

Para excluir um fluxo do Data Refinery , acesse a guia Ativos do projeto, expanda Fluxos, clique em Data Refinery menu overflowSelecione o fluxo “ Data Refinery ” e, em seguida, selecione “Excluir” no ícone “Overflow ”.

Promover um fluxo do Data Refinery para um espaço

Os espaços de implementação são usados para gerenciar um conjunto de ativos relacionados em um ambiente separado de seus projetos. Você usa um espaço para preparar dados para um trabalho de implementação. É possível promover fluxos do Data Refinery por meio de diversos projetos para um único espaço. Conclua as etapas no fluxo do Data Refinery antes de promovê-lo porque o fluxo do Data Refinery não é editável em um espaço.

Para promover um fluxo Data Refinery em um espaço, vá para a guia Assets (Ativos ) do projeto, expanda F lows (Fluxos) e clique em Data Refinery flow (Fluxo ). Selecione o fluxo Data Refinery. Clique no ícone menu overflow de menu de opções do fluxo “ Data Refinery ” e selecione “Promover ”. O arquivo de origem para o fluxo do Data Refinery e quaisquer outros dados dependentes serão promovidos também.

menu overflowPara criar ou executar uma tarefa do fluxo “ Data Refinery ” em um espaço, acesse a guia “Ativos” do espaço, role a página até o fluxo “ Data Refinery ” e clique no ícone Ícone de novo emprego “Nova tarefa” no menu de opções adicionais. Para executar trabalhos, você precisa de uma chave de API de usuário. Normalmente, ele é criado automaticamente quando você cria seu primeiro trabalho. Você também pode criar manualmente uma chave de API em seu perfil e configurações. Se você já criou a tarefa, acesse a guia Tarefas para editar a tarefa ou visualizar os detalhes da execução da tarefa. A saída em forma de tarefa de fluxo do Data Refinery estará disponível na guia Ativos do espaço. É necessário ter a função de Administrador ou Editor para visualizar os detalhes da tarefa ou para editar ou executar a tarefa. Com a função Visualizador para o projeto, é possível apenas visualizar os detalhes da tarefa. Você pode usar a saída modelada como dados de entrada para um trabalho.

Restrição:

Quando você promove um fluxo do Data Refinery de um projeto para um espaço e o destino do fluxo do Data Refinery é um ativo de dados conectado, deve-se promover manualmente o ativo de dados conectado. Esta ação assegura que os dados do ativo de dados conectados sejam atualizados quando você executa a tarefa de fluxo do Data Refinery no espaço. Caso contrário, uma execução bem-sucedida da tarefa de fluxo do Data Refinery criará um novo ativo de dados no espaço.

Para obter informações sobre espaços, consulte Espaços de implementação.

Exportar os dados de fluxo da Data Refinery com ativos do projeto

Você também pode exportar um fluxo de Data Refinery exportando os ativos do projeto. Para obter mais informações, consulte Exportando ativos do projeto.