Gerenciando fluxos do Data Refinery
Um fluxo do Data Refinery é um conjunto ordenado de etapas para purificar, modelar e aprimorar dados. À medida que você refina seus dados por aplicando operações a um conjunto de dados, você constrói dinamicamente um fluxo de Data Refinery customizado que você pode modificar em tempo real e economizar para uso futuro.
São ações que você pode fazer enquanto refina seus dados:
Trabalhando com o fluxo Data Refinery
- Salvar um fluxo do Data Refinery
- Executar ou planejar uma tarefa para fluxo do Data Refinery
- Renomear um fluxo do Data Refinery
- Criar um fluxo do Data Refinery por meio de programação
Etapas
- Desfazer ou refazer uma etapa
- Editar, duplicar, inserir ou excluir uma etapa
- Visualizar as etapas de fluxo de Data Refinery em uma "visualização instantânea"
- Exportar os dados de fluxo do Data Refinery para um arquivo CSV
Trabalhando com os conjuntos de dados
- Mudar a origem de um fluxo do Data Refinery
- Editar o tamanho da amostra
- Editar as propriedades de origem
- Alterar o destino de um fluxo do Data Refinery
- Editar as propriedades de destino
- Alterar o nome do destino de fluxo Data Refinery
Ações na página do projeto
- Reabrir um fluxo do Data Refinery para continuar trabalhando
- Duplicar um fluxo do Data Refinery
- Excluir um fluxo do Data Refinery
- Promover um fluxo do Data Refinery para um espaço
- Exportar os dados de fluxo do Data Refinery com os ativos do projeto
Trabalhando com o fluxo Data Refinery
Salvar um fluxo do Data Refinery
Salve um fluxo do " Data Refinery " clicando no ícone
"Salvar fluxo do ' Data Refinery '" na barra de ferramentas do " Data Refinery ". Os fluxos do Data Refinery são salvos no projeto em que você está trabalhando. Salve um fluxo do Data Refinery para que seja possível continuar refinando um conjunto de dados posteriormente.
A saída padrão do fluxo Data Refinery é salva como um ativo de dados source-file-name_shaped.csv. Por exemplo, se o arquivo de origem for mydata.csv, o nome e a saída padrão para o fluxo do Data Refinery serão mydata_csv_shaped. É possível editar o nome e adicionar uma extensão mudando o destino de um fluxo do Data Refinery.
Se as pastas estiverem habilitadas no seu projeto, você poderá salvar o fluxo e a saída do seu Data Refinery em pastas.
Você pode editar a localização do fluxo e o destino no painel
“Informações da visualização” ou no ícone “Configurações do fluxo ”.
Executar ou planejar uma tarefa para um fluxo do Data Refinery
O Data Refinery suporta conjuntos de dados grandes, que podem ser demorados e difíceis de refinar. Para que você possa trabalhar de forma rápida e eficiente, o Data Refinery opera em um subconjunto de amostra de linhas no conjunto de dados. O tamanho da amostra é de 1 MB ou 10.000 linhas, o que vier primeiro. Ao executar uma tarefa para o fluxo do Data Refinery, o conjunto de dados inteiro é processado. Ao executar a tarefa, você seleciona o tempo de execução e pode incluir um planejamento único ou repetido.
No programa " Data Refinery ", na barra de ferramentas " Data Refinery ", clique no ícone "Jobs " e, em seguida, selecione "Salvar e criar uma tarefa " ou "Salvar e visualizar tarefas ".
Depois de salvar um fluxo do Data Refinery, também é possível criar um trabalho para ele na página Projeto.
Vá para a guia "Ativos ", selecione o fluxo " Data Refinery " e escolha "Nova tarefa" no ícone de transbordamento.
É necessário ter a função de Administrador ou Editor para visualizar os detalhes da tarefa ou para editar ou executar a tarefa. Com a função Visualizador para o projeto, é possível apenas visualizar os detalhes da tarefa.
Para executar tarefas, você precisa de uma chave API de usuário. Normalmente, ele é criado automaticamente quando você cria seu primeiro trabalho. Você também pode criar manualmente uma chave API a partir do seu Perfil e configurações.
Para obter mais informações sobre empregos, consulte Criando empregos em Data Refinery.
Renomear um fluxo do Data Refinery
Na barra de ferramentas do Data Refinery, abra o painel "Exibir informações ". Ou clique no ícone
de configurações do Flow e acesse a guia Geral.
Crie fluxos d Data Refinery mente por meio de programação, sem usar a interface do usuário
Você pode criar fluxos d Data Refinery mente por meio de programação, utilizando o atributo ` shaperAPICreated ` na API. Essa funcionalidade permite que você:
- Use APIs externas para criar fluxos d Data Refinery.
- Use integrações de terceiros para criar fluxos com operações de modelagem.
- Use fluxos de trabalho automatizados para criar pipelines de transformação de dados.
- Use aplicativos personalizados para criar fluxos d Data Refinery s sem utilizar a interface do usuário.
Para obter mais informações, consulte a documentação da API: <hostname:port_number>/v2/data_flow_spark/docs/swagger/index.html
Etapas
Desfazer ou refazer um passo
Clique no ícone
"Desfazer" ou no ícone
"Refazer" na barra de ferramentas.
Editar, duplicar, inserir ou excluir uma etapa
No painel "Etapas", clique no ícone
de transbordamento na etapa da operação que você deseja alterar. Selecione a ação (Editar, Duplicar, Inserir etapa antes, Inserir etapa apósou Excluir)
Se você selecionar Editar, Data Refinery vai para o modo de edição e ou exibe a operação a ser editada na linha de comando ou na área de janela da Operação. Aplicar a operação editada.
Se você selecionar Duplicate, a etapa duplicada será inserida após a etapa selecionada.
A ação Duplicar não está disponível para as operações de Junção ou União
Data Refinery atualiza o fluxo Data Refinery para refletir as mudanças e reprises todas as operações.
Visualizar as etapas de fluxo de Data Refinery em uma "visualização instantânea"
Para ver a aparência de seus dados a qualquer momento, clique em uma etapa anterior para colocar o Data Refinery em visualização de captura instantânea. Por exemplo, se você clicar em Fonte de dados, você verá quais seus dados pareciam antes de você começar a refiná-lo. Clique em qualquer etapa de operação para ver a aparência de seus dados depois que a operação foi aplicada. Para deixar a visualização do instantâneo, clique em Viewing step x of y ou clique na mesma etapa que você selecionou para entrar em visualização instantânea.
Exportar os dados de fluxo do Data Refinery para um arquivo CSV
Clique no ícone
Exportar na barra de ferramentas para exportar os dados da etapa atual do seu fluxo do Data Refinery para um arquivo do CSV sem salvar ou executar uma tarefa do fluxo do Data Refinery. Use esta opção, por exemplo, se desejar uma saída rápida de um fluxo de e Data Refinery e que está em andamento. Quando você exporta os dados, um arquivo CSV é criado e baixado para a pasta Downloads do seu computador (ou para o local de download especificado pelo usuário) na etapa atual do fluxo Data Refinery. Se você estiver na visualização instantânea, a saída do arquivo CSV estará na etapa em que você clicou. Se você estiver visualizando uma amostra (subconjunto) dos dados, apenas os dados da amostra estarão na saída.
Se o seu arquivo CSV contiver qualquer carga maliciosa (fórmulas, por exemplo) em um campo de entrada, esses itens poderão ser executados.
Você também pode exportar um fluxo de Data Refinery exportando os ativos do projeto. Para obter mais informações, consulte Exportando ativos do projeto.
Trabalhando com os conjuntos de dados
Mudar a origem de um fluxo do Data Refinery
Alterar a origem de um fluxo de Data Refinery . Execute o mesmo fluxo do Data Refinery, mas com um conjunto de dados de origem diferente. Se as pastas estiverem habilitadas no seu projeto, você pode navegar pelas pastas para selecionar um conjunto de dados de origem. Há duas maneiras que você pode alterar a origem:
No painel "Etapas ": clique no ícone
de menu suspenso ao lado de "Fonte de dados ", selecione "Editar " e, em seguida, escolha um conjunto de dados de origem diferente.

Nas configurações do Flow: Você pode usar este método se quiser alterar mais de uma fonte de dados no mesmo lugar. Por exemplo, para uma operação de Join ou de União.
Na barra de ferramentas, clique no ícone de configurações do fluxo. Vá até a guia “Conjuntos de dados de origem” e clique no ícone
de menu suspenso ao lado da fonte de dados. Selecione Substituir origem de dadose, em seguida, escolha um conjunto de dados de origem diferente
Para melhores resultados, o novo conjunto de dados deve ter um esquema que seja compatível ao conjunto de dados original (por exemplo, nomes de colunas, número de colunas e tipos de dados). Se o novo conjunto de dados tiver um esquema diferente, as operações que não funcionarem com o esquema mostrarão erros. É possível editar ou excluir as operações ou mudar a origem para uma que tenha um esquema mais compatível.
Se você escolher uma conexão para um destino, só poderá usar uma conexão da lista de fontes de dados compatíveis com o Data Refinery.
Editar o tamanho da amostra
Quando você executa a tarefa para o fluxo Data Refinery , as operações são realizadas no conjunto de dados completo. No entanto, quando você aplica as operações de forma interativa em Data Refinery, dependendo do tamanho do conjunto de dados, você visualize apenas uma amostra dos dados.
Aumente o tamanho da amostra para ver resultados que estarão mais próximos dos resultados do trabalho de fluxo Data Refinery , mas esteja ciente de que pode demorar mais para visualizar os resultados em Data Refinery. O máximo é uma contagem de topo de linha de 10.000 linhas ou 1 MB, consoante o que vier em primeiro lugar. Diminua o tamanho da amostra para visualizar resultados mais rápidos. Dependendo do tamanho dos dados e do número e da complexidade das operações, você pode desejar experimentar o tamanho da amostra para ver o que funciona melhor para o conjunto de dados.
Na barra de ferramentas, clique no ícone de configurações do fluxo. Vá até a guia “Conjuntos de dados de origem ”, clique no ícone
de menu suspenso ao lado da fonte de dados e selecione “Editar amostra ”.
Editar as propriedades de origem
As propriedades disponíveis dependem da fonte de dados. Diferentes propriedades estão disponíveis para ativos de dados e para dados de diferentes tipos de conexões. Altere o formato de arquivo apenas se o formato de arquivo inferido estiver incorreto. Se você alterar o formato de arquivo, a origem é lida com o novo formato, mas o arquivo de origem permanece inalterado. Alterar as propriedades de origem do formato pode ser um processo iterativo. Inspecione seus dados depois de aplicar uma opção.
Na barra de ferramentas, clique no ícone de configurações do fluxo. Vá até a guia “Conjuntos de dados de origem ”, clique no ícone
de mais opções ao lado da fonte de dados e selecione “Editar formato ”.
Alterar o destino de um fluxo do Data Refinery
Por padrão, o alvo da Data Refinery é salvo como um ativo de dados no projeto em que você está trabalhando.
Para alterar o local de destino, clique no ícone
Configurações do fluxo na barra de ferramentas. Acesse a guia Conjunto de dados de destino , clique em Selecionar destinoe selecione um local de destino diferente Se as pastas estiverem habilitadas no seu projeto, você pode navegar pelas pastas para selecionar uma pasta de destino.
Se você escolher uma conexão para um destino, só poderá usar uma conexão da lista de fontes de dados compatíveis com o Data Refinery. Algumas dessas conexões só podem ser usadas como fonte para um fluxo Data Refinery.
Editar as propriedades de destino
As propriedades disponíveis dependem da fonte de dados. Diferentes propriedades estão disponíveis para ativos de dados e para dados de diferentes tipos de conexões.
Para alterar as propriedades do conjunto de dados de destino, clique no ícone
Configurações do fluxo na barra de ferramentas. Vá para a guia Conjunto de dados de destino e clique em Editar propriedades
Alterar o nome do destino de fluxo Data Refinery
O nome do conjunto de dados de destino está incluído nos campos que você pode alterar quando você editar as propriedades de destino.
Por padrão, o destino do Data Refinery é salvo como um source-file-name_shaped.csv do ativo de dados no projeto, Por exemplo, se a origem for mydata.csv, o nome e a saída padrão para o fluxo do Data Refinery será o ativo de dados mydata_csv_shaped
Diferentes propriedades e convenções de nomenclatura aplicam-se a um conjunto de dados de destino a partir de uma conexão. Por exemplo, se o conjunto de dados estiver em Cloud Object Storage, o conjunto de dados é identificado nos campos Bucket e Nome do arquivo . Se o conjunto de dados estiver em um banco de dados Db2 , o conjunto de dados será identificado nos campos Schema name e Table name .
Para obter mais informações, consulte Opções de conexão de destino.
Ações na página do projeto
Reabrir um fluxo do Data Refinery para continuar trabalhando
Para reabrir um fluxo do Data Refinery e continuar refinando seus dados, acesse a guia Ativos do projeto. Sob Tipos de ativos, expanda Flows, clique em Data Refinery fluir. Clique no nome do fluxo do Data Refinery.
Duplicar um fluxo do Data Refinery
Para criar uma cópia de um fluxo do Data Refinery , acesse a guia Ativos do projeto, expanda Fluxos, clique em Data Refinery.
Selecione o fluxo “ Data Refinery ” e, em seguida, selecione “Duplicar” no ícone de menu suspenso. O fluxo do Data Refinery é adicionado à lista de fluxos do Data Refinery como "nome original cópia 1".
Excluir um fluxo do Data Refinery
Para excluir um fluxo do Data Refinery , acesse a guia Ativos do projeto, expanda Fluxos, clique em Data Refinery
Selecione o fluxo “ Data Refinery ” e, em seguida, selecione “Excluir” no ícone “Overflow ”.
Promover um fluxo do Data Refinery para um espaço
Os espaços de implementação são usados para gerenciar um conjunto de ativos relacionados em um ambiente separado de seus projetos. Você usa um espaço para preparar dados para um trabalho de implementação. É possível promover fluxos do Data Refinery por meio de diversos projetos para um único espaço. Conclua as etapas no fluxo do Data Refinery antes de promovê-lo porque o fluxo do Data Refinery não é editável em um espaço.
Para promover um fluxo Data Refinery em um espaço, vá para a guia Assets (Ativos ) do projeto, expanda F lows (Fluxos) e clique em Data Refinery flow (Fluxo ). Selecione o fluxo Data Refinery. Clique no ícone
de menu de opções do fluxo “ Data Refinery ” e selecione “Promover ”. O arquivo de origem para o fluxo do Data Refinery e quaisquer outros dados dependentes serão promovidos também.
Para criar ou executar uma tarefa do fluxo “ Data Refinery ” em um espaço, acesse a guia “Ativos” do espaço, role a página até o fluxo “ Data Refinery ” e clique no ícone
“Nova tarefa” no menu de opções adicionais. Para executar trabalhos, você precisa de uma chave de API de usuário. Normalmente, ele é criado automaticamente quando você cria seu primeiro trabalho. Você também pode criar manualmente uma chave de API em seu perfil e configurações. Se você já criou a tarefa, acesse a guia Tarefas para editar a tarefa ou visualizar os detalhes da execução da tarefa. A saída em forma de tarefa de fluxo do Data Refinery estará disponível na guia Ativos do espaço. É necessário ter a função de Administrador ou Editor para visualizar os detalhes da tarefa ou para editar ou executar a tarefa. Com a função Visualizador para o projeto, é possível apenas visualizar os detalhes da tarefa. Você pode usar a saída modelada como dados de entrada para um trabalho.
Quando você promove um fluxo do Data Refinery de um projeto para um espaço e o destino do fluxo do Data Refinery é um ativo de dados conectado, deve-se promover manualmente o ativo de dados conectado. Esta ação assegura que os dados do ativo de dados conectados sejam atualizados quando você executa a tarefa de fluxo do Data Refinery no espaço. Caso contrário, uma execução bem-sucedida da tarefa de fluxo do Data Refinery criará um novo ativo de dados no espaço.
Para obter informações sobre espaços, consulte Espaços de implementação.
Exportar os dados de fluxo da Data Refinery com ativos do projeto
Você também pode exportar um fluxo de Data Refinery exportando os ativos do projeto. Para obter mais informações, consulte Exportando ativos do projeto.