Nugget do modelo de extensão

O nugget do modelo de extensão é gerado e colocado em sua tela de fluxo após a execução do nó Modelo de extensão, que contém seu script R ou script Python for Spark que define a construção e pontuação do modelo.

Por padrão, o nugget do modelo de extensão contém o script que é usado para pontuação do modelo, opções para ler os dados e qualquer saída do console R ou Python para Spark. Opcionalmente, o nugget do modelo de extensão também pode conter várias outras formas de saída do modelo, como gráficos e saída de texto. Depois que o nugget do modelo de extensão é gerado e incluído em sua tela de fluxo, um nó de saída pode ser conectado a ele. O nó de saída é então usado da maneira usual em seu fluxo para obter informações sobre os dados e modelos e para exportar dados em vários formatos.

guia Sintaxe

Sintaxe de pontuação do modelo R. Se estiver usando R, o script R que é usado para pontuação do modelo é exibido neste campo. Por padrão, este campo é ativado mas não editável. Para editar o script de pontuação do modelo Python, clique em Editar.

Sintaxe de pontuação do modelo Python. Se estiver usando Python for Spark, o script Python usado para pontuação de modelo é exibido neste campo. Por padrão, este campo é ativado mas não editável. Para editar o script de pontuação do modelo Python, clique em Editar.

Se você clicar Editar para tornar o campo de sintaxe de pontuação editável, é possível editar seu script de pontuação de modelo digitando no campo de sintaxe de pontuação. Por exemplo, você pode querer editar seu script de pontuação de modelo se identificar um erro em seu script de pontuação de modelo depois de executar o nó Modelo de Extensão para gerar um nugget do modelo de extensão. Quaisquer mudanças feitas no script de pontuação do modelo no nugget do modelo de extensão serão perdidas se você regenerar o modelo executando o nó Modelo de Extensão novamente.

Guia Opções de modelo

Leia as opções de dados. Essas opções se aplicam apenas ao R, não ao Python for Spark. Com essas opções, é possível especificar como os valores omissos, os campos de sinalização e as variáveis com formatos de data ou data/hora são manipulados.

  • Ler dados em lotes. Se você estiver processando uma grande quantidade de dados (que são muito grandes para caber na memória do mecanismo R, por exemplo), use esta opção para dividir os dados em lotes que podem ser enviados e processados individualmente. Especifique o número máximo de registros de dados a serem incluídos em cada lote.

    Tanto para o nó de transformação de extensão quanto para o nugget do modelo de extensão, os dados passam pelo script R (em lote). Por esse motivo, os scripts para pontuação de modelo e nós de processo executados em um ambiente Hadoop ou de banco de dados não devem incluir operações que abrangem ou combinam linhas nos dados, como classificação ou agregação. Essa limitação é imposta para garantir que os dados possam ser divididos em um ambiente Hadoop e durante a mineração dentro da base de dados. Os nós de Saída de Extensão e de Modelo de Extensão não têm essa limitação.

  • Converter campos de sinalização. Especifica como os campos de sinalização são tratados. Há duas opções: Sequências para fator, Números inteiros e reais para dobro e Valores lógicos (True, False). Se você selecionar Valores lógicos (True, False) os valores originais dos campos de sinalização serão perdidos. Por exemplo, se um campo tem valores Male e Female, estes são alterados para True e False.
  • Converter os valores ausentes para o valor R 'não disponível' (NA). Quando selecionados, quaisquer valores ausentes são convertidos para o RNAvalor. O valorNAé usado por R para identificar valores ausentes. Algumas funções R que você usa podem ter um argumento que pode controlar como a função se comporta quando os dados contémNA. Por exemplo, a função pode permitir que você opte por excluir automaticamente registros que contenhamNA. Se essa opção não for selecionada, quaisquer valores ausentes são passados para R inalterados, e podem causar erros quando seu script R for executado.
  • Converter campos de data/hora em classes de R com controle especial para fusos horários Quando selecionado, as variáveis com os formatos de hora ou data/hora são convertidos em objetos de data/hora de R. Você deve selecionar uma das seguintes opções:
    • R POSIXct. Variáveis com formatos date ou datetime são convertidos em RPOSIXct.
    • R POSIXlt (lista). Variáveis com formatos date ou datetime são convertidos em RPOSIXlt.
    Nota: Os formatos POSIX são opções avançadas. Use essas opções somente se o script R especificar que os campos data/hora sejam tratados de uma forma que requeira esses formatos. Os formatos POSIX não se aplicam a variáveis com formatos de hora.
As opções que você seleciona para os Campos de conversão de sinalizador, Converter valores ausentes para o valor R 'não disponível' (NA) e os Campos de data/hora para classes R com controle especial para controles de fuso horário não são reconhecidas quando o nugget do modelo de extensão é executado em um banco de dados. Quando o nó é executado em um banco de dados, os valores padrão para esses controles são usados:
  • Campos de conversão de sinalização é configurado como Sequências para fatorar, números inteiros e reais para dobrar
  • Converter valores ausentes para o valor R 'não disponível' (NA) é selecionado
  • Converter campos de data / hora em classes R com controle especial para fusos horários não é selecionado

Guia de saída de console

A guia Saída de console contém qualquer saída que é recebida quando o script R script ou Python for Spark na guia Sintaxe é executado (por exemplo, se usar um script R, ele mostrará a saída recebida do console R quando o script R no campo Sintaxe de pontuação do modelo R na guia Sintaxe do Nugget do modelo de extensão é executado). Essa saída inclui quaisquer mensagens de erro ou avisos R ou Python produzidos quando o script R ou Python é executado e qualquer saída de texto do console R. A saída pode ser usada, principalmente, para depurar o script.

Cada vez que o script de pontuação do modelo é executado, o conteúdo da guia Saída de console é sobrescrito com a saída recebida do console R ou Python for Spark. Você não pode editar a saída de console.