Nó de saída de extensão

Com o nó Extension Output (Saída de extensão), você pode executar scripts escritos em R, Python ou Python para Spark para produzir saídas.

Depois de adicionar o nó à tela, clique duas vezes nele para abrir suas propriedades.

guia Sintaxe

Selecione seu tipo de sintaxe - R, Python ou Python para Spark. Em seguida, insira ou cole seu script customizado para a saída de dados. Quando sua sintaxe estiver pronta, é possível executar o nó. As opções a seguir estão disponíveis para a sintaxe R:
  • Converter campos de sinalização. Especifica como os campos de sinalização são tratados. Há duas opções: Sequências para fator, Números inteiros e reais para dobro e Valores lógicos (True, False). Se você selecionar Valores lógicos (True, False) os valores originais dos campos de sinalização serão perdidos. Por exemplo, se um campo tem valores Male e Female, estes são alterados para True e False.
  • Converter os valores ausentes para o valor R 'não disponível' (NA). Quando selecionados, quaisquer valores ausentes são convertidos para o RNAvalor. O valorNAé usado por R para identificar valores ausentes. Algumas funções R que você usa podem ter um argumento que pode controlar como a função se comporta quando os dados contémNA. Por exemplo, a função pode permitir que você opte por excluir automaticamente registros que contenhamNA. Se essa opção não for selecionada, quaisquer valores ausentes são passados para R inalterados, e podem causar erros quando seu script R for executado.
  • Converter campos de data/hora em classes de R com controle especial para fusos horários Quando selecionado, as variáveis com os formatos de hora ou data/hora são convertidos em objetos de data/hora de R. Você deve selecionar uma das seguintes opções:
    • R POSIXct. Variáveis com formatos date ou datetime são convertidos em RPOSIXct.
    • R POSIXlt (lista). Variáveis com formatos date ou datetime são convertidos em RPOSIXlt.
    Nota: Os formatos POSIX são opções avançadas. Use essas opções somente se o script R especificar que os campos data/hora sejam tratados de uma forma que requeira esses formatos. Os formatos POSIX não se aplicam a variáveis com formatos de hora.

Guia de saída de console

A guia Console Output (Saída do console) contém qualquer saída recebida quando o script R ou um script d Python e é executado (por exemplo, se você usar um script R, ela mostrará a saída recebida do console R quando o script R no campo R Syntax (Sintaxe R) na guia Syntax (Sintaxe) for executado). Essa saída pode incluir mensagens de erro R ou Python ou avisos que são produzidos quando o script R ou script Python é executado. A saída pode ser usada, principalmente, para depurar o script. A guia Saída de console também contém o script a partir do campo R Sintaxe ou Sintaxe Python.

Sempre que o script de importação de extensão é executado, o conteúdo da guia Saída do console é substituído pela saída recebida do console R ou Python. Não é possível editar a saída.

Observação: As mensagens de erro ou avisos do R ou Python resultantes da execução do script de saída de extensão são sempre exibidas na guia Saída do console.

Testes estatísticos

Você pode configurar o nó Saída da extensão para executar testes estatísticos em seus dados. Os exemplos a seguir são alguns dos testes que você pode executar.

Para ver exemplos desses testes, você pode baixar o fluxo de amostra extension-output-node-str.zip e importá-lo para SPSS Modeler. Para obter mais informações sobre importação, consulte Importando um fluxo do SPSS Modeler. Em seguida, abra as propriedades do nó Saída da extensão para ver a sintaxe de exemplo.

Testes T
Descrição

O teste t determina se há uma diferença significativa entre as médias dos dois grupos. O teste é valioso quando você tem amostras pequenas, nas quais o desvio padrão da população é desconhecido.

Cenário de exemplo
Uma empresa farmacêutica deseja testar se um novo medicamento reduz a pressão arterial de forma mais eficaz do que o tratamento padrão. Eles distribuem aleatoriamente 25 pacientes para cada grupo de tratamento e medem a redução da pressão arterial após 30 dias. Um teste t pode determinar se a diferença na redução média entre os grupos é estatisticamente significativa.
Python bibliotecas e funções R
Bibliotecas do Python
  • scipy.stats.ttest_ind() - Teste t para amostras independentes (variâncias iguais ou desiguais)
  • scipy.stats.ttest_rel() - Teste t para amostras emparelhadas
  • scipy.stats.ttest_1samp() - Teste t para uma amostra
Funções R
  • t.test() - Função abrangente para todos os tipos de teste t, com opções para testes pareados, de uma amostra e de duas amostras
  • var.test() - Teste de igualdade de variâncias (verificação prévia)
Testes F e Análise de Variância (ANOVA)
Descrição

O teste F é utilizado para comparar variâncias entre dois ou mais grupos. Ele constitui a base da Análise de Variância (ANOVA), que amplia o conceito do teste t para situações envolvendo três ou mais grupos. O teste F determina se a variabilidade entre as médias dos grupos é significativamente maior do que a variabilidade dentro dos grupos.

Cenário de exemplo

Uma rede de varejo deseja determinar se as pontuações médias de satisfação dos clientes diferem significativamente entre cinco lojas. Eles coletam avaliações de satisfação de 50 clientes em cada local. A ANOVA unidirecional testaria se a localização tem um efeito significativo na satisfação. Se significativo, testes post hoc identificariam quais locais específicos diferem uns dos outros.

Python bibliotecas e funções R

Bibliotecas Python:

  • scipy.stats.f_oneway() - Teste F ANOVA unidirecional
  • statsmodels.formula.api.ols() - Mínimos quadrados ordinários para modelos ANOVA
  • statsmodels.stats.anova.anova_lm() - Geração de tabela ANOVA
  • scipy.stats.levene() - Teste de homogeneidade da variância

Funções R:

  • aov() - Análise de variância
  • anova() - Tabela ANOVA para objetos do modelo
  • var.test() - Teste F para comparar duas variâncias
  • TukeyHSD() - Teste post hoc de diferença significativa honesta de Tukey
  • leveneTest() - Teste de Levene para homogeneidade da variância (pacote car)
Testes Z
Descrição

O teste Z é um teste de hipótese estatística. Utiliza a distribuição normal padrão (distribuição Z) para determinar se existe uma diferença significativa entre os parâmetros da amostra e da população. O teste Z é útil quando o desvio padrão da população é conhecido ou quando os tamanhos das amostras são grandes o suficiente para garantir que a distribuição amostral seja aproximadamente normal.

Cenário de Exemplo

Um varejista online deseja testar se um novo design de site aumenta a taxa de conversão em relação à média histórica de 3.5 %. Após implementarem o novo design por uma semana, observam 2.450 conversões em 70.000 visitantes. Um teste Z para proporções pode determinar se a taxa de conversão observada ( 3.5 %) difere significativamente da taxa histórica.

Python bibliotecas e funções R

Bibliotecas Python:

  • statsmodels.stats.weightstats.ztest() - Teste Z para médias
  • statsmodels.stats.proportion.proportions_ztest() - Teste Z para proporções
  • scipy.stats.norm.cdf() - Calcular valores p a partir de estatísticas Z

Funções R:

  • BSDA::z.test() - Teste Z para médias (requer o pacote BSDA)
  • prop.test() - Teste para proporções (utiliza aproximação qui-quadrado, equivalente ao teste Z para grandes amostras)
  • Observação: o R básico não inclui o teste Z; são necessários pacotes como BSDA, TeachingDemos, ou funções personalizadas