Modelo de conteúdo de estatísticas de coluna e modelo de conteúdo de estatísticas pareadas

O modelo de conteúdo Column Statistics fornece acesso a estatísticas que podem ser computadas para cada campo (estatísticas univariadas). O modelo de conteúdo Pairwise Statistics fornece acesso a estatísticas que podem ser computadas entre pares de campos ou valores em um campo.

Qualquer uma dessas medidas de estatísticas é possível:

  • Count
  • UniqueCount
  • ValidCount
  • Mean
  • Sum
  • Min
  • Max
  • Range
  • Variance
  • StandardDeviation
  • StandardErrorOfMean
  • Skewness
  • SkewnessStandardError
  • Kurtosis
  • KurtosisStandardError
  • Median
  • Mode
  • Pearson
  • Covariance
  • TTest
  • FTest

Alguns valores são apropriados apenas para estatísticas de coluna única, enquanto outros são apropriados apenas para estatísticas de pares.

Os nós que os produzem são:

  • O nó Statistics produz estatísticas de coluna e pode produzir estatísticas em pares quando os campos de correlação são especificados
  • O nó Data Audit produz colunas e pode produzir estatísticas em pares quando um campo de sobreposição é especificado.
  • O nó Means produz estatísticas em pares ao comparar pares de campos ou comparar os valores de um campo com outros resumos de campo.

Quais modelos e estatísticas de conteúdo estão disponíveis dependem das capacidades do nó específico e das configurações dentro do nó

Tabela 1. Métodos para o modelo de conteúdo Estatísticas de Coluna
Método Tipos de retorno Descrição
getAvailableStatistics() List<StatisticType> Retorna as estatísticas disponíveis nesse modelo. Nem todos os campos têm necessariamente valores para todas as estatísticas
getAvailableColumns() List<String> Retorna os nomes das colunas para as quais as estatísticas foram computadas.
getStatistic(String column, StatisticType statistic) Number Retorna os valores estatísticos associados à coluna.
reset() void Limpa qualquer armazenamento interno associado a esse modelo de conteúdo.
Tabela 2. Métodos para o Modelo de Conteúdo de Estatísticas Pairwise
Método Tipos de retorno Descrição
getAvailableStatistics() List<StatisticType> Retorna as estatísticas disponíveis nesse modelo. Nem todos os campos têm necessariamente valores para todas as estatísticas
getAvailablePrimaryColumns() List<String> Retorna os nomes das colunas primárias para as quais as estatísticas foram computadas.
getAvailablePrimaryValues() List<Object> Retorna os valores da coluna primária para a qual as estatísticas foram computadas.
getAvailableSecondaryColumns() List<String> Retorna os nomes das colunas secundárias para as quais as estatísticas foram computadas.
getStatistic(String primaryColumn, String secondaryColumn, StatisticType statistic) Number Retorna os valores estatísticos associados às colunas.
getStatistic(String primaryColumn, Object primaryValue, String secondaryColumn, StatisticType statistic) Number Retorna os valores estatísticos associados ao valor da coluna primária e da coluna secundária.
reset() void Limpa qualquer armazenamento interno associado a esse modelo de conteúdo.

Nós e saídas

Esta tabela lista os nós que constroem saídas que incluem esse tipo de modelo de conteúdo

Tabela 3. Nós e saídas
Nome do nó Nome da saída ID do contêiner Notas
"means" (Significa nó) "means" "columnStatistics"  
"means" (Significa nó) "means" "pairwiseStatistics"  
"dataaudit" (Nó de auditoria de dados) "means" "columnStatistics"  
"statistics" (Nó de estatísticas) "statistics" "columnStatistics" Gerado somente quando campos específicos são examinados.
"statistics" (Nó de estatísticas) "statistics" "pairwiseStatistics" Gerado somente quando os campos estão correlacionados.

Exemplo de script

from modeler.api import StatisticType
stream = modeler.script.stream()

# Set up the input data
varfile = stream.createAt("variablefile", "File", 96, 96)
varfile.setPropertyValue("full_filename", "$CLEO/DEMOS/DRUG1n")

# Now create the statistics node. This can produce both
# column statistics and pairwise statistics
statisticsnode = stream.createAt("statistics", "Stats", 192, 96)
statisticsnode.setPropertyValue("examine", ["Age", "Na", "K"])
statisticsnode.setPropertyValue("correlate", ["Age", "Na", "K"])
stream.link(varfile, statisticsnode)

results = []
statisticsnode.run(results)
statsoutput = results[0]
statscm = statsoutput.getContentModel("columnStatistics")
if (statscm != None):
	cols = statscm.getAvailableColumns()
	stats = statscm.getAvailableStatistics()
	print "Column stats:", cols[0], str(stats[0]), " = ", statscm.getStatistic(cols[0], stats[0])

statscm = statsoutput.getContentModel("pairwiseStatistics")
if (statscm != None):
	pcols = statscm.getAvailablePrimaryColumns()
	scols = statscm.getAvailableSecondaryColumns()
	stats = statscm.getAvailableStatistics()
	corr = statscm.getStatistic(pcols[0], scols[0], StatisticType.Pearson)
	print "Pairwise stats:", pcols[0], scols[0], " Pearson = ", corr