Modelo de conteúdo de estatísticas de coluna e modelo de conteúdo de estatísticas pareadas
O modelo de conteúdo Column Statistics fornece acesso a estatísticas que podem ser computadas para cada campo (estatísticas univariadas). O modelo de conteúdo Pairwise Statistics fornece acesso a estatísticas que podem ser computadas entre pares de campos ou valores em um campo.
Qualquer uma dessas medidas de estatísticas é possível:
CountUniqueCountValidCountMeanSumMinMaxRangeVarianceStandardDeviationStandardErrorOfMeanSkewnessSkewnessStandardErrorKurtosisKurtosisStandardErrorMedianModePearsonCovarianceTTestFTest
Alguns valores são apropriados apenas para estatísticas de coluna única, enquanto outros são apropriados apenas para estatísticas de pares.
Os nós que os produzem são:
- O nó Statistics produz estatísticas de coluna e pode produzir estatísticas em pares quando os campos de correlação são especificados
- O nó Data Audit produz colunas e pode produzir estatísticas em pares quando um campo de sobreposição é especificado.
- O nó Means produz estatísticas em pares ao comparar pares de campos ou comparar os valores de um campo com outros resumos de campo.
Quais modelos e estatísticas de conteúdo estão disponíveis dependem das capacidades do nó específico e das configurações dentro do nó
| Método | Tipos de retorno | Descrição |
|---|---|---|
getAvailableStatistics() |
List<StatisticType> |
Retorna as estatísticas disponíveis nesse modelo. Nem todos os campos têm necessariamente valores para todas as estatísticas |
getAvailableColumns() |
List<String> |
Retorna os nomes das colunas para as quais as estatísticas foram computadas. |
getStatistic(String column, StatisticType statistic) |
Number |
Retorna os valores estatísticos associados à coluna. |
reset() |
void |
Limpa qualquer armazenamento interno associado a esse modelo de conteúdo. |
| Método | Tipos de retorno | Descrição |
|---|---|---|
getAvailableStatistics() |
List<StatisticType> |
Retorna as estatísticas disponíveis nesse modelo. Nem todos os campos têm necessariamente valores para todas as estatísticas |
getAvailablePrimaryColumns() |
List<String> |
Retorna os nomes das colunas primárias para as quais as estatísticas foram computadas. |
getAvailablePrimaryValues() |
List<Object> |
Retorna os valores da coluna primária para a qual as estatísticas foram computadas. |
getAvailableSecondaryColumns() |
List<String> |
Retorna os nomes das colunas secundárias para as quais as estatísticas foram computadas. |
getStatistic(String primaryColumn, String secondaryColumn, StatisticType
statistic) |
Number |
Retorna os valores estatísticos associados às colunas. |
getStatistic(String primaryColumn, Object primaryValue, String secondaryColumn,
StatisticType statistic) |
Number |
Retorna os valores estatísticos associados ao valor da coluna primária e da coluna secundária. |
reset() |
void |
Limpa qualquer armazenamento interno associado a esse modelo de conteúdo. |
Nós e saídas
Esta tabela lista os nós que constroem saídas que incluem esse tipo de modelo de conteúdo
| Nome do nó | Nome da saída | ID do contêiner | Notas |
|---|---|---|---|
"means" (Significa nó) |
"means" |
"columnStatistics" |
|
"means" (Significa nó) |
"means" |
"pairwiseStatistics" |
|
"dataaudit" (Nó de auditoria de dados) |
"means" |
"columnStatistics" |
|
"statistics" (Nó de estatísticas) |
"statistics" |
"columnStatistics" |
Gerado somente quando campos específicos são examinados. |
"statistics" (Nó de estatísticas) |
"statistics" |
"pairwiseStatistics" |
Gerado somente quando os campos estão correlacionados. |
Exemplo de script
from modeler.api import StatisticType
stream = modeler.script.stream()
# Set up the input data
varfile = stream.createAt("variablefile", "File", 96, 96)
varfile.setPropertyValue("full_filename", "$CLEO/DEMOS/DRUG1n")
# Now create the statistics node. This can produce both
# column statistics and pairwise statistics
statisticsnode = stream.createAt("statistics", "Stats", 192, 96)
statisticsnode.setPropertyValue("examine", ["Age", "Na", "K"])
statisticsnode.setPropertyValue("correlate", ["Age", "Na", "K"])
stream.link(varfile, statisticsnode)
results = []
statisticsnode.run(results)
statsoutput = results[0]
statscm = statsoutput.getContentModel("columnStatistics")
if (statscm != None):
cols = statscm.getAvailableColumns()
stats = statscm.getAvailableStatistics()
print "Column stats:", cols[0], str(stats[0]), " = ", statscm.getStatistic(cols[0], stats[0])
statscm = statsoutput.getContentModel("pairwiseStatistics")
if (statscm != None):
pcols = statscm.getAvailablePrimaryColumns()
scols = statscm.getAvailableSecondaryColumns()
stats = statscm.getAvailableStatistics()
corr = statscm.getStatistic(pcols[0], scols[0], StatisticType.Pearson)
print "Pairwise stats:", pcols[0], scols[0], " Pearson = ", corr