Informações de perfil de nível de coluna

Cada perfil contém vários níveis de informações

As informações são agrupadas da seguinte forma:

Quando os resultados da criação de perfil avançada são gravados em uma tabela de saída, os valores são armazenados como cadeias de caracteres, independentemente do tipo de dados real. Nesse caso, a ordem de classificação da cadeia de caracteres é aplicada quando você classifica as classes, os formatos ou os tipos de dados.

.

Estatísticas

A guia Estatísticas fornece um resumo da estrutura dos dados analisados em uma coluna e de diferentes tipos de visualizações para essas informações estruturais Quais informações exatamente são mostradas depende se a coluna contém dados contínuos (quantitativos) ou nominais (qualitativos)

gráficos

Dependendo do tipo de dados em uma coluna, é possível escolher entre diferentes tipos de visualizações:

  • Dados nominais:

    • Gráficos de barras
    • Gráfico de proporção ou de pizza
    • gráfico de Pareto
  • Dados contínuos:

    • Gráfico de histograma
    • Gráfico de box plot
    • Gráfico de plot quantil (Q-Q)

Um gráfico de distribuição está disponível para todos os tipos de dados A tabela de distribuição geralmente lista pelo menos os valores mais frequentes (ou intervalos) na coluna e suas contas. A tabela pode mostrar outras informações, como os formatos, tipos ou classes de dados. Para visualizar as linhas individuais que contêm um determinado valor, clique em Mostrar linhas.

As estatísticas de distribuição de valores não numéricos, como valores de cadeia de caracteres, mostrarão apenas os primeiros 100 valores distintos, independentemente de quantos valores estejam de fato armazenados. Para acessar todos os valores na tabela de saída, use consultas de banco de dados padrão ou a API IBM Knowledge Catalog.

Nos gráficos de barras ou de histogramas, você tem a opção de selecionar uma coluna de sobreposição para ver como seus valores são distribuídos dentro de cada valor da coluna que você está procurando atualmente. Por exemplo, se você tiver uma coluna com produtos assados vendidos e selecionar uma temporada de coluna de sobreposição, poderá ver como as vendas de um determinado produto de padaria diferem por temporada. Para a coluna de sobreposição, é possível selecionar entre todas as colunas no ativo de dados que contêm dados nominais.

Resumo

O ladrilho Resumo fornece informações gerais sobre os dados na coluna selecionada:

  • O tipo de dados da coluna conforme definido na origem de dados
  • O tipo de dados que foi inferido através da análise
  • O número de formatos de dados diferentes nessa coluna
  • O formato inferido mais frequente para essa coluna
  • A classe de dados designada
  • O tipo de medição de dados (nominal ou continuous)
  • O número de linhas (ou seja, o número de valores) que foram verificadas

Estatísticas básicas

Estatísticas básicas fornecem informações gerais sobre a distribuição e dispersão dos valores na coluna selecionada. Dependendo do formato de dados de uma coluna, as estatísticas variam ligeiramente. Por exemplo, as estatísticas de uma coluna de número inteiro de tipo de dados têm valores mínimo, máximo e médio, enquanto que as estatísticas de uma coluna de sequência de tipos de dados têm valores de comprimentos mínimo, máximo e médio.

Medida Descrição Mostrado para este tipo de dados
Cardinalidade A porcentagem de valores distintos exclusivos na coluna, incluindo brancos e nulos. Ele é calculado dividindo o número total de valores distintos em uma coluna pelo número total de valores nessa coluna Contínuo
Distinguir O número de valores diferentes que existem nos dados de amostra para a coluna Contínuo
Entropia Esse valor quantifica quantas informações a coluna contém. Mais geralmente, a entropia pode ser usada para quantificar as informações em um evento e uma variável aleatória. Esta quantia é estimada não apenas com base no número de valores diferentes que estão presentes na variável, mas também pela quantia de valores inesperados.. Nominal
Gini O grau de probabilidade de um elemento específico ser classificado incorretamente quando escolhido aleatoriamente e uma variação do coeficiente de Gini. O índice de Gini pode variar de 0 a 1, onde 0 indica que todos os elementos pertencem a uma determinada classe ou que apenas uma classe existe lá. Um índice de Gini de 1 indica que todos os elementos são distribuídos aleatoriamente em várias classes. Um valor de 0.5 indica que os elementos são distribuídos uniformemente em algumas classes Nominal
Máximo O maior valor de uma variável numérica Contínuo
Média A média aritmética, a soma dividida pelo número de valores Contínuo
Mediana O valor acima e abaixo do qual metade dos valores cai. Se houver um número par de valores, a média será a média dos dois valores médios quando eles forem classificados. A mediana não é afetada por valores discrepantes Contínuo
Mínimo O menor valor de uma variável numérica Contínuo
Ausente O número de linhas na amostra que não têm um valor Contínuo
nominal
Modo O valor que ocorre mais frequentemente na coluna. Se vários valores ocorrerem com a mesma frequência, cada um deles será um modo. Contínuo
nominal
Valores discrepantes O número de valores nos dados da coluna que estão longe da maioria dos outros valores na coluna.. Contínuo
Intervalo A diferença entre os valores máximo e mínimo na coluna Contínuo
Sum A soma ou o total dos valores, em todas as colunas que possuem valores Contínuo
Exclusivo O número de valores distintos que aparecem apenas uma vez na coluna atual.. Contínuo
nominal
Válido O número de valores que são considerados válidos, o que significa que os valores de coluna vazios ou omissos são excluídos Contínuo
nominal

Insights avançados

Informações detalhadas sobre a distribuição e dispersão dos valores na coluna selecionada. Essas informações são mostradas somente para dados contínuos:

Medida Descrição
25º percentil O valor abaixo do qual 25% e acima do qual 75% dos valores detectados caem.
75º percentil O valor acima do qual 25% e abaixo do qual 75% dos valores detectados caem.
Curtose Uma medida da extensão na qual há valores discrepantes (cauda de uma distribuição). O excesso de curtose é a cauda de uma distribuição relativa a uma distribuição normal. Para a uma distribuição normal, o valor da estatística da curtose é zero. A curtose positiva indica que os dados exibem mais valores discrepantes que uma distribuição normal. A curtose negativa indica que os dados exibem menos valores discrepantes do que uma distribuição normal.

As distribuições com curtose média (caudas médias) são mesocurticas. Distribuições com baixa curtose (caudas finas) são platykurtic.
Média padrão Erro Uma medida da distância entre a média da amostra (média) dos dados e a média da população real.
Erro padrão Uma medida de dispersão ao redor da média. Com um desvio padrão baixo, os valores geralmente estão próximos à média.. Com um desvio padrão alto, o intervalo de valores é maior.
Assimetria Uma medida da assimetria de uma distribuição. Uma distribuição é assimétrica quando os seus lados esquerdo e direito não são imagens espelhadas. Uma distribuição pode ter direita (ou positiva), esquerda (ou negativa) ou zero assimetria (distribuição simétrica).
variância Uma medida de dispersão ao redor da média. É a expectativa do desvio ao quadrado de uma variável aleatória da sua média populacional ou média amostral.

Classes de dados

As informações a seguir são mostradas para designações de classe de dados:

  • A classe de dados selecionada, que é a classe de dados designada para a coluna É igual à classe de dados detectada, a menos que você a tenha alterado manualmente.

  • A classe de dados detectados, que é a melhor classe de dados correspondente para a coluna, conforme detectado pela análise

  • A pontuação de confiança da classe de dados designada A confiança de uma classe de dados é a porcentagem de valores não nulos que correspondem à classe de dados. Várias classes de dados são identificadores mais genéricos que são detectados e designados em um nível de coluna. Essas classes de dados são designadas quando uma classe de dados mais específica não pôde ser identificada em um nível de valor. Os identificadores genéricos sempre terão uma confiança de 100% e incluirão as seguintes classes de dados: Código, Identificador, Indicador, Quantidade e Texto

  • Uma lista de todas as classes de dados que foram detectadas durante a análise em ordem decrescente, com a melhor correspondência (a confiança mais alta) na parte superior. Para cada classe de dados, a pontuação de confiança e a prioridade da classe de dados são mostradas

  • Para cada classe de dados detectada, informações adicionais podem ser mostradas, dependendo do escopo da classe de dados

    Para classes de dados em que a correspondência é feita com base nos dados da coluna, os valores da coluna que corresponderam aos critérios para essa classe de dados específica são listados A coluna Contagem (%) mostra quantas linhas na amostra contêm um valor específico e a porcentagem das linhas com esse valor.. Além disso, o formato de cada valor correspondente é mostrado.

    Para classes de dados em que a correspondência é feita com base no nome da coluna e para as classes de dados genéricas Código, Identificador, Indicador, Quantidade e Texto, nenhuma informação adicional é mostrada. Essas classes de dados são usadas quando os valores de dados não permitem identificar uma classe de dados específica. As classes de dados genéricas sempre têm uma confiança de 100%

Formatos

O formato inferido para a coluna, o número de formatos detectados e uma lista de todos os formatos detectados são mostrados

Um formato representa o padrão de caractere de um valor de dados Cada caractere alfabético é representado por uma letra maiúscula ou minúscula A, dependendo da capitalização do caractere. Cada caractere numérico é representado pelo número 9. Espaços e caracteres especiais são mostrados conforme aparecem.

A lista de formatos detectados mostra quantos valores com um formato específico foram localizados e a porcentagem geral dos valores com esse formato.. Clique em uma entrada para ver os valores correspondentes ao padrão. Observe que apenas 100 valores são recuperados para exibição para que a lista de valor possa não conter todos os valores ou até mesmo estar vazia.

Types

As seguintes informações são mostradas:

  • O tipo de dados da coluna conforme definido na origem de dados
  • O tipo de dados que foi inferido através da análise
  • O comprimento mínimo de um valor nessa coluna
  • O comprimento máximo de um valor nessa coluna
  • O comprimento médio de valores de coluna
  • Uma lista de todos os tipos de dados na coluna

O tipo de dados descreve se a coluna contém dados de um determinado tipo, como número inteiro, sequência ou tipo de data.

Geralmente, o tipo de dados ideal de uma coluna é óbvio porque a maioria ou todos os valores da coluna são do mesmo tipo. No entanto, quando a lista contiver vários tipos diferentes de dados, verifique a contagem de frequência para o tipo de dado inferido Se essa contagem de frequência for baixa em relação à contagem de linhas da tabela, valores de dados inválidos poderão fazer com que o tipo de dados errado seja inferido.

Saiba Mais