Nó mímico

Em Synthetic Data Generator, você pode usar o nó Mimic para definir seus requisitos de como os dados sintéticos devem se assemelhar aos dados de amostra de sementes.

O nó Mimic analisa a distribuição estatística de cada campo nos dados de sementes de amostra e gera (ou atualiza) um nó Generate com a distribuição mais adequada atribuída a cada campo. O nó Generate pode então gerar automaticamente dados sintéticos com base na análise.

Descrição
Use o nó Mimic em um fluxo Synthetic Data Generator para configurar a proximidade com que os dados sintéticos se assemelham às propriedades estatísticas e às distribuições do conjunto de dados original. O nó usa algoritmos avançados para aprender os padrões e relacionamentos subjacentes nos dados de entrada para criar registros realistas, porém artificiais.
Você também pode configurar o recurso de privacidade diferencial. Para obter mais informações, consulte Uso da privacidade diferencial.
Usando o nó
Use o nó Mimic após um nó Import ou Anonymize. Quando o nó Mimic é executado, um nó Generate é criado, caso ainda não exista.
Você pode incluir o nó Mimic várias vezes em um fluxo Synthetic Data Generator se quiser gerar dados sintéticos usando configurações diferentes no mesmo conjunto de dados. Um nó Import of Anonymize pode se ramificar em vários nós Mimic.
Obrigatório ou opcional
O nó Mimic é obrigatório, a menos que você esteja gerando dados sintéticos usando um esquema de dados personalizado. Você deve conectar um nó Import ou Anonymize ao nó Mimic.

Colunas definidas como sem tipo

O nó Mimic sempre exclui colunas definidas como Typeless do conjunto de dados durante o pré-processamento dos dados. As colunas excluídas não aparecem no nó Gerar. Os algoritmos de aprendizado de máquina geralmente ignoram campos sem tipo, pois eles podem não ter nenhum valor preditivo ou padrão discernível que possa ser determinado por meio de análise estatística.

Se desejar manter uma coluna definida como Sem tipo no conjunto de dados, você pode ativar Sem tipo como Realista nas configurações do nó Mimic e, em seguida, editar a coluna no nó Gerar para definir o dicionário para essa coluna. Os dados na coluna são então tratados como esse tipo de dicionário.

Criação de scripts com o nó Mimc

Você pode usar linguagens de script, como Python, para definir propriedades de nós de forma programática.

Propriedades do nó Mimc

As propriedades a seguir são específicas do nó Mimc. Para obter informações sobre propriedades comuns de nós, consulte Propriedades de fluxos e nós.

Tabela 1. Propriedades do nó para scripts
Nome da propriedade Tipo de dados Descrição do imóvel
bins Número Inteiro Para campos contínuos, a distribuição empírica é a função de distribuição cumulativa dos dados históricos.
custom_gen_node_name Booleano Você pode gerar o nome do nó Generate gerado (ou atualizado) automaticamente, selecionando Auto.
delta Número Inteiro Probabilidade máxima permitida de vazamento de privacidade. O valor deve ser <= 1/n*n, em que n é o tamanho da amostra em um determinado momento. O epsilon ou o delta deve ser maior que 0
epsilon Número Inteiro Determina o orçamento de privacidade. Valores menores proporcionam maior proteção à privacidade e perda de precisão.
frequency_weight_field campo Especifique o campo de peso se o seu conjunto de dados contiver um. O campo de peso é então excluído do processo de ajuste da distribuição.
gen_node_name Sequência Especifique um nome personalizado para o nó Generate gerado (ou atualizado).
good_fit_type Sequência Para campos contínuos, especifique o AnderDarling teste ou o KolmogSmirn teste de adequação para classificar distribuições ao ajustar distribuições aos campos.
locale Sequência A localidade determina quais tipos de dicionário estão disponíveis para a geração de campos e pode ter um valor entre ["de_DE", "en_US", "es_ES", "fr_FR", "it_IT", "ja_JP", "ko_KR", "pl_PL", "pt_BR", "ru_RU", "zh_CN"]
missing_value_imputation Booleano Defina como True para usar a imputação para substituir seus dados ausentes. Imputação significa substituir dados ausentes por uma estimativa e, em seguida, analisar o conjunto completo de dados como se os valores imputados fossem dados reais.
missing_value_imputation_continuous_strategy Sequência Ao substituir valores ausentes para um campo contínuo, ele pode ser definido como mean ou fixed. O padrão é "média".
missing_value_imputation_continuous_replace_value Número Inteiro Quando fixed é definido para missing_value_imputation_continuous_strategy, você pode definir um valor aqui.
missing_value_imputation_nominal_strategy Sequência Ao substituir valores ausentes para um campo nominal, ele pode ser definido como mode ou fixed. O padrão é a média.
missing_value_imputation_nominal_replace_value Número Inteiro Quando fixed é definido para missing_value_imputation_nominal_strategy, você pode definir um valor aqui.
missing_value_imputation_ordinal_strategy Sequência Ao substituir valores ausentes para um campo ordinal, ele pode ser definido como medium ou fixed. O padrão é a média.
missing_value_imputation_ordinal_replace_value Número Inteiro Quando fixed é definido para missing_value_imputation_ordinal_strategy, você pode definir um valor aqui.
missing_value_imputation_strategies Propriedade estruturada Quando True é definido para missing_value_imputation, você pode usar essa propriedade para substituir valores ausentes de campos específicos. Consulte o script de exemplo.
random_seed Número Inteiro Permite que você reproduza a saída sintética particular diferencial
typeless_as_realistic Booleano Defina como True para tratar o campo sem tipo como um tipo de dicionário.
use_diff_privacy Booleano Defina como True para garantir que nenhum dado sensível seja exposto nos dados sintéticos gerados pelo controle dos parâmetros de orçamento de privacidade (epsilon) e vazamento (delta).
used_cases_type Sequência Especifica o número de casos a serem usados ao ajustar distribuições aos campos no conjunto de dados. Use AllCases ou FirstNCases.
used_cases Número Inteiro O número de casos.

Exemplo de script

A seguir, um exemplo das propriedades usadas em um script.

mimicnode.setPropertyValue("missing_value_imputation", "True")
mimicnode.setPropertyValue("missing_value_imputation_strategies","[['Age','Fixed','60']]")