CSV arquivo para atribuição de prazo e classificação com base em regras

Crie um arquivo ` CSV ` com o nome ikc-term-assignment-rules.csv que define as regras para a atribuição de termos ou classificações e envie-o para o projeto. O arquivo CSV deve estar em conformidade com as regras de formatação.

Regras gerais de formatação

O arquivo CSV deve estar em conformidade com o formato comum e o tipo MIME para arquivos com valores separados por vírgulas ( CSV ) e deve ser codificado em UTF-8.

Tamanho de arquivo

O tamanho máximo recomendado do arquivo de importação CSV é de 50 MB.

Linha de cabeçalho

A linha de cabeçalho do arquivo CSV representa as propriedades que compõem a regra e a ação a ser executada.

Siga estas diretrizes para a linha do cabeçalho:

  • A linha do cabeçalho deve ser a primeira linha do arquivo e não deve ser repetida.
  • Separe os nomes das colunas com uma vírgula. Se você criar o arquivo em um editor de planilhas, as vírgulas serão adicionadas automaticamente quando você salvar o arquivo no formato CSV.
  • A linha do cabeçalho deve incluir as colunas obrigatórias para a regra.
  • Você pode omitir qualquer coluna opcional.
  • Você pode adicionar outras colunas arbitrárias, que serão ignoradas.
  • Use os nomes exatos das colunas na linha do cabeçalho. Os nomes das colunas diferenciam maiúsculas de minúsculas.
  • Certifique-se de que os nomes das colunas não incluam caracteres de espaço em branco adicionais. Os caracteres de espaço em branco podem ser adicionados por uma planilha ou editor de texto, mas não podem ser vistos. Se você receber um erro de importação informando que os nomes das colunas estão incorretos, mesmo que as colunas estejam escritas e em letras maiúsculas corretamente, verifique se há espaços em branco.

Especificação da coluna

Para delimitar valores para colunas diferentes, use uma vírgula. Se você criar o arquivo em um editor de planilhas, as vírgulas serão adicionadas automaticamente quando você salvar o arquivo no formato CSV.

Para omitir um valor de uma coluna, use uma vírgula logo após a vírgula anterior e sem nenhum outro caractere. Por exemplo, duas vírgulas consecutivas indicam que a segunda coluna está vazia.

Para incluir valores, use aspas duplas (").

Caminhos das categorias

É necessário especificar o caminho completo da categoria para um termo ou uma classificação. Para delimitar o caminho da categoria, use dois símbolos de maior que (>>) entre cada nível da hierarquia de categorias e entre o caminho da categoria e o nome do artefato. Se você iniciar o caminho com >>, a categoria raiz será [uncategorized].

Colunas de regras

O arquivo CSV pode conter colunas obrigatórias e opcionais.

Para definir a condição da regra, inclua essas colunas:

OBJECT_TYPE

O tipo de objeto ao qual os termos devem ser atribuídos. Valores válidos:

  • asset
  • column

Essa coluna é obrigatória e não pode estar vazia.

PROPERTY

A propriedade para combinar. Valores válidos:

  • name: O nome do ativo de dados ou coluna.
  • description: A descrição do ativo de dados ou coluna.
  • mostfreqvalues: Qualquer um dos valores mais frequentes do perfil de dados. As regras com essa propriedade exigem a criação de perfis de dados antes que a regra possa ser aplicada corretamente.
    OBJECT_TYPE deve ser column.
  • dataclassname: O nome da classe de dados atribuída a uma coluna.
    OBJECT_TYPE deve ser column.
  • assetid: O ID do ativo de dados.
  • parentassetname: O nome do recurso de dados que contém a coluna.
    OBJECT_TYPE deve ser column.
  • parentassetdescription: A descrição do ativo de dados que contém a coluna.
    OBJECT_TYPE deve ser column.

Essa coluna é obrigatória e não pode estar vazia.

MATCH_STRING

A cadeia de caracteres a ser comparada com a propriedade. Você pode definir qualquer valor. Essa coluna é obrigatória e não pode estar vazia.

MATCH_TYPE

Descreve como a string de correspondência deve ser comparada com a propriedade. Essa coluna é obrigatória e não pode estar vazia. Valores válidos:

  • equals
    Correspondência exata sem distinção entre maiúsculas e minúsculas.
  • equalscs
    Correspondência exata com distinção entre maiúsculas e minúsculas.
  • contains
    Corresponde se a propriedade contiver a string de correspondência. A correspondência não diferencia maiúsculas de minúsculas.
  • containscs
    Corresponde se a propriedade contiver a string de correspondência. A correspondência faz distinção entre maiúsculas e minúsculas.

Para definir quais termos e classificações devem ser atribuídos com qual nível de confiança, inclua estas colunas

TERM_NAME

O nome do termo, incluindo o caminho da categoria, conforme descrito em Caminho da categoria. Por exemplo, Category 1 >> Category2 >> MyTerm.

Para atribuir um termo, é necessário que TERM_NAME TERM_ID ou esteja presente. Você pode especificar ambos. Nesse caso, o site TERM_ID tem precedência. Se você planeja usar o arquivo de regras em sistemas diferentes com termos e hierarquias de categorias semelhantes, use nomes de termos em vez de IDs de termos.

TERM_ID

A ID do termo. Você pode usar a ID do artefato ou a ID global.

Para atribuir um termo, é necessário que TERM_NAME TERM_ID ou esteja presente. Você pode especificar ambos. Nesse caso, o site TERM_ID tem precedência. Se você planeja usar o arquivo de regras em sistemas diferentes com termos e hierarquias de categorias semelhantes, use nomes de termos em vez de IDs de termos.

CLASSIFICATION_NAME

O nome da classificação, incluindo o caminho da categoria, conforme descrito em Caminho da categoria. Por exemplo, Category 1 >> Category2 >> MyClassification.

Para atribuir uma classificação, é necessário que CLASSIFICATION_NAME CLASSIFICATION_ID ou esteja presente. Você pode especificar ambos. Nesse caso, o site CLASSIFICATION_ID tem precedência. Se você planeja usar o arquivo de regras em diferentes sistemas com classificações e hierarquias de categorias semelhantes, utilize nomes de classificação em vez de IDs de classificação.

CLASSIFICATION_ID

O ID da classificação. Você pode usar a ID do artefato ou a ID global.

Para atribuir uma classificação, é necessário que CLASSIFICATION_NAME CLASSIFICATION_ID ou esteja presente. Você pode especificar ambos. Nesse caso, o site CLASSIFICATION_ID tem precedência. Se você planeja usar o arquivo de regras em diferentes sistemas com classificações e hierarquias de categorias semelhantes, utilize nomes de classificação em vez de IDs de classificação.

CONFIDENCE

Um valor de tipo float entre 0 e 1 que indica o nível de confiança na atribuição do termo ou da classificação. O valor padrão é 1.0 (=100%). Independentemente da localidade, o ponto decimal é .

Colunas adicionais que você pode incluir:

ACTIVE

Se você definir o valor no, a regra não será considerada durante a atribuição. Durante o desenvolvimento, você pode querer desativar certas regras sem removê-las do arquivo CSV.

GROUP

Um grupo de regras que permite que você configure regras de atribuição mais complexas, como, If a column name contains X and its description contains Y, then assign term T1 and T2.

Pelo menos uma condição e uma ação devem ser definidas por grupo de regras.

Opções do arquivo de regras

Você pode fornecer opções adicionais para influenciar como as regras são aplicadas no campo de descrição do arquivo de regras carregado. Adicione linhas no formato <option-name>=<option-value>. O campo de descrição também pode conter qualquer outro texto.

default_confidence_if_missing

Um valor flutuante entre 0 e 1 que indica uma confiança padrão diferente de 1.0 se a coluna CONFIDENCE estiver vazia.

use_expanded_names

Define quando um nome gerado também deve ser considerado quando as regras são avaliadas. Essa opção só está disponível se os recursos de enriquecimento baseados em IA gerativa estiverem ativados.

Valores possíveis:

  • NEVER: Não considere os nomes gerados.
  • SUGGESTED: Considere um nome gerado sugerido.
  • ACCEPTED: Considere um nome gerado atribuído.

O valor padrão é ACCEPTED.

use_generated_descriptions

Define quando uma descrição gerada também deve ser considerada como uma descrição quando as regras são avaliadas. Essa opção só está disponível se os recursos de enriquecimento baseados em IA gerativa estiverem ativados.

Valores possíveis:

  • NEVER: Não considere as descrições geradas
  • SUGGESTED: Considere uma descrição gerada sugerida.
  • ACCEPTED: Considere uma descrição gerada atribuída.

O valor padrão é ACCEPTED.

Exemplos

Veja alguns exemplos de regras e grupos de regras.

Exemplos de regras

O exemplo a seguir descreve três regras:

  1. Se uma coluna tiver um nome que contenha a string address, atribua o termo personal data com 100% de confiança. 100% é o padrão se a coluna CONFIDENCE estiver vazia.
  2. Se uma coluna tiver um nome que contenha a string customer, atribua o termo data subject com 90% de confiança.
  3. Se um ativo tiver uma descrição que contenha a sequência de caracteres client, atribua o termo data subject, mas com 100% de confiança.
  4. Se um ativo tiver uma descrição que contenha a sequência de caracteres FYEO, atribua a classificação Confidential com 100% de confiança.

Os nomes dos termos são escritos como um caminho na árvore de categorias: GDPR é uma categoria raiz que contém os termos personal data e data subject.

A coluna COMMENT contém informações adicionais sobre a regra, mas não afeta a atribuição de termos.

OBJECT_TYPE PROPERTY TIPO DE PARTIDA MATCH_STRING NOME_DO_TERMO NOME_DA_CLASSIFICAÇÃO CONFIANÇA COMMENT
coluna nome contém endereço GDPR >> dados pessoais O endereço é um dado pessoal
coluna nome contém Cliente GDPR >> titular dos dados 0.9 Os clientes são titulares de dados
ativo descrição contém cliente GDPR >> titular dos dados Os clientes são titulares de dados
ativo descrição contém FYEO >> Confidencial A descrição contém "FYEO" se for confidencial

Exemplos de grupos de regras

O exemplo a seguir mostra um grupo de regras G1 que une duas condições e um grupo de regras G2 que define dois termos a serem atribuídos a uma condição:

  1. G1: Se o nome de uma coluna contiver address e sua descrição contiver identifier, atribua o termo online identifier com 92% de confiança.
  2. G2: Se uma coluna tiver postfach (" P.O. Box” em alemão) como um dos seus valores mais frequentes, atribua ao termo European Union uma confiança de 90% e ao termo data subject uma confiança de 95%.
OBJECT_TYPE PROPERTY TIPO DE PARTIDA MATCH_STRING NOME_DO_TERMO CONFIANÇA GRUPO
coluna nome contém endereço G1
coluna descrição contém identificador GDPR >> identificador on-line 0.92 G1
coluna mais valores de frequência contém caixa postal GDPR >> União Europeia 0.9 G2
GDPR >> titular dos dados 0.95 G2

Este exemplo mostra como você pode usar as propriedades parentassetnameparentassetdescription e.

  1. G3: Se a coluna com o nome CUSTOMER_ID estiver contida em um ativo de dados com o nome CUSTOMER_ADDRESS, atribua ao termo Person:A10 100% de confiança.
  2. G4: Se a coluna com o nome ACCT_ID estiver contida em um ativo de dados onde as descrições contêm customer account information, atribua o termo Account number com 95% de confiança.
OBJECT_TYPE PROPERTY TIPO DE PARTIDA MATCH_STRING NOME_DO_TERMO CONFIANÇA GRUPO
coluna nome do ativo pai equivalentes ENDEREÇO DO CLIENTE G3
coluna nome equivalentes customer_id Empresa >> Departamento >> Pessoa: A10 1.0 G3
coluna descrição do ativo pai contém informações da conta do cliente G4
coluna nome equivalentes ID_ACCT Finanças >> Contas >> Número da conta 0.95 G4

Exemplo de descrição do arquivo de regras

O exemplo a seguir é uma descrição válida de um arquivo de regras:

This the best rule file in the world.

default_confidence_if_missing = 0.95
use_expanded_names = ACCEPTED
use_generated_descriptions = SUGGESTED

Closing remarks.