CSV arquivo para atribuição de prazo e classificação com base em regras
Crie um arquivo ` CSV ` com o nome ikc-term-assignment-rules.csv que define as regras para a atribuição de termos ou classificações e envie-o para o projeto. O arquivo CSV deve estar em conformidade com as regras de formatação.
Regras gerais de formatação
O arquivo CSV deve estar em conformidade com o formato comum e o tipo MIME para arquivos com valores separados por vírgulas ( CSV ) e deve ser codificado em UTF-8.
Tamanho de arquivo
O tamanho máximo recomendado do arquivo de importação CSV é de 50 MB.
Linha de cabeçalho
A linha de cabeçalho do arquivo CSV representa as propriedades que compõem a regra e a ação a ser executada.
Siga estas diretrizes para a linha do cabeçalho:
- A linha do cabeçalho deve ser a primeira linha do arquivo e não deve ser repetida.
- Separe os nomes das colunas com uma vírgula. Se você criar o arquivo em um editor de planilhas, as vírgulas serão adicionadas automaticamente quando você salvar o arquivo no formato CSV.
- A linha do cabeçalho deve incluir as colunas obrigatórias para a regra.
- Você pode omitir qualquer coluna opcional.
- Você pode adicionar outras colunas arbitrárias, que serão ignoradas.
- Use os nomes exatos das colunas na linha do cabeçalho. Os nomes das colunas diferenciam maiúsculas de minúsculas.
- Certifique-se de que os nomes das colunas não incluam caracteres de espaço em branco adicionais. Os caracteres de espaço em branco podem ser adicionados por uma planilha ou editor de texto, mas não podem ser vistos. Se você receber um erro de importação informando que os nomes das colunas estão incorretos, mesmo que as colunas estejam escritas e em letras maiúsculas corretamente, verifique se há espaços em branco.
Especificação da coluna
Para delimitar valores para colunas diferentes, use uma vírgula. Se você criar o arquivo em um editor de planilhas, as vírgulas serão adicionadas automaticamente quando você salvar o arquivo no formato CSV.
Para omitir um valor de uma coluna, use uma vírgula logo após a vírgula anterior e sem nenhum outro caractere. Por exemplo, duas vírgulas consecutivas indicam que a segunda coluna está vazia.
Para incluir valores, use aspas duplas (").
Caminhos das categorias
É necessário especificar o caminho completo da categoria para um termo ou uma classificação. Para delimitar o caminho da categoria, use dois símbolos de maior que (>>) entre cada nível da hierarquia de categorias e entre o caminho da categoria e o nome do artefato. Se você iniciar o caminho com >>, a categoria raiz será [uncategorized].
Colunas de regras
O arquivo CSV pode conter colunas obrigatórias e opcionais.
Para definir a condição da regra, inclua essas colunas:
OBJECT_TYPEO tipo de objeto ao qual os termos devem ser atribuídos. Valores válidos:
assetcolumn
Essa coluna é obrigatória e não pode estar vazia.
PROPERTYA propriedade para combinar. Valores válidos:
name: O nome do ativo de dados ou coluna.description: A descrição do ativo de dados ou coluna.mostfreqvalues: Qualquer um dos valores mais frequentes do perfil de dados. As regras com essa propriedade exigem a criação de perfis de dados antes que a regra possa ser aplicada corretamente.OBJECT_TYPEdeve sercolumn.dataclassname: O nome da classe de dados atribuída a uma coluna.OBJECT_TYPEdeve sercolumn.assetid: O ID do ativo de dados.parentassetname: O nome do recurso de dados que contém a coluna.OBJECT_TYPEdeve sercolumn.parentassetdescription: A descrição do ativo de dados que contém a coluna.OBJECT_TYPEdeve sercolumn.
Essa coluna é obrigatória e não pode estar vazia.
MATCH_STRINGA cadeia de caracteres a ser comparada com a propriedade. Você pode definir qualquer valor. Essa coluna é obrigatória e não pode estar vazia.
MATCH_TYPEDescreve como a string de correspondência deve ser comparada com a propriedade. Essa coluna é obrigatória e não pode estar vazia. Valores válidos:
equals
Correspondência exata sem distinção entre maiúsculas e minúsculas.equalscs
Correspondência exata com distinção entre maiúsculas e minúsculas.contains
Corresponde se a propriedade contiver a string de correspondência. A correspondência não diferencia maiúsculas de minúsculas.containscs
Corresponde se a propriedade contiver a string de correspondência. A correspondência faz distinção entre maiúsculas e minúsculas.
Para definir quais termos e classificações devem ser atribuídos com qual nível de confiança, inclua estas colunas
TERM_NAMEO nome do termo, incluindo o caminho da categoria, conforme descrito em Caminho da categoria. Por exemplo,
Category 1 >> Category2 >> MyTerm.Para atribuir um termo, é necessário que
TERM_NAMETERM_IDou esteja presente. Você pode especificar ambos. Nesse caso, o siteTERM_IDtem precedência. Se você planeja usar o arquivo de regras em sistemas diferentes com termos e hierarquias de categorias semelhantes, use nomes de termos em vez de IDs de termos.TERM_IDA ID do termo. Você pode usar a ID do artefato ou a ID global.
Para atribuir um termo, é necessário que
TERM_NAMETERM_IDou esteja presente. Você pode especificar ambos. Nesse caso, o siteTERM_IDtem precedência. Se você planeja usar o arquivo de regras em sistemas diferentes com termos e hierarquias de categorias semelhantes, use nomes de termos em vez de IDs de termos.CLASSIFICATION_NAMEO nome da classificação, incluindo o caminho da categoria, conforme descrito em Caminho da categoria. Por exemplo,
Category 1 >> Category2 >> MyClassification.Para atribuir uma classificação, é necessário que
CLASSIFICATION_NAMECLASSIFICATION_IDou esteja presente. Você pode especificar ambos. Nesse caso, o siteCLASSIFICATION_IDtem precedência. Se você planeja usar o arquivo de regras em diferentes sistemas com classificações e hierarquias de categorias semelhantes, utilize nomes de classificação em vez de IDs de classificação.CLASSIFICATION_IDO ID da classificação. Você pode usar a ID do artefato ou a ID global.
Para atribuir uma classificação, é necessário que
CLASSIFICATION_NAMECLASSIFICATION_IDou esteja presente. Você pode especificar ambos. Nesse caso, o siteCLASSIFICATION_IDtem precedência. Se você planeja usar o arquivo de regras em diferentes sistemas com classificações e hierarquias de categorias semelhantes, utilize nomes de classificação em vez de IDs de classificação.CONFIDENCEUm valor de tipo float entre 0 e 1 que indica o nível de confiança na atribuição do termo ou da classificação. O valor padrão é 1.0 (=100%). Independentemente da localidade, o ponto decimal é
.
Colunas adicionais que você pode incluir:
ACTIVESe você definir o valor
no, a regra não será considerada durante a atribuição. Durante o desenvolvimento, você pode querer desativar certas regras sem removê-las do arquivo CSV.GROUPUm grupo de regras que permite que você configure regras de atribuição mais complexas, como,
If a column name contains X and its description contains Y, then assign term T1 and T2.Pelo menos uma condição e uma ação devem ser definidas por grupo de regras.
Opções do arquivo de regras
Você pode fornecer opções adicionais para influenciar como as regras são aplicadas no campo de descrição do arquivo de regras carregado. Adicione linhas no formato <option-name>=<option-value>. O campo de descrição também pode conter qualquer outro texto.
default_confidence_if_missingUm valor flutuante entre 0 e 1 que indica uma confiança padrão diferente de 1.0 se a coluna
CONFIDENCEestiver vazia.use_expanded_namesDefine quando um nome gerado também deve ser considerado quando as regras são avaliadas. Essa opção só está disponível se os recursos de enriquecimento baseados em IA gerativa estiverem ativados.
Valores possíveis:
NEVER: Não considere os nomes gerados.SUGGESTED: Considere um nome gerado sugerido.ACCEPTED: Considere um nome gerado atribuído.
O valor padrão é
ACCEPTED.use_generated_descriptionsDefine quando uma descrição gerada também deve ser considerada como uma descrição quando as regras são avaliadas. Essa opção só está disponível se os recursos de enriquecimento baseados em IA gerativa estiverem ativados.
Valores possíveis:
NEVER: Não considere as descrições geradasSUGGESTED: Considere uma descrição gerada sugerida.ACCEPTED: Considere uma descrição gerada atribuída.
O valor padrão é
ACCEPTED.
Exemplos
Veja alguns exemplos de regras e grupos de regras.
Exemplos de regras
O exemplo a seguir descreve três regras:
- Se uma coluna tiver um nome que contenha a string
address, atribua o termopersonal datacom 100% de confiança. 100% é o padrão se a colunaCONFIDENCEestiver vazia. - Se uma coluna tiver um nome que contenha a string
customer, atribua o termodata subjectcom 90% de confiança. - Se um ativo tiver uma descrição que contenha a sequência de caracteres
client, atribua o termodata subject, mas com 100% de confiança. - Se um ativo tiver uma descrição que contenha a sequência de caracteres
FYEO, atribua a classificaçãoConfidentialcom 100% de confiança.
Os nomes dos termos são escritos como um caminho na árvore de categorias: GDPR é uma categoria raiz que contém os termos personal data e data subject.
A coluna COMMENT contém informações adicionais sobre a regra, mas não afeta a atribuição de termos.
| OBJECT_TYPE | PROPERTY | TIPO DE PARTIDA | MATCH_STRING | NOME_DO_TERMO | NOME_DA_CLASSIFICAÇÃO | CONFIANÇA | COMMENT |
|---|---|---|---|---|---|---|---|
| coluna | nome | contém | endereço | GDPR >> dados pessoais | O endereço é um dado pessoal | ||
| coluna | nome | contém | Cliente | GDPR >> titular dos dados | 0.9 | Os clientes são titulares de dados | |
| ativo | descrição | contém | cliente | GDPR >> titular dos dados | Os clientes são titulares de dados | ||
| ativo | descrição | contém | FYEO | >> Confidencial | A descrição contém "FYEO" se for confidencial |
Exemplos de grupos de regras
O exemplo a seguir mostra um grupo de regras G1 que une duas condições e um grupo de regras G2 que define dois termos a serem atribuídos a uma condição:
G1: Se o nome de uma coluna contiveraddresse sua descrição contiveridentifier, atribua o termoonline identifiercom 92% de confiança.G2: Se uma coluna tiverpostfach(" P.O. Box” em alemão) como um dos seus valores mais frequentes, atribua ao termoEuropean Unionuma confiança de 90% e ao termodata subjectuma confiança de 95%.
| OBJECT_TYPE | PROPERTY | TIPO DE PARTIDA | MATCH_STRING | NOME_DO_TERMO | CONFIANÇA | GRUPO |
|---|---|---|---|---|---|---|
| coluna | nome | contém | endereço | G1 | ||
| coluna | descrição | contém | identificador | GDPR >> identificador on-line | 0.92 | G1 |
| coluna | mais valores de frequência | contém | caixa postal | GDPR >> União Europeia | 0.9 | G2 |
| GDPR >> titular dos dados | 0.95 | G2 |
Este exemplo mostra como você pode usar as propriedades parentassetnameparentassetdescription e.
G3: Se a coluna com o nomeCUSTOMER_IDestiver contida em um ativo de dados com o nomeCUSTOMER_ADDRESS, atribua ao termoPerson:A10100% de confiança.G4: Se a coluna com o nomeACCT_IDestiver contida em um ativo de dados onde as descrições contêmcustomer account information, atribua o termoAccount numbercom 95% de confiança.
| OBJECT_TYPE | PROPERTY | TIPO DE PARTIDA | MATCH_STRING | NOME_DO_TERMO | CONFIANÇA | GRUPO |
|---|---|---|---|---|---|---|
| coluna | nome do ativo pai | equivalentes | ENDEREÇO DO CLIENTE | G3 | ||
| coluna | nome | equivalentes | customer_id | Empresa >> Departamento >> Pessoa: A10 | 1.0 | G3 |
| coluna | descrição do ativo pai | contém | informações da conta do cliente | G4 | ||
| coluna | nome | equivalentes | ID_ACCT | Finanças >> Contas >> Número da conta | 0.95 | G4 |
Exemplo de descrição do arquivo de regras
O exemplo a seguir é uma descrição válida de um arquivo de regras:
This the best rule file in the world.
default_confidence_if_missing = 0.95
use_expanded_names = ACCEPTED
use_generated_descriptions = SUGGESTED
Closing remarks.