Risco de reidentificação para IA

Privacidade Ícone que representa riscos à privacidade.
Privacidade
Riscos dos dados de treinamento
Risco tradicional da IA
Amplificado por dados sintéticos

Descrição

Mesmo com a remoção de informações pessoais (PI) e informações pessoais confidenciais (SPI) dos dados, pode ser possível identificar pessoas devido a correlações com outros recursos disponíveis nos dados.

Por que a reidentificação é uma preocupação para modelos de fundação?

A inclusão de recursos irrelevantes, mas altamente correlacionados com informações pessoais para treinamento de modelos pode aumentar o risco de reidentificação, e os dados sintéticos gerados a partir desses dados podem preservar essas correlações.

Imagem de fundo para riscos associados aos dados de treinamento
Exemplo

Divulgação de identidade

Um estudo finlandês explicou que os conjuntos de dados sintéticos oferecem uma forte proteção contra a divulgação de identidades, desde que não se aproximem dos dados originais (overfitting). Os outliers exclusivos representam um risco maior, pois pontos de dados reconhecíveis podem ser usados para inferir propriedades dos dados reais e obter mais informações.

Imagem de fundo para riscos associados aos dados de treinamento
Exemplo

Reidentificação

Um estudo de 2019 publicado na Nature Communications estimou que um número impressionante de 99.98 % dos americanos poderia ser reidentificado usando apenas 15 atributos demográficos. Até mesmo as imagens médicas sintéticas são motivo de preocupação.

Tópico principal: Atlas de risco de IA

Nós fornecemos exemplos cobertos pela imprensa para ajudar a explicar muitos dos riscos dos modelos de fundação. Muitos desses eventos cobertos pela imprensa ainda estão evoluindo ou já foram resolvidos, e fazer referência a eles pode ajudar o leitor a entender os possíveis riscos e a trabalhar para mitigá-los. O destaque desses exemplos é apenas para fins ilustrativos.