Risco de reidentificação para IA
Descrição
Mesmo com a remoção de informações pessoais (PI) e informações pessoais confidenciais (SPI) dos dados, pode ser possível identificar pessoas devido a correlações com outros recursos disponíveis nos dados.
Por que a reidentificação é uma preocupação para modelos de fundação?
A inclusão de recursos irrelevantes, mas altamente correlacionados com informações pessoais para treinamento de modelos pode aumentar o risco de reidentificação, e os dados sintéticos gerados a partir desses dados podem preservar essas correlações.
Divulgação de identidade
Um estudo finlandês explicou que os conjuntos de dados sintéticos oferecem uma forte proteção contra a divulgação de identidades, desde que não se aproximem dos dados originais (overfitting). Os outliers exclusivos representam um risco maior, pois pontos de dados reconhecíveis podem ser usados para inferir propriedades dos dados reais e obter mais informações.
Reidentificação
Um estudo de 2019 publicado na Nature Communications estimou que um número impressionante de 99.98 % dos americanos poderia ser reidentificado usando apenas 15 atributos demográficos. Até mesmo as imagens médicas sintéticas são motivo de preocupação.
Tópico principal: Atlas de risco de IA
Nós fornecemos exemplos cobertos pela imprensa para ajudar a explicar muitos dos riscos dos modelos de fundação. Muitos desses eventos cobertos pela imprensa ainda estão evoluindo ou já foram resolvidos, e fazer referência a eles pode ajudar o leitor a entender os possíveis riscos e a trabalhar para mitigá-los. O destaque desses exemplos é apenas para fins ilustrativos.