Rischio di reidentificazione per AI
Descrizione
Anche rimuovendo le informazioni personali (PI) e le informazioni personali sensibili (SPI) dai dati, potrebbe essere possibile identificare le persone grazie alle correlazioni con altre caratteristiche disponibili nei dati.
Perché la reidentificazione è una preoccupazione per i modelli di fondazione?
L'inclusione di caratteristiche irrilevanti ma altamente correlate alle informazioni personali per l'addestramento del modello può aumentare il rischio di reidentificazione, mentre i dati sintetici generati da tali dati possono conservare queste correlazioni.
Divulgazione dell'identità
Uno studio finlandese ha spiegato che gli insiemi di dati sintetici offrono una forte protezione contro la divulgazione dell'identità, a patto che non corrispondano strettamente ai dati originali (overfitting). Gli outlier unici rappresentano un rischio maggiore, poiché i punti di dati riconoscibili potrebbero essere utilizzati per dedurre le proprietà dei dati reali e ottenere maggiori informazioni.
Reidentificazione
Uno studio del 2019 pubblicato su Nature Communications ha stimato che uno sconcertante 99.98 % degli americani potrebbe essere re-identificato utilizzando solo 15 attributi demografici. Anche le immagini mediche sintetiche destano preoccupazione.
Argomento principale: Atlante del rischio di IA
Facciamo degli esempi che sono stati trattati dalla stampa per aiutare a spiegare molti dei rischi dei modelli di fondazione. Molti di questi eventi trattati dalla stampa sono ancora in evoluzione o sono stati risolti, e fare riferimento ad essi può aiutare il lettore a comprendere i rischi potenziali e a lavorare per mitigarli. L'evidenziazione di questi esempi è solo a scopo illustrativo.