I dati difettosi sono caratterizzati come non rappresentativi, privi di informazioni, storicamente distorti o comunque "cattivi". Questo porta ad algoritmi che producono risultati ingiusti e amplificano qualsiasi distorsione nei dati. I sistemi AI che utilizzano risultati distorti come dati di input per il processo decisionale creano un ciclo di feedback che può anche rafforzare le distorsioni nel tempo. Questo ciclo, in cui l'algoritmo apprende e perpetua costantemente gli stessi modelli distorti, porta a risultati sempre più distorti.
Durante la fase di addestramento possono verificarsi anche distorsioni se i dati vengono classificati o valutati in modo non corretto. A volte, gli algoritmi possono "imparare" dalla correlazione dei dati piuttosto che dalla causalità, poiché non possiedono la capacità di comprendere la differenza. Quando questo accade, l'output dell'algoritmo può presentare distorsioni in quanto il modello non ha preso in considerazione altri fattori nei dati che potrebbero avere maggiore importanza.
Un esempio comunemente citato di distorsione della correlazione è un modello ipotetico che stabilisce una relazione causale tra l'aumento degli attacchi di squali e l'aumento delle vendite di gelati. In realtà, entrambe le situazioni tendono a verificarsi durante l'estate e hanno solo una relazione correlata.