On parle de données erronées lorsqu’elles ne sont pas représentatives, qu’elles manquent d’informations, qu’elles sont historiquement biaisées ou qu’elles sont autrement « mauvaises ». Il en résulte des algorithmes qui produisent des résultats injustes et amplifient tout biais dans les données. Les systèmes d’IA qui utilisent des résultats biaisés comme données d’entrée pour la prise de décision créent une boucle de rétroaction qui peut également renforcer les biais au fil du temps. Ce cycle, dans lequel l’algorithme apprend et perpétue en permanence les mêmes modèles biaisés, conduit à des résultats de plus en plus biaisés.
Des biais peuvent également survenir au cours de la phase d’entraînement si les données sont mal catégorisées ou évaluées. Il arrive que les algorithmes « apprennent » de la corrélation des données plutôt que de la causalité, car ils ne sont pas aptes à comprendre la différence. Dans ce cas, les productions de l’algorithme peuvent être biaisées dans la mesure où le modèle n’a pas pris en compte d’autres facteurs potentiellement plus importants dans les données.
Un exemple couramment cité de biais de corrélation est un modèle hypothétique qui établit un lien de causalité entre l’augmentation des attaques de requins et l’augmentation des ventes de glaces. En réalité, les deux situations ont tendance à se produire pendant l’été et présentent seulement une relation de corrélation.