Évaluer l'équité
Comprendre les concepts utilisés pour calculer les évaluations d'équité.
- Comment le biais est-il calculé?
- Des données équilibrées et une égalité parfaite
- Calculer l'égalité parfaite
- Conversion du type de données d'une colonne de prévision
- Comment interpréter un score d'équité supérieur à 100 %
Comment le biais est-il calculé?
L'algorithme du moniteur d'équité calcule le biais toutes les heures à partir des derniers N enregistrements présents dans la table de journalisation des charges utiles; la valeur de N est définie lors de la configuration du moniteur d'équité. L'algorithme utilise une méthode appelée « perturbation » pour évaluer les écarts entre les résultats attendus dans les données.
La perturbation fait passer les valeurs de la caractéristique du groupe de référence au groupe surveillé, ou inversement. Les données perturbées sont ensuite envoyées au modèle pour évaluer son comportement. L'algorithme examine les derniers N enregistrements de la table de données utiles ainsi que le comportement du modèle sur les données perturbées afin de déterminer si les résultats du modèle indiquent la présence d'un biais.
Un modèle est considéré comme biaisé si le pourcentage de résultats favorables pour le groupe surveillé est inférieur au pourcentage de résultats favorables pour le groupe de référence, d'une valeur seuil que vous spécifiez lors de la configuration du moniteur d'équité.
Notez que les valeurs d'équité peuvent dépasser 100 %. Ce calcul signifie que le groupe étudié a obtenu de meilleurs résultats que le groupe de référence. De plus, si aucune nouvelle demande d'évaluation n'est envoyée, la valeur d'équité reste constante.
Des données équilibrées et une égalité parfaite
Pour les ensembles de données équilibrés, les concepts suivants s'appliquent :
- Pour déterminer la valeur d'égalité parfaite, les transactions du groupe de référence sont synthétisées en remplaçant la valeur de chaque caractéristique surveillée de chaque transaction du groupe surveillé par toutes les valeurs du groupe de référence. Ces nouvelles transactions synthétisées sont ajoutées à l'ensemble des transactions de référence du groupe et évaluées par le modèle.
Par exemple, si la caractéristique surveillée est SEX et que le groupe surveillé est FEMALE, toutes FEMALE les transactions sont dupliquées en tant que MALE transactions. Les autres caractéristiques restent inchangées. Ces nouvelles transactions MALE synthétisées sont ajoutées à l'ensemble des transactions de MALE référence d'origine.
- Le pourcentage de résultats favorables est calculé à partir du nouveau groupe de référence. Ce pourcentage correspond à une équité parfaite pour le groupe étudié.
- Les transactions de groupe surveillées sont également synthétisées en remplaçant la valeur de l'attribut de référence de chaque transaction de groupe de référence par la valeur du groupe surveillé. Ces nouvelles transactions synthétisées sont ajoutées à l'ensemble des transactions du groupe faisant l'objet d'une surveillance et sont évaluées par le modèle.
Si la fonctionnalité surveillée est SEX et que le groupe surveillé est FEMALE, toutes MALE les transactions sont dupliquées en tant que FEMALE transactions. Les autres caractéristiques restent inchangées. Ces nouvelles transactions FEMALE synthétisées sont ajoutées à l'ensemble des transactions de groupe initialement FEMALE surveillées.
Calculer l'égalité parfaite
La formule mathématique suivante sert à calculer l'égalité parfaite :
Perfect equality = Percentage of favorable outcomes for all reference transactions,
including the synthesized transactions from the monitored group
Par exemple, si la caractéristique surveillée est SEX et que le groupe surveillé est FEMALE, la formule suivante donne l'équation de l'égalité parfaite :
Perfect equality for `SEX` = Percentage of favorable outcomes for `MALE` transactions,
including the synthesized transactions that were initially `FEMALE` but changed to `MALE`
Lorsque vous configurez les évaluations d'équité, vous pouvez générer un ensemble de mesures permettant d'évaluer l'équité de votre modèle. Vous pouvez utiliser les indicateurs d'équité pour déterminer si votre modèle produit des résultats biaisés.
Conversion du type de données d'une colonne de prévision
En ce qui concerne le contrôle de l'équité, la colonne de prédiction n'accepte que des valeurs numériques entières, même si l'étiquette de prédiction est de type catégoriel. Il est possible de convertir le type de données de la colonne de prévision.
Par exemple, les données d'apprentissage peuvent comporter des étiquettes de classe telles que « Prêt refusé » ou « Prêt accordé ». La valeur de prédiction renvoyée par le point de terminaison de notation d' IBM Watson Machine Learning a des valeurs telles que « 0.0 », « 1.0 ». Le critère d'évaluation comporte également une colonne facultative qui contient la représentation textuelle de la prédiction. Par exemple, si prediction=1.0, la colonne predictionLabel pourrait avoir la valeur « Prêt accordé ». Si cette colonne est disponible, lorsque vous définissez les résultats favorables et défavorables pour le modèle, indiquez les chaînes de caractères « Prêt accordé » et « Prêt refusé ». Si une telle colonne n'est pas disponible, vous devez alors spécifier les valeurs de type entier et double des variables « 1.0 » et « 0.0 » pour les classes « favorable » et « défavorable ».
IBM Watson Machine Learning comporte un concept de schéma de sortie qui définit le schéma des données de sortie du point de terminaison de notation IBM Watson Machine Learning ainsi que la fonction des différentes colonnes. Ces rôles permettent d'identifier quelle colonne contient la valeur prédite, quelle colonne contient la probabilité de prédiction, ainsi que la valeur de l'étiquette de classe, etc. Le schéma de sortie est défini automatiquement pour les modèles créés à l'aide du générateur de modèles. Il est également possible de le configurer à l'aide du client IBM Watson Machine Learning Python. Les utilisateurs peuvent utiliser le schéma de sortie pour définir une colonne contenant la représentation sous forme de chaîne de caractères de la prédiction. Définissez la valeur modeling_role de la colonne sur « decoded-target ». La documentation relative au client IBM Watson Machine Learning Python est disponible à l'adresse suivante : https://ibm.github.io/watsonx-ai-python-sdk/core_api.html#repository. Recherchez « OUTPUT_DATA_SCHEMA » pour comprendre le schéma de sortie. L'appel d'API à utiliser est celui store_model qui accepte OUTPUT_DATA_SCHEMA comme paramètre.
Comment interpréter un score d'équité supérieur à 100 %
En fonction de la configuration de l'équité, votre score d'équité peut être supérieur à 100 pour cent. En d'autres termes, votre groupe surveillé obtient des résultats relativement plus équitables comparé au groupe de référence. Cela signifie techniquement que le modèle est inéquitable dans le sens inverse.