Bewertungsergebnisse prüfen

Wenn Sie Auswertungen konfigurieren, können Sie die Auswertungsergebnisse analysieren, um Erkenntnisse über die Leistung Ihres Modells zu gewinnen. Ein Dashboard stellt die Tools zum Prüfen von Leistungsdetails, zur gemeinsamen Nutzung von Informationen zu Alerts oder zum Drucken von Berichten bereit.

Einige der Details, die Sie über das Insights-Dashboard einsehen können, sind:

  • Überprüfen Sie die Qualitätsergebnisse, um eine Fehlermatrix anzuzeigen, mit der Sie feststellen können, ob Ihr bereitgestelltes Modell Ihre Transaktionen ordnungsgemäß analysiert hat.
  • Zeigen Sie Driftergebnisse an, um die Transaktionen anzuzeigen, die für einen Rückgang der Genauigkeit und/oder Datenkonsistenz verantwortlich sind.
  • Überprüfen Sie die Ergebnisse der Modellzustandsbewertung, wo Sie eine Zusammenfassung der Metriken anzeigen können, die während der letzten Auswertung mit Scorecardkacheln generiert wurden, die mit unterschiedlichen Dimensionen korrelieren.

Das Evaluierungsdiagramm für die Modellbereitstellung wird mit jeder Auswertung angezeigt, die Details dazu enthält, wie das Modell festgelegte Schwellenwerte erreicht.

So zeigen Sie Ergebnisse im Insights-Dashboardan:

  1. Klicken Sie in „ Watson OpenScale “ auf das Symbol Aktivitätssymbol „Aktivität“, um das Insights-Dashboard zu öffnen.

  2. Wählen Sie die Kachel des Bereitstellungsmodells aus, für die Sie Ergebnisse anzeigen wollen. Die Ergebnisse Ihrer letzten Auswertung werden angezeigt.

  3. Klicken Sie auf den Pfeil Navigationspfeil in einem Auswertungsabschnitt, um Datenvisualisierungen von Auswertungsergebnissen innerhalb der von Ihnen angegebenen Einstellungen für Zeitrahmen und Datumsbereich anzuzeigen. Die letzte Auswertung für den ausgewählten Zeitrahmen wird auch während des zugehörigen Datenbereichs angezeigt.

  4. Im Menü Aktionen können Sie Details zu Ihrem Modell anzeigen, indem Sie eine der folgenden Analyseoptionen auswählen:

    • Alle Bewertungen: Für Vorproduktionsmodelle können Sie einen Verlauf Ihrer Bewertungen anzeigen, um zu verstehen, wie sich Ihre Ergebnisse im Zeitverlauf ändern.
    • Vergleichen: Vergleichen Sie Modelle mit einem Matrixdiagramm, das Schlüsselmetriken hervorhebt, um zu ermitteln, welche Version eines Modells für die Produktion bereit ist oder für welche Modelle mehr Training erforderlich ist.
    • Modellinformationen anzeigen:Zeigen Sie Details zu Ihrem Modell an, um zu verstehen, wie Ihre Implementierungsumgebung eingerichtet ist.
    • Bericht als PDF herunterladen: Generieren Sie einen Modellzusammenfassungsbericht, der alle Metriken und die Erklärung dafür enthält, warum sie so bewertet wurden, wie sie waren.
    • Alert einrichten: Senden Sie Alerts zu Schwellenwertverstößen an eine E-Mail-Adresse.

Sie können auch das Menü Aktionen verwenden, um Daten für Modellbewertungen zu verwalten. Weitere Informationen finden Sie unter Modelltransaktionen senden.

Bei Zeitreihendiagrammen werden die aggregierten Auswertungen als Datenpunkte angezeigt, die Sie auswählen können, um die Ergebnisse für einen bestimmten Zeitpunkt zu betrachten. Der Zeitstempel jedes Datenpunkts, der angezeigt wird, wenn Sie den Mauszeiger über Zeitreihendiagramme bewegen, stimmt aufgrund des Standardaggregationsverhaltens nicht mit dem Zeitstempel der letzten Auswertung überein.

Bei Stapelbereitstellungen können Zeitreihendiagramme auch die folgenden Metriken anzeigen:

  • Das Auswertungsintervall ist standardmäßig auf 1 Woche eingestellt. Mit dem Python können Sie das Auswertungsintervall auf 1 Monat oder 1 Jahr einstellen.
  • Das Intervall, das mit der Metrik Zeitrahmen angegeben wird, wird auf das Auswertungsintervall gesetzt, das Sie für die Bewertungen konfigurieren.

In den folgenden Abschnitten wird beschrieben, wie Sie die Ergebnisse Ihrer Modellauswertungen analysieren können:

Fairnessergebnisse überprüfen

Um Ihnen die Überprüfung der Fairness-Ergebnisse zu erleichtern, werden Berechnungen für die folgenden Arten von Datensätzen bereitgestellt:

  • Ausgeglichen: Die ausgewogene Berechnung enthält die Scoring-Anforderung, die für die ausgewählte Stunde empfangen wurde. Die Berechnung berücksichtigt auch weitere Datensätze aus früheren Stunden, falls die für die Auswertung erforderliche Mindestanzahl an Datensätzen nicht erreicht wurde. Enthält zusätzlich verzerrte und synthetisierte Datensätze, mit denen die Reaktion des Modells getestet wird, wenn sich der Wert des überwachten Merkmals ändert.
  • Nutzdaten : Die tatsächlichen Bewertungsanfragen, die das Modell für die ausgewählte Stunde erhält.
  • Trainingsdaten : Die Datensätze, die zum Trainieren des Modells verwendet werden.
  • Verzerrungsbereinigte Daten: Die Ausgabe des Verzerrungsbereinigungsalgorithmus nach der Verarbeitung der Laufzeitdaten und der durch Perturbation veränderten Daten.

Um die Berechnung des ausgeglichenen Datasets für Stapelbereitstellungssubskriptionen anzuzeigen, müssen Sie einen Modellendpunkt angeben, wenn Sie Ihre Bereitstellungsdetails angeben. Weitere Informationen finden Sie unter „Konfigurieren des Batch-Prozessors “. Berechnungen mit verzerrten Datensätzen für Batch-Einsätze werden für Modellauswertungen nicht unterstützt.

Datenvisualisierung von Fairnessmetriken für jede überwachte Gruppe

Mit dem Diagramm können Sie die Gruppen beobachten, bei denen Verzerrungen auftreten, und den Prozentsatz der erwarteten Ergebnisse für diese Gruppen anzeigen. Sie können auch den Prozentsatz der erwarteten Ergebnisse für Referenzgruppen anzeigen. Dies ist der Durchschnitt der erwarteten Ergebnisse über alle Referenzgruppen hinweg. Die Diagramme zeigen das Vorhandensein von Verzerrungen an, indem sie das Verhältnis des Prozentsatzes der erwarteten Ergebnisse für überwachte Gruppen in einem Datenbereich mit dem Prozentsatz der Ergebnisse für Referenzgruppen vergleichen.

Die Grafik zeigt zudem die Verteilung der Referenz- und Messwerte für jeden einzelnen Wert des Attributs in den Daten aus der Payload-Tabelle, die zur Ermittlung von Verzerrungen analysiert wurden. Die Verteilung der Nutzdaten wird für jeden einzelnen Wert der Attribute angezeigt. Sie können diese Daten verwenden, um das Ausmaß der Verzerrung mit dem vom Modell empfangenen Datenvolumen zu korrelieren. Sie können auch den Prozentsatz der Gruppen mit erwarteten Ergebnissen anzeigen, um Quellen für Verzerrungen zu ermitteln, die zu Abweichungen bei den Ergebnissen geführt haben und zu Erhöhungen des Prozentsatzes der erwarteten Ergebnisse für Referenzgruppen geführt haben.

Überprüfung der Qualitätsergebnisse

Um Sie bei der Überprüfung der Qualitätsergebnisse zu unterstützen, wird eine Konfusionsmatrix angezeigt, mit deren Hilfe Sie feststellen können, ob Ihr eingesetztes Modell Ihre Transaktionen falsch analysiert hat. Bei binären Klassifizierungsmodellen werden die Transaktionsdatensätze als falsch-positiv oder falsch-negativ und bei Mehrklassenmodellen als falsche Klassenzuordnung eingestuft. Bei binären Klassifikationsproblemen wird die Zielkategorie entweder der Stufe positive oder negative zugeordnet. Die Konfusionsmatrix zeigt auch den Prozentsatz der positiven und negativen Transaktionen an, die korrekt analysiert wurden. Um die Korrektheit zu erkennen, hebt die Matrix auch die Kategorien der Vorgänge mit grünen und blauen Farbtönen hervor, um den Grad der am meisten oder am wenigsten korrekten Kategorien anzuzeigen. Sie können die Menüs Voraussichtlicher Wert und Tatsächlicher Wert verwenden, um die Kategorie der Transaktionen anzugeben, die Sie analysieren möchten.

Detaillierte Tabelle der Qualitätsmetriken

Ergebnisse der Drift v2 überprüfen

Wenn Sie die Bewertungsergebnisse von drift v2 überprüfen, werden ausklappbare Kacheln angezeigt, die Sie öffnen können, um verschiedene Details zu den Metriken anzuzeigen. Mit einem Zeitreihendiagramm können Sie den Verlauf anzeigen, wie sich die einzelnen Metrikbewertungen im Zeitverlauf ändern, oder Sie können Details anzeigen, wie die Scoreausgabe und Featuredrifts berechnet werden. Sie können auch Details zu den einzelnen Merkmalen anzeigen, um zu verstehen, wie sie zu den erzielten Ergebnissen beitragen.

Ergebnisse der Drift v2 -Auswertung werden angezeigt

Ergebnisse des Modellzustands überprüfen

Wenn Sie die Ergebnisse der Bewertung des Modellzustands überprüfen, erhalten Sie eine Zusammenfassung der Kennzahlen, die während der letzten Bewertung erstellt wurden, mit Scorecard-Kacheln, die mit verschiedenen Dimensionen korrelieren. Bei Metriken mit mehreren Dimensionen können Sie auf ein Dropdown-Menü auf den Kacheln klicken, um die Metrik auszuwählen, die Sie analysieren wollen. Um zu analysieren, wie sich Ihre Metriken im Zeitverlauf ändern, können Sie auf die ausblendbaren Kacheln für jede Kategorie klicken, um Zeitreihendiagramme anzuzeigen.

Modellzustandsmetriken werden angezeigt

Weitere Informationen finden Sie unter Auswertungsmetriken für den Modellzustand.