Modell zur Risikobewertung

Die Modell-Risikobewertungs-Engine misst Risiken für Fundamentmodelle, indem sie Metriken berechnet, die mit Risikodimensionen zusammenhängen, um Ihnen dabei zu helfen, die besten Modelle zu ermitteln, die Ihre Risikotoleranzziele erreichen.

Die Modell-Risikobewertungs-Engine ist ein Modul im ibm-watsonx-gov Python SDK, das Ihnen dabei helfen kann, die Risiken generativer KI zu verstehen und effektive Methoden zur Messung und Minderung der Risiken zu etablieren. Dieses Modul hilft bei der quantitativen Risikobewertung von Fundamentmodellen und unterstützt die Bewertung von watsonx.ai großen Sprachmodellen und externen Modellen anderer Anbieter.

Bei Bewertungen werden Kennzahlen für die folgenden Risikodimensionen berechnet:

  • Toxische Emissionen
  • Schädliche Ausgabe
  • Prompt undicht
  • Halluzination
  • Prompt-Injection
  • Jailbreaking
  • Output-Verzerrung
  • Erzeugung schädlicher Codes

Die Risikodimensionen sind eine Sammlung von Risiken, die bei der Arbeit mit generativen KI-Ressourcen und Modellen des maschinellen Lernens auftreten können. Weitere Informationen finden Sie im KI-Risikoatlas. Die verfügbaren Risikodimensionen sind eine Teilmenge der im Risikoatlas verfügbaren Risiken.

Sie müssen watsonx.ai Anmeldeinformationen bereitstellen, um Metriken für die Risiken Jailbreaking, Prompt-Leaking, Generierung von schädlichem Code und Prompt-Injection zu berechnen. Für jede Risikodimension werden ein oder mehrere standardisierte Datensätze verwendet, um das Risikoniveau zu bewerten.

Nach Abschluss der Risikobewertung können Sie die Ergebnisse in der Governance-Konsole speichern oder als PDF-Bericht exportieren, der die berechneten Kennzahlen zusammenfasst.

Mit der Modell-Risikobewertungs-Engine können Sie die folgenden Aufgaben ausführen:

  • Berechnen Sie Metriken mit watsonx.ai als Inferenzmaschine.
  • Risikokennzahlen für Gründungsmodelle in watsonx.ai berechnen.
  • Berechnen Sie Metriken für Fundamentmodelle, die nicht in watsonx.ai enthalten sind, indem Sie Ihre eigene Bewertungsfunktion für jedes Modell implementieren und auswerten.
  • Speichern Sie berechnete Metriken in der Governance-Konsole ( OpenPages ).
  • Abrufen berechneter Metriken von der Governance-Konsole ( OpenPages ).
  • Erstellen Sie einen PDF-Bericht mit berechneten Kennzahlen.
  • Die Metriken in einer Notizbuchzelle in einem Tabellen- oder Diagrammformat anzeigen.

Um das Modul zur Bewertung des Modellrisikos zu verwenden, müssen Sie das ibm-watsonx-gov Python SDK mit bestimmten Einstellungen installieren:

pip install "ibm-watsonx-gov[mre]"

Eingabe

Bei Verwendung der Modell-Risikobewertungs-Engine können Sie die folgenden Eingabeparameter angeben:

Tabelle 1. Eingabeparameter für die Modell-Risikobewertungsmaschine
Parameter Beschreibung
wx_gc_configuration (Optional) Die Konfiguration der Governance-Konsole zum Speichern der berechneten Metrikergebnisse. Durch das Speichern des Bewertungsergebnisses in der Governance-Konsole wird verhindert, dass die Metriken bei der nächsten Bewertung erneut berechnet werden. Die Bewertungsmaschine ruft stattdessen die gespeicherten Metriken ab.
foundation_model_name Der Name des zu bewertenden Stiftungsmodells.
risk_dimensions (Optional) Eine Liste der zu bewertenden Risiken. Wenn nicht angegeben, werden alle verfügbaren Risiken bewertet.
max_sample_size (Optional) Die maximale Anzahl von Dateninstanzen, die für die Auswertung verwendet werden sollen. Geben Sie einen kleineren Wert an (z. B. 50), um die Auswertung zu beschleunigen, oder wählen Sie "Keine", um alle Daten für die Auswertung zu verwenden, was länger dauert, aber aussagekräftigere Ergebnisse liefert.
model_details Die Details des Stiftungsmodells. Der Wert kann WxAIFoundationModel oder CustomFoundationModel sein, wobei WxAIFoundationModel ein Objekt ist, das die Logik zum Aufrufen von Inferenzen für watsonx.ai darstellt, und CustomFoundationModel ein Objekt ist, das die Logik zum Aufrufen der Logik für ein externes LLM enthält.
pdf_report_output_path (Optional) Der vom Benutzer angegebene Dateipfad, unter dem der generierte PDF-Bericht gespeichert wird.

Ausgabe

Die Modell-Risikobewertungsmaschine kann Ihnen dabei helfen, Metriken für jede Risikodimension als Ausgabe zu berechnen. Diese Ausgabe kann in einer Notizbuchzelle gespeichert, an OpenPages, gesendet oder als PDF-Bericht exportiert werden. Die Modell-Risikobewertungsmaschine berechnet Kennzahlen für die folgenden Risikodimensionen:

Tabelle 2. Risikodimensionen für die Modell-Risikobewertungsmaschine
Risiko Beschreibung
Toxische Emissionen Das Modell produziert hasserfüllte, beleidigende und profane (HAP) oder obszöne Inhalte.
Schädliche Ausgabe Das Modell könnte eine Sprache erzeugen, die zu körperlicher Gewalt führt, oder eine Sprache, die offen gewalttätige, verdeckt gefährliche oder anderweitig indirekt unsichere Aussagen enthält.
Halluzination Faktisch ungenaue oder unwahre Inhalte in Bezug auf die Modell-Trainingsdaten oder -eingaben. Dieses Risiko wird manchmal auch als Mangel an Treue oder als Mangel an Bodenständigkeit bezeichnet.
Prompt-Injection Ein Angriff, der ein generatives Modell, das eine Eingabe als Eingabe verwendet, dazu zwingt, durch Manipulation der in seiner Eingabe enthaltenen Struktur, Anweisungen oder Informationen eine unerwartete Ausgabe zu erzeugen.
Jailbreaking Ein Angriff, der versucht, die im Modell festgelegten Leitplanken zu durchbrechen, um eingeschränkte Aktionen auszuführen.
Output-Verzerrung Erstellte Inhalte könnten bestimmte Gruppen oder Einzelpersonen auf unfaire Weise darstellen.
Prompt undicht Ein Versuch, die Systemaufforderung eines Modells zu extrahieren
Erzeugung schädlichen Codes Modelle können Code generieren, der Schaden verursacht oder unbeabsichtigt andere Systeme beeinträchtigt.

Beispiele

Mit der Modell-Risikobewertungs-Engine können Sie Bewertungen durchführen und Ergebnisse generieren, wie in den folgenden Beispielen gezeigt:

Schritt 1: Konfiguration

Erstellen Sie eine Modellkonfiguration für eine Risikobewertungsmaschine:

from ibm_watsonx_gov.config.model_risk_configuration import ModelRiskConfiguration, WxGovConsoleConfiguration

configuration = ModelRiskConfiguration(
    model_details = model_details,
    risk_dimensions=risk_dimensions,
    max_sample_size=max_sample_size,
    pdf_report_output_path=pdf_report_output_path,
    # wx_gc_configuration=wx_gc_configuration, # uncomment this line if the result should be pushed to Governance Console (OpenPages)
)

Schritt 2: Auswertung durchführen

Führen Sie eine Bewertung durch, um Risiken zu messen:

from ibm_watsonx_gov.evaluators.model_risk_evaluator import ModelRiskEvaluator
from ibm_watsonx_gov.clients.api_client import APIClient
from ibm_watsonx_gov.credentials import Credentials

wxgov_client = APIClient(credentials=Credentials(api_key=""))
evaluator = ModelRiskEvaluator(
    configuration=config, api_client=wxgov_client)
result = evaluator.evaluate()
result.to_json()

Schritt 3: PDF-Bericht erstellen

Exportieren Sie die ausgewerteten Daten und Kennzahlen als PDF-Bericht:

evaluator.download_model_risk_report()

Weitere Informationen finden Sie im Notebook "Model Risk Evaluation Engine ".