評価指標を評価する

評価指標モジュールは、LLM指標の算出に役立ちます。

Evaluate metricsは、 ibm-watsonx-gov Python SDKのモジュールであり、文脈の関連性、忠実度、回答の類似性に関する指標のスコアを計算するメソッドを含んでいます。 モデルインサイトを使用して評価結果を可視化することができます。

メトリック評価モジュールを使用するには、 ibm-watsonx-gov Python SDK を特定の設定でインストールする必要があります:

pip install "ibm-watsonx-gov[metrics]"

次の例で示すように、評価指標モジュールを使用して指標を計算することができます

簡易メトリック評価

from ibm_watsonx_gov.evaluators.metrics_evaluator import MetricsEvaluator
from ibm_watsonx_gov.metrics import AnswerRelevanceMetric
os.environ["WATSONX_APIKEY"] = "..."

evaluator = MetricsEvaluator()
metrics = [AnswerSimilarityMetric()]
result = evaluator.evaluate(data=input_df, metrics=metrics)

高度なメトリック評価

from ibm_watsonx_gov.evaluators.metrics_evaluator import MetricsEvaluator
from ibm_watsonx_gov.metrics import AnswerRelevanceMetric
from ibm_watsonx_gov.config import GenAIConfiguration
from ibm_watsonx_gov.clients.api_client import APIClient
from ibm_watsonx_gov.credentials import Credentials

config = GenAIConfiguration(input_fields=["question"],
                    context_fields=["context"],
                    output_fields=["generated_text"],
                    reference_fields=["reference_answer"])
wxgov_client = APIClient(credentials=Credentials(api_key=""))
evaluator = MetricsEvaluator(configuration=config, api_client=wxgov_client)
metrics = [AnswerSimilarityMetric()]

result = evaluator.evaluate(data=input_df, metrics=metrics)

詳細は、「評価メトリクスノートブック」 を参照してください。