Evaluar métricas

El módulo de evaluación de métricas puede ayudarle a calcular las métricas LLM.

Evaluar métricas es un módulo en el ibm-watsonx-gov SDK Python que contiene métodos para calcular puntuaciones para las métricas de relevancia del contexto, fidelidad y similitud de respuestas. Puede utilizar los conocimientos de los modelos para visualizar los resultados de la evaluación.

Para utilizar el módulo de evaluación de métricas debe instalar el SDK ibm-watsonx-gov Python con una configuración específica:

pip install "ibm-watsonx-gov[metrics]"

Ejemplos

Puede utilizar el módulo de evaluación de métricas para calcular métricas como se muestra en los siguientes ejemplos:

Evaluación simplificada de las métricas

from ibm_watsonx_gov.evaluators.metrics_evaluator import MetricsEvaluator
from ibm_watsonx_gov.metrics import AnswerRelevanceMetric
os.environ["WATSONX_APIKEY"] = "..."

evaluator = MetricsEvaluator()
metrics = [AnswerSimilarityMetric()]
result = evaluator.evaluate(data=input_df, metrics=metrics)

Evaluación avanzada de métricas

from ibm_watsonx_gov.evaluators.metrics_evaluator import MetricsEvaluator
from ibm_watsonx_gov.metrics import AnswerRelevanceMetric
from ibm_watsonx_gov.config import GenAIConfiguration
from ibm_watsonx_gov.clients.api_client import APIClient
from ibm_watsonx_gov.credentials import Credentials

config = GenAIConfiguration(input_fields=["question"],
                    context_fields=["context"],
                    output_fields=["generated_text"],
                    reference_fields=["reference_answer"])
wxgov_client = APIClient(credentials=Credentials(api_key=""))
evaluator = MetricsEvaluator(configuration=config, api_client=wxgov_client)
metrics = [AnswerSimilarityMetric()]

result = evaluator.evaluate(data=input_df, metrics=metrics)

Para obtener más información, consulte el cuaderno de métricas Evaluate.