Evaluar métricas
El módulo de evaluación de métricas puede ayudarle a calcular las métricas LLM.
Evaluar métricas es un módulo en el ibm-watsonx-gov SDK Python que contiene métodos para calcular puntuaciones para las métricas de relevancia del contexto, fidelidad y similitud de respuestas. Puede utilizar los conocimientos de los modelos para visualizar los resultados de la evaluación.
Para utilizar el módulo de evaluación de métricas debe instalar el SDK ibm-watsonx-gov Python con una configuración específica:
pip install "ibm-watsonx-gov[metrics]"
Ejemplos
Puede utilizar el módulo de evaluación de métricas para calcular métricas como se muestra en los siguientes ejemplos:
Evaluación simplificada de las métricas
from ibm_watsonx_gov.evaluators.metrics_evaluator import MetricsEvaluator
from ibm_watsonx_gov.metrics import AnswerRelevanceMetric
os.environ["WATSONX_APIKEY"] = "..."
evaluator = MetricsEvaluator()
metrics = [AnswerSimilarityMetric()]
result = evaluator.evaluate(data=input_df, metrics=metrics)
Evaluación avanzada de métricas
from ibm_watsonx_gov.evaluators.metrics_evaluator import MetricsEvaluator
from ibm_watsonx_gov.metrics import AnswerRelevanceMetric
from ibm_watsonx_gov.config import GenAIConfiguration
from ibm_watsonx_gov.clients.api_client import APIClient
from ibm_watsonx_gov.credentials import Credentials
config = GenAIConfiguration(input_fields=["question"],
context_fields=["context"],
output_fields=["generated_text"],
reference_fields=["reference_answer"])
wxgov_client = APIClient(credentials=Credentials(api_key=""))
evaluator = MetricsEvaluator(configuration=config, api_client=wxgov_client)
metrics = [AnswerSimilarityMetric()]
result = evaluator.evaluate(data=input_df, metrics=metrics)
Para obtener más información, consulte el cuaderno de métricas Evaluate.