Métrica de avaliação da latência da API
A métrica de latência da API mede o tempo necessário (em ms) para processar uma solicitação de pontuação por sua implementação de modelo.
Detalhes da métrica
A latência da API é uma métrica de taxa de transferência e latência para avaliações do monitor de integridade do modelo que calcula a latência rastreando o tempo que leva para processar solicitações de pontuação por milissegundo (ms).
Escopo
A métrica de latência da API avalia ativos de IA generativa e modelos de aprendizado de máquina.
- Tarefas de IA generativa :
- Resumo de textos
- Classificação de texto
- Geração de conteúdo
- Extração de entidade
- Resposta à pergunta
- Geração Aumentada de Recuperação (RAG)
- Tipo de problema de aprendizado de máquina :
- Classificação binária
- Classificação de multiclasse
- Regressão
- Idiomas suportados : Inglês
Processo de avaliação
A latência média, máxima, mediana e mínima da API para solicitações de pontuação e registros de transação são calculadas durante as avaliações do monitor de integridade do modelo.
Para calcular o índice de latência da API, o valor response_time de suas solicitações de avaliação é usado para rastrear o tempo que a implantação do modelo leva para processar as solicitações de avaliação.
Nas implantações do watsonx.ai Runtime, o valor response_time é detectado automaticamente quando você configura as avaliações.
Para implementações externas e personalizadas, você deve especificar o valor response_time ao enviar solicitações de pontuação para calcular a taxa de transferência e a latência, conforme mostrado no exemplo a seguir do SDK Python :
from ibm_watson_openscale.supporting_classes.payload_record import PayloadRecord
client.data_sets.store_records(
data_set_id=payload_data_set_id,
request_body=[
PayloadRecord(
scoring_id=<uuid>,
request=openscale_input,
response=openscale_output,
response_time=<response_time>,
user_id=<user_id>)
]
)