Métrica de avaliação do rendimento da API
A métrica de taxa de transferência de API mede o número de solicitações de pontuação processadas por sua implantação de modelo por segundo.
Detalhes da métrica
A taxa de transferência da API é uma métrica de taxa de transferência e latência para avaliações do monitor de integridade do modelo que calcula a taxa de transferência rastreando o número de solicitações de pontuação e registros de transação processados por segundo.
Escopo
A métrica de rendimento da API avalia os ativos de IA generativa e os modelos de aprendizado de máquina.
- Tarefas de IA generativa :
- Resumo de textos
- Classificação de texto
- Geração de conteúdo
- Extração de entidade
- Resposta à pergunta
- Geração Aumentada de Recuperação (RAG)
- Tipo de problema de aprendizado de máquina :
- Classificação binária
- Classificação de multiclasse
- Regressão
- Idiomas suportados : Inglês
Processo de avaliação
A taxa de transferência média, máxima, mediana e mínima da API para solicitações de pontuação e registros de transações são calculadas durante as avaliações do monitor de integridade do modelo.
Para calcular a métrica de taxa de transferência da API, o valor response_time de suas solicitações de avaliação é usado para rastrear o tempo que a implantação do modelo leva para processar as solicitações de avaliação.
Nas implantações do watsonx.ai Runtime, o valor response_time é detectado automaticamente quando você configura as avaliações.
Para implementações externas e personalizadas, você deve especificar o valor response_time ao enviar solicitações de pontuação para calcular a taxa de transferência e a latência, conforme mostrado no exemplo a seguir do SDK Python :
from ibm_watson_openscale.supporting_classes.payload_record import PayloadRecord
client.data_sets.store_records(
data_set_id=payload_data_set_id,
request_body=[
PayloadRecord(
scoring_id=<uuid>,
request=openscale_input,
response=openscale_output,
response_time=<response_time>,
user_id=<user_id>)
]
)