Métrica de avaliação do rendimento da API

A métrica de taxa de transferência de API mede o número de solicitações de pontuação processadas por sua implantação de modelo por segundo.

Detalhes da métrica

A taxa de transferência da API é uma métrica de taxa de transferência e latência para avaliações do monitor de integridade do modelo que calcula a taxa de transferência rastreando o número de solicitações de pontuação e registros de transação processados por segundo.

Escopo

A métrica de rendimento da API avalia os ativos de IA generativa e os modelos de aprendizado de máquina.

  • Tarefas de IA generativa :
    • Resumo de textos
    • Classificação de texto
    • Geração de conteúdo
    • Extração de entidade
    • Resposta à pergunta
    • Geração Aumentada de Recuperação (RAG)
  • Tipo de problema de aprendizado de máquina :
    • Classificação binária
    • Classificação de multiclasse
    • Regressão
  • Idiomas suportados : Inglês

Processo de avaliação

A taxa de transferência média, máxima, mediana e mínima da API para solicitações de pontuação e registros de transações são calculadas durante as avaliações do monitor de integridade do modelo.

Para calcular a métrica de taxa de transferência da API, o valor response_time de suas solicitações de avaliação é usado para rastrear o tempo que a implantação do modelo leva para processar as solicitações de avaliação.

Nas implantações do watsonx.ai Runtime, o valor response_time é detectado automaticamente quando você configura as avaliações.

Para implementações externas e personalizadas, você deve especificar o valor response_time ao enviar solicitações de pontuação para calcular a taxa de transferência e a latência, conforme mostrado no exemplo a seguir do SDK Python :

    from ibm_watson_openscale.supporting_classes.payload_record import PayloadRecord            
        client.data_sets.store_records(
        data_set_id=payload_data_set_id, 
        request_body=[
        PayloadRecord(
            scoring_id=<uuid>,
            request=openscale_input,
            response=openscale_output,
            response_time=<response_time>,  
            user_id=<user_id>)
                    ]
        )