API 吞吐量评估指标

API 吞吐量指标衡量的是您的模型部署每秒处理的评分请求数量。

度量详细信息

API 吞吐量是用于模型健康状况监控评估的吞吐量和延迟指标,它通过追踪每秒处理的评分请求和事务记录的数量来计算吞吐量。

作用域

API吞吐量指标用于评估生成式人工智能资产和机器学习模型。

  • 生成式人工智能任务
    • 文本摘要
    • 文本分类
    • 内容生成
    • 实体抽取
    • 问题回答
    • 检索增强生成(RAG)
  • 机器学习问题类型
    • 二元分类
    • 多重类分类
    • 回归
  • 支持的语言 :英语

评估流程

在模型健康状况监控评估过程中,会计算评分请求和事务记录的平均、最大、中位数和最小 API 吞吐量。

要计算 API 吞吐量指标,会使用评分 response_time 请求的处理时间来追踪模型部署处理评分请求所需的时间。

对于 Watson Machine Learning 的部署,在配置评估时,该值 response_time 会自动检测到。

对于外部和自定义部署,在发送评分请求时,您必须指定该值 response_time ,以便计算吞吐量和延迟,如下面的 Python SDK 示例所示:

    from ibm_watson_openscale.supporting_classes.payload_record import PayloadRecord            
        client.data_sets.store_records(
        data_set_id=payload_data_set_id, 
        request_body=[
        PayloadRecord(
            scoring_id=<uuid>,
            request=openscale_input,
            response=openscale_output,
            response_time=<response_time>,  
            user_id=<user_id>)
                    ]
        )