记录吞吐量评估指标
记录吞吐量指标用于衡量您的模型部署每秒处理的记录数量。
度量详细信息
记录吞吐量是模型运行状况监控评估的吞吐量和延迟指标,通过跟踪每秒处理的评分请求和事务记录的数量来计算吞吐量。
作用域
记录吞吐量指标用于评估生成式人工智能资产和机器学习模型。
- 生成人工智能任务 :
- 文本摘要
- 文本分类
- 内容生成
- 实体抽取
- 问题回答
- 检索增强生成(RAG)
- 机器学习问题类型 :
- 二元分类
- 多重类分类
- 回归
- 支持的语言 :英语
评估过程
在模型运行状况监控评估期间,会计算评分请求和交易记录的平均、最大、中值和最小记录吞吐量。
为了计算记录吞吐量指标,您的评分请求中的 response_time 值用于跟踪您的模型部署处理评分请求所需的时间。
对于 Watson Machine Learning 部署,在配置评估时会自动检测 response_time 值。
对于外部部署和自定义部署,在发送评分请求以计算吞吐量和延迟时,必须指定 response_time 值,如下例中 Python SDK 所示:
from ibm_watson_openscale.supporting_classes.payload_record import PayloadRecord
client.data_sets.store_records(
data_set_id=payload_data_set_id,
request_body=[
PayloadRecord(
scoring_id=<uuid>,
request=openscale_input,
response=openscale_output,
response_time=<response_time>,
user_id=<user_id>)
]
)