配置生成式人工智能质量评估
您可以利用生成式人工智能质量评估工具,来衡量您的基础模型执行任务的表现。
当您 评估提示模板时,可以查看以下任务类型的生成 AI 质量评估结果摘要:
- 文本摘要
- 内容生成
- 实体抽取
- 问题回答
- 检索扩充生成 (RAG)
摘要显示使用缺省设置计算的度量的分数和违例。
要使用您自己的设置配置生成 AI 质量评估,您可以设置最小样本大小,并为每个度量设置阈值,如以下示例中所示:

最小样本大小指示要评估的模型事务记录的最小数量,当度量值得分违反阈值时,阈值值会创建警报。 度量标准得分必须高于较低的阈值才能避免违例。 度量值越高表示得分越好。
您还可以配置设置,使用“LLM-as-a-judge”模型来计算指标。 LLM 即评判模型是您可以用来评估其他模型性能的 LLM 模型。
若要使用“大语言模型作为评判者”模型计算指标,在配置评估设置时,您必须选择 “管理 ”以添加一个 generative_ai_evaluator 系统。

您可以选择一个评估器来计算答案质量和检索质量指标。

在 watsonx.governance 中设置提示模板并查看RAG任务的评估结果时,您还可以使用笔记本来创建评估器。