快速入门: 评估空间中的部署

您可以评估部署空间中的模型部署,以获取有关模型性能的洞察。 配置评估时,可以直接在空间中分析评估结果和对事务记录建模。

所需的服务
watsonx.governance
watsonx.ai
具有关联数据库的 Watson OpenScale

基本工作流程包括以下任务:

  1. 打开项目。 您可以在项目中与他人协作以处理数据。
  2. 构建并保存机器学习模型。 有各种用于构建模型的工具,例如, AutoAI 试验, Jupyter Notebook , SPSS Modeler 流或 Pipeline。 请参阅 分析数据并使用模型
  3. 在部署空间中部署和测试模型。
  4. 在部署空间中配置评估。
  5. 评估模型性能。

了解如何评估空间中的部署

watsonx.governance 评估模型部署,以帮助您测量性能并了解模型预测。 配置模型评估时, watsonx.governance 会为每个评估生成度量值,以提供您可以查看的不同洞察。 watsonx.governance 还会记录评估期间处理的事务,以帮助您了解如何确定模型预测。

了解有关在部署空间中评估部署的更多信息

了解在 Watson OpenScale中评估模型的其他方法

观看一段关于如何在部署空间中评估部署的视频

观看视频 观看此视频以预览本教程中的步骤。 视频中显示的用户界面可能存在细微差异。 该视频旨在与编写的教程相伴。 视频从 watsonx 主页屏幕开始。 用户导航到资源中心 ,选择项目 ,然后创建一个示例项目。

此视频提供了一种可视方法来学习本文档中的概念和任务。


尝试一个教程,以评估部署空间中的部署

在本教程中,您将完成以下任务:





完成本教程的提示
以下是成功完成本教程的一些提示。

设置浏览器窗口

为获得最佳学习体验,请在浏览器的一个窗口中打开您的账户,并将本教程页面保持在另一个窗口中,以便在两个窗口之间轻松切换。 请考虑将两个浏览器窗口并排排列,以便更轻松地进行后续操作。

并排教程和 UI

提示: 如果在用户界面中完成本教程时迂到引导式教程,请单击 稍后可能



任务 1: 基于样本创建项目

您需要一个项目来存储用于构建模型的资产。 例如,训练数据, AutoAI 体验或 Jupyter Notebook 以及保存的模型。 执行以下步骤以根据样本创建项目:

  1. 下载evaluate-an-ml-model.zip文件。

  2. 导航菜单中选择 导航菜单“项目”>“所有项目 ”。

  3. 在 " 项目 " 页面上,单击 新建项目

  4. 选择 本地文件

  5. 上载先前下载的 ZIP 文件。

  6. 在 " 创建项目 " 页面上,复制并粘贴项目名称,并添加项目的可选描述。

    Evaluate an ML model
    
  7. 单击创建

  8. 单击 查看新项目 以验证是否已成功创建项目和资产。

  9. 单击 资产 选项卡以查看项目的资产。

  10. 查看 抵押贷款核准预测模型。 此模型根据多个因素 (例如,其信用历史记录,债务总额,收入,贷款金额和就业历史记录) 来预测是否应该批准抵押贷款申请人。

  11. 返回到项目的 资产 选项卡。

检查点图标 检查你的进度

下图显示了样本项目。 现在,您已准备好开始本教程。

样本项目




任务 2: 部署模型

在可以部署模型之前,需要将模型提升到新的部署空间。 部署空间可帮助您组织支持资源,例如输入数据和环境; 部署模型或函数以生成预测或解决方案; 以及查看或编辑部署详细信息。 下一个任务是将评估数据和模型提升到部署空间,然后创建联机部署。

任务 2a: 下载评估数据

要验证模型是否按需要工作,您需要一组从模型训练中保留的带标签数据。 示例项目包含评估数据(GoldenBank_HoldoutData.csv),您可以上传这些数据,以便稍后在部署空间中执行评估。 执行以下步骤以下载数据集:

  1. 点击.csv GoldenBank_HoldoutData 数据资产的 溢出菜单 溢出菜单,选择下载

  2. 将数据资产保存到电脑中。

任务 2b: 将模型提升到部署空间

在可以部署模型之前,需要将模型提升到部署空间。 遵循以下步骤将模型提升到部署空间:

  1. “资产 ”选项卡中,单击 “抵押贷款审批模型 ”模型的 溢出菜单 溢出菜单,然后选择 “提升到空间 ”。

  2. 选择现有部署空间。 如果您没有部署空间:

    1. 单击 创建新的部署空间

    2. 对于名称,请键入Golden Bank Preproduction Space

    3. 针对 部署阶段选择 开发

    4. 单击创建

    5. 当部署空间准备就绪时,关闭该通知。

  3. 选中 “在部署后转到部署空间中的模型 ”选项。

  4. 单击 提升

注意: 如果您在发布后未选择“转到部署空间中的模型”选项,可以使用导航菜单转到 “部署”页面 ,然后选择您的部署空间和模型。

检查点图标 检查你的进度

下图显示了部署空间中的模型。

下图显示了部署空间中的模型。

任务 2c: 创建模型部署

既然模型位于部署空间中,请执行以下步骤来创建模型部署:

  1. 打开模型后,单击 新建部署

    1. 选择 联机 作为 部署类型

    2. 对于部署名称,请键入Mortgage Approval Model Deployment

    3. 单击创建

  2. 部署完成后,单击部署名称以查看部署详细信息页面。

  3. 查看评分端点,您可以使用该端点在应用程序中以编程方式访问此模型。

检查点图标 检查你的进度

下图显示了部署空间中的模型部署。

下图显示了部署空间中的模型部署。




任务 3: 在部署空间中配置评估

遵循以下步骤在此部署空间中配置评估:

任务 3a: 配置模型详细信息

第一个。 请遵循以下步骤来配置模型详细信息。

  1. 在部署中,单击 评估 选项卡。
  2. 单击 配置 OpenScale 评估设置
  3. 您需要将 Watson OpenScale 服务实例与部署空间相关联。 如果出现提示,请单击 关联服务实例,选择实例,然后单击 关联。 如果未使用数据库设置 Watson OpenScale 实例,那么系统将提示您在 Watson OpenScale 中配置数据库设置,然后才能继续。

指定模型输入

训练数据包含适用于二元分类模型的数字和分类数据。

  1. 对于 数据类型,选择 数字/分类
  2. 对于 算法类型,选择 二元分类
  3. 单击 查看摘要
  4. 查看摘要,然后点击 “保存并继续 ”。

连接到训练数据

训练数据存储在 Db2 Warehouse on Cloud 实例中。

  1. 对于 配置方法,请选择 使用手动设置
  2. 单击 下一步
  3. 对于 培训数据选项,选择 数据库或云存储
  4. 选择 Db2 作为位置。
  5. 提供连接信息:
    • 主机名或 IP 地址: db2w-ruggyab.us-south.db2w.cloud.ibm.com
    • SSL 端口: 50001
    • 数据库: BLUDB
    • 用户名: CPDEMO
    • 密码: DataFabric@2022IBM
  6. 单击连接
  7. 针对模式选择 AI_MBS
  8. 针对表选择 抵押权审批表
  9. 单击 下一步

选择特征和标签列

抵押权人核准 列指示申请人是否已核准,并且功能部件列包含有助于核准决策的信息。

  1. 查看以下功能栏:

    • GENDER
    • 教育经历
    • 就业状态
    • 婚姻状况
    • income
    • 在线应用
    • 住所
    • 当前地址 (YRS_AT_CURRENT_ADDRESS)
    • YRS_WITH_CURRENT_雇主
    • 卡数
    • 信用卡债务
    • 贷款
    • 贷款额
    • 信用评分
    • 商业客户机
    • 平均价格
    • 欺诈调查
    • 属性值
  2. 搜索 MORTGAGE_APPROVAL,然后选择 Label/Target 复选框。

  3. 单击 下一步

指定模型输出详细信息

从模型输出数据中,您需要选择由已部署的模型生成的预测列,以及包含模型对预测的置信度的概率列。

  1. 选择 预测概率 列的相应复选框。
  2. 单击 查看摘要
  3. 单击 完成

检查点图标 检查你的进度

下图显示了已完成的模型详细信息。 现在,您已准备好配置可解释性。

下图显示了已完成的模型详细信息。

任务 3b: 配置可解释性

接下来,请执行以下步骤来配置可解释性。

选择说明方法

"Shapley 加法解释" (SHAP) 使用所有可能的输入组合来发现每个输入如何将预测移动到平均值预测值或置信度分数或使其远离平均值预测值或置信度分数。 局部可解释模型-不可知的解释 (LIME) 构建稀疏线性模型以发现每个特征的重要性。 SHAP 更彻底, LIME 更快。

  1. 点击 “可解释性 ”。
  2. “参数 ”旁边,点击编辑图标 编辑
  3. 启用全球解释选项。
  4. 对于全局解释方法 ,请选择 LIME(增强 )。
  5. 对于 局部解释方法,选择 LIME (增强型)
  6. 单击 下一步

配置全局解释能力

SHAP 量化每个特征对模型结果产生的影响。 SHAP 生成适合全局解释的摘要图,但也可以生成单个预测解释。

  1. 检查以下部分的设置,并接受默认值:
    • 全局解释设置
    • LIME 设置
  2. 单击 下一步

选择可控特征

您可以在运行分析时指定想要可控的特征,以显示在确定模型结果时最重要的特征。

  1. 查看可控功能列表。
  2. 单击 保存

检查点图标 检查你的进度

下图显示了已完成的可解释性配置。 现在,您已准备好配置公平性。

下图显示了已完成的可解释性配置。

任务 3c: 配置公平性

接下来,遵循以下步骤来配置公平性。

选择配置类型

您可以手动配置公平性,也可以上载使用提供的 Jupyter Notebook 生成的配置文件。

  1. 单击 公平性
  2. “配置 ”旁边,点击编辑图标 编辑
  3. 针对 配置类型选择 手动配置
  4. 单击 下一步

选择有利结果

对于此模型部署,有利的结果是申请人被批准抵押贷款时,不利的结果是申请人未被批准时。

  1. 在表中,针对 1 值选择 有利 ,这表示已批准申请人进行抵押贷款。
  2. 在表中,选择 不利 作为 0 值,这表示未批准申请人进行抵押贷款。
  3. 单击 下一步

样本数量:

根据将用于评估模型的数据集来调整样本大小。

  1. 最小样本大小 更改为 100
  2. 单击 下一步

度量值

"公平性" 监视器跟踪多个公平性度量。 不同的影响是受监测组的有利结果百分比与参考组的有利结果百分比之比。

  1. 查看从所有数据生成的要应用于受监视功能部件的受监视度量,然后查看从反馈数据生成的要应用于受监视功能部件的度量。
  2. 接受缺省度量,然后单击 下一步
  3. 接受阈值下限和上限的缺省值,然后单击 下一步

选择要监视的字段

您希望监视已部署模型的趋势,以便为一个组提供一个组而不是另一个组的有利结果。 在这种情况下,您希望监控模型是否存在性别偏见。

  1. 选择 GENDER 字段。
  2. 单击 下一步
  3. 如果值列示在表中:
    1. 检查女性: 受监视
    2. 检查男性: 参考。
  4. 如果这些值未在表中列出:
    1. 添加定制值 字段中,输入 Female
    2. 单击 添加值
    3. 在表中的 男性 旁边选择 受监视
    4. 添加定制值 字段中,输入 Female
    5. 单击 添加值
    6. 选择表中 男性 旁边的 参考
  5. 单击 下一步
  6. 接受受监视组的缺省阈值,然后单击 保存

检查点图标 检查你的进度

下图显示了已完成的公平性配置。 现在,您已准备好配置质量。

下图显示了已完成的公平性配置。

任务 3d: 配置质量

接下来,遵循以下步骤来配置质量。 质量监视器将评估模型预测结果的准确程度。

  1. 单击 质量
  2. 质量阈值旁边,点击编辑图标 编辑
  3. ROC 下的面积 的值更改为 0.7
  4. 单击 下一步
  5. 最小样本大小 更改为 100
  6. 单击 保存

检查点图标 检查你的进度

下图显示了已完成的质量配置。 现在,您已准备好配置漂移。

下图显示了已完成的质量配置。

任务 3e: 配置漂移

最后,遵循以下步骤来配置漂移。 "漂移" 监视器会检查您的部署是否最新且行为一致。

  1. 单击 漂移 v2
  2. 计算漂移档案旁边,点击编辑图标 编辑
  3. 对于 计算选项,选择 在 Watson OpenScale中计算。 此选项指示 Watson OpenScale 执行训练数据分析,以确定功能部件的数据分布。
  4. 单击 下一步
  5. 接受阈值上限的缺省值,然后单击 下一步
  6. 对于重要功能 ,选择所有列,然后点击下一步
  7. 对于最重要的功能 ,请选择以下列,然后点击下一步
    • 信用卡债务
    • income
    • 贷款
    • 贷款额
    • 属性值
  8. 接受样本大小的缺省值,然后单击 保存
  9. 单击 X 以关闭窗口并等待 Watson OpenScale 访存监视器。

检查点图标 检查你的进度

下图显示了部署空间中已完成的配置。 现在,您已准备好监视模型部署。

下图显示了部署空间中已完成的配置。




任务 4: 评估模型

执行以下步骤以使用保留数据来评估模型:

  1. 操作 菜单中,选择 立即评估

  2. 在导入选项列表中,选择 “从 CSV 文件导入”。

  3. 将从项目中下载的 Golden Bank_HoldoutData.csv 数据文件拖入侧面板。

  4. 单击 上载并评估 ,然后等待评估完成。

  5. 评估完成后,您将看到运行的测试数,通过的测试数和失败的测试数。 滚动以查看 公平性质量漂移全局说明的结果。

检查点图标 检查你的进度

下图显示了已部署模型的评估结果。 现在,您已评估模型,准备好观察模型质量。

评估模型




任务 5: 观察模型监视器的质量

Watson OpenScale 质量监视器会生成一组度量值,以评估模型的质量。 您可以使用这些质量指标来确定模型预测结果的效果。 当使用保留数据的评估完成时,请遵循以下步骤来观察模型质量或准确性:

  1. “质量 ”部分,点击 “配置 ”图标 配置。 在这里,您可以看到为此监视器配置的质量阈值为 70% ,并且所使用的质量测量是 ROC 曲线下的面积。

  2. 单击 X 以关闭窗口并返回到模型eval到了屏幕。

  3. “质量 ”部分,点击 “详细信息 ”图标 详细信息 以查看模型质量的详细结果。 在这里,您可以看到一些质量度量计算和一个混淆矩阵,其中显示了正确的模型决策以及误报和误报。 ROC 曲线下的计算面积为 0.9 或更高,这超过了 0.7 阈值,因此模型满足其质量要求。

  4. 单击 返回到摘要 以返回到模型详细信息屏幕。

检查点图标 检查你的进度

下图显示了 Watson OpenScale中的质量详细信息。 现在,您已观察到模型质量,可以观察到模型公平性。

质量




任务 6: 观察模型监视器以获取公平性

Watson OpenScale 公平性监视器生成一组度量以评估模型的公平性。 您可以使用公平性指标来确定模型是否产生有偏差的结果。 遵循以下步骤来观察模型公平性:

  1. “公平性 ”部分,点击配置图标 配置。 在这里,您可以看到正在对该模型进行复审,以确保对申请人进行公平对待,而无论其性别如何。 妇女被确定为受监测群体,正在对其进行公平性衡量,公平性的门槛至少为 80%。 公平性监视器使用不同的影响方法来确定公平性。 不同影响将受监视组的有利结果百分比与参考组的有利结果百分比进行比较。

  2. 单击 X 以关闭窗口并返回到模型eval到了屏幕。

  3. 公平性部分,点击详细信息图标 详细信息 以查看模型公平性的详细结果。 在这里,您可以看到正在自动批准的男性和女性申请人的百分比,以及 100% 以上的公平性分数,因此模型性能远远超过所需的 80% 公平性阈值。

  4. 请注意标识的数据集。 为了确保公平性指标最准确, Watson OpenScale 使用扰动来确定仅更改受保护属性和相关模型输入而其他功能保持不变的结果。 扰动将特征的值从参考组更改为受监视组,反之亦然。 当使用 "均衡" 数据集时,这些附加护栏用于计算公平性,但您也可以仅使用有效内容或模型训练数据来查看公平性结果。 由于模型的行为是公平的,因此您无需为此度量输入其他详细信息。

    公平性数据集

  5. 单击 返回到摘要 以返回到模型详细信息屏幕。

检查点图标 检查你的进度

下图显示了 Watson OpenScale中的公平性详细信息。 现在,您已观察到模型公平性,可以观察到模型可解释性。

公平性




任务 7: 观察模型监视器以进行漂移

Watson OpenScale 漂移监视器会测量一段时间内数据中的更改,以确保模型的结果一致。 使用漂移评估可识别模型输出中的更改,预测的准确性以及输入数据的分布。 遵循以下步骤来观察模型漂移:

  1. 漂移部分,点击配置图标 配置。 在这里,您可以看到漂移阈值。 输出漂移测量模型置信度分布中的变化。 模型质量漂移通过将估算的运行时准确性与训练准确性进行比较来度量准确性下降。 特征漂移用于测量重要特征的值分布变化。 该配置还会显示所选功能部件的数量以及最重要的功能部件。

  2. 单击 X 以关闭窗口并返回到模型eval到了屏幕。

  3. 漂移部分,点击详细信息图标 详细信息 以查看模型漂移的详细结果。 您可以使用时间序列图表来查看每个度量标准得分随时间变化的历史记录。 值越低越好,因此在这种情况下,结果会高于配置中设置的阈值上限。 然后查看有关如何计算分数输出和特征漂移的详细信息。 您还可以查看有关每个功能部件的详细信息,以了解这些功能部件如何对 Watson OpenScale 生成的评分作出贡献。

  4. 单击 返回到摘要 以返回到模型详细信息屏幕。

检查点图标 检查你的进度

下图显示了 Watson OpenScale中的漂移详细信息。 现在,您已观察到模型漂移,可以观察到模型可解释性。

漂移




任务 8: 观察模型监视器以了解可解释性

了解模型是如何做出决定的也很重要。 需要这种理解来向参与贷款审批的人员解释决策,并确保模型所有者的决策有效。 要了解这些决策,请执行以下步骤来观察模型可解释性:

  1. 单击 事务 选项卡。

  2. 在图形上,选择一个时间范围以查看该时间段内的事务列表。

  3. 对于任何事务,单击 操作 列下的 说明 。 在这里,您将看到此决策的详细说明。 您将看到模型的最重要输入以及每个输入对最终结果的重要性。 蓝色条形表示倾向于支持模型决策的输入,而红色条形显示可能导致另一个决策的输入。 例如,申请人可能有足够的收入可以通过其他方式获得批准,但他们的不良信用历史记录和高额债务共同导致模型拒绝申请。 查看此说明以了解模型决策的基础。

  4. 可选: 如果要进一步深入了解模型如何做出其决策,请单击 检查 选项卡。 使用 检查 功能来分析决策以查找敏感度区域,在这些区域中,对几个输入的少量更改将导致不同的决策,并且您可以通过使用替代方法覆盖某些实际输入来自行测试敏感度,以查看这些更改是否会影响结果。 单击 运行分析 以让 Watson OpenScale 显示交付不同结果所需的最小更改。 选择 仅分析可控特征 以将更改仅限于可控特征。

检查点图标 检查你的进度

下图显示了 Watson OpenScale中事务的可解释性。 您已确定该模型是准确的,并且公平对待所有申请人。 现在,您可以将模型推进到其生命周期中的下一个阶段。

可解释性



后续步骤

请尝试以下其他教程:

其他资源