预测零售促销活动

本教程构建两个模型来预测未来促销活动的效果,然后对这两个模型进行比较。

状态监测教程类似,数据挖掘过程包含探索、数据准备、训练和测试四个阶段。 数据文件 telco.csv 中的数据并非全部都适用于预测客户流失。 您可以使用筛选器仅选择被视为重要且可作为预测变量的数据(即模型中标记为" 重要" 的字段)。

预览教程

观看视频 观看此视频,预览本教程中的步骤。 视频中展示的用户界面可能存在细微差异。 该视频旨在作为书面教程的补充材料。 本视频提供了一种可视化学习方法,用于掌握本文档中的概念和任务。

尝试教程

在本教程中,您将完成以下任务:

示例建模流程与数据集

本教程使用示例项目中的零售促销流程。 使用的数据文件是 goods2n.csv. 下图展示了示例建模器的流程。

图 1。 示例建模器流程
示例建模器流程

下图展示了样本数据集。
图 2。 样本数据集
样本数据集

任务1:打开示例项目

示例项目包含多个数据集和示例建模器流程。 若您尚未拥有示例项目,请参阅教程主题以创建示例项目。 然后按照以下步骤打开示例项目:

  1. 导航菜单 中,选择 watsonx项目 导航菜单 > 所有项目。
  2. 点击 SPSS Modeler 项目
  3. 点击 “资产 ”选项卡查看数据集和建模器流程。

检查点图标 检查你的进度

下图展示了项目的“资源”选项卡。 您现在已准备好使用与本教程相关的示例建模器流程。

替代文本

返回顶部

任务2:检查数据资产、推导和类型节点

零售促销包含多个节点。 请按照以下步骤检查数据资产衍生类型节点:

“数据资产”节点

  1. “资产 ”选项卡中,打开零售促销建模器流程,并等待画布加载完成。
  2. 双击节点 goods1n.csv。 此节点是一个数据资产节点,指向项目中的文件 goods1n.csv
  3. 检查文件格式属性
  4. 点击 “预览数据 ”查看完整数据集。
  5. 请注意,每条记录包含:
    • Class产品类型。
    • Cost单价。
    • Promotion特定促销活动的支出指数。
    • Before促销前的收入。
    • After促销后的收入。

    两个收入领域(BeforeAfter)以绝对值表示。 然而,促销活动后(且很可能是促销活动带来的)收入增长,似乎可能是一个更有价值的数据。

  6. 关闭数据预览和属性侧边栏。

“派生”节点

  1. 双击 “增加(推导) ”节点。 该节点推导出收入增长的数值。
  2. 请检查设置,特别是 “表达式 ”字段;该字段包含一个公式,用于计算促销前收入的百分比增幅: (After - Before) / Before * 100.0
  3. 点击 “预览数据 ”可查看包含衍生值的数据集。
  4. 注意“增长 ”列。

    对于每个类别的产品,收入增长与促销成本之间几乎存在线性关系。 因此,决策树或神经网络似乎可以合理和准确地预测其他可用字段上的收入增长量。

  5. 关闭数据预览和属性侧边栏。

“类型”节点

  1. 双击 “定义类型(类型) ”节点。 该节点指定字段属性,例如测量级别(字段包含的数据类型),以及每个字段在建模中作为目标或输入的角色。 测量级别是用于指示字段中数据的类型的类别。 源数据文件使用了三种不同的测量级别:
    • 连续字段(例如 字段 Age )包含连续的数值。
    • 名义字段(如 字段 Education )具有两个或多个不同的值——在此情况下为 CollegeHigh school
    • 数字段(例如 Income level 字段)描述具有多个不同值且具有内在顺序的数据——在此情况下为 MediumLow、和 High

      对于每个字段, 类型节点还会指定一个角色,以表明该字段在建模过程中所扮演的角色。 该字段的引用对象设置为目标字段 Increase,该字段是通过派生获得的。 该字 target 段是您想要预测其值的字段。

      对于其他大多数字段 ,角色被设置为输入。 输入字段有时也被称为 predictors输入变量,其值会被建模算法用于预测目标字段的值。

      该字 After 段的作用被设置为 “ ”,因此建模算法不会使用此字段。

  2. 可选:点击 “预览数据 ”可查看包含衍生值的数据集。

检查点图标 检查你的进度

下图展示了类型节点。 您现在可以生成并比较这些模型了。

“类型”节点

返回顶部

任务3:生成并比较模型

该流程训练了神经网络和决策树,以作出此收入增长预测。 请按照以下步骤生成两个模型:

生成模型

  1. 双击 “增加(神经网络) ”节点以查看其属性。
    1. 展开 “基础 ”部分即可看到, 多层感知器是模型类型。 该属性决定了网络如何通过隐藏层将预测器与目标连接起来。 多层感知器能够处理更复杂的关系,但可能需要付出增加训练和评分时间的代价。
    2. 展开 “模型选项 ”部分以查看评估和评分属性。
  2. 双击 “增加(C&R树) ”节点以查看其属性。
  3. 点击 “运行全部 运行图标”,等待模型核心生成。
比较模型
  1. 增量(C&R树) 模型核心连接至增量(神经网络)
  2. 添加一个分析节点:
    1. 从调色板中展开 “输出 ”部分。
    2. 将分析节点拖放到画布上。
    3. 增量(神经网络) 模型模块连接至分析节点。
  3. 更改数据集以使用不同的数据进行分析:
    1. 双击节点 goods1n.csv 以查看其属性。
    2. CV lick 更改数据集
    3. 导航至数据资产 > GOODS2n.csv
    4. 点击选择
    5. 点击保存
  4. 将鼠标悬停在分析节点上,然后单击运行图标 运行图标
  5. “输出和模型 ”窗格中,单击名为 “分析 ”的输出以查看结果。

    分析结果中,特别是从预测增长与正确答案之间的线性相关性来看,训练后的系统能够以极高的成功率预测收入增长。

    进一步的探索可能重点关注经过训练的系统产生相对较大错误的情况。 您可以通过将预测的收入增长与实际增长进行对比来识别这些错误。 您可通过交互式图形在图表中筛选异常值 SPSS Modeler ,并根据其属性调整数据描述或学习过程,从而提升预测精度。

检查点图标 检查你的进度

下图显示了分析节点的输出结果。

分析节点结果

返回顶部

目录

这个例子向您展示了如何预测未来促销活动的效果。 与状态监测示例类似,数据挖掘过程包含探索、数据准备、训练和测试四个阶段。

后续步骤

现在您可以尝试其他 SPSS® Modeler 教程了。