什么是监督学习?

发布日期 2025年9月12日
安装在电线杆上的监控摄像头,俯瞰着一条弯道公路
By Ivan Belcic and Cole Stryker

什么是监督学习?

监督学习是一种使用标记数据训练机器学习模型的方法,可用于分类和回归任务。了解监督学习的工作原理、常见算法、应用场景,以及它与无监督学习的区别。

标记数据集由输入样本及其对应的目标输出或标签组成。**当训练数据输入机器学习算法后,算法会根据损失函数计算模型预测值与目标值之间的差异,并不断调整模型参数,以学习输入特征与数据标签之间的关系。

已标记的训练数据提供了“真实标签(Ground Truth)”,即用于训练和评估模型的参考答案或基准值。模型通过学习这些样本,在面对新的、未见过的数据时执行分类或数值预测。

监督学习可帮助组织规模化解决多种现实问题,例如垃圾邮件分类、图像识别、客户流失预测和需求预测。如果训练数据具有代表性、标签质量可靠且模型得到适当验证,监督学习可以构建具有良好预测性能的机器学习模型。

什么是真实标签数据?

真实标签数据是经过可靠来源确认,并用作模型训练、验证或测试参考的数据。这些标签可以通过人工标注、客观测量、系统记录或已经确认的现实结果获得。

例如,在图像分类中,真实标签可以是图像中对象的正确类别;在房价预测中,真实值可以是已完成交易的实际价格。真实标签代表模型应学习或预测的目标结果,但并不意味着所有标签都绝对无误。人工标注差异、测量误差和数据偏差仍可能影响标签质量。

监督学习利用标记数据学习输入与目标输出之间的关系。训练完成后,模型可以将所学模式应用于新的、未见过的数据,输出预测类别、概率或连续数值。

监督学习如何工作

监督学习技术使用标记的训练数据集来理解输入和输出数据之间的关系。数据科学家和领域专家可以通过人工标注、自动化标注、业务系统记录或客观测量创建训练数据集。

在训练期间,模型的算法会处理大型数据集以探究输入和输出之间的潜在相关性。训练完成后,模型需要使用验证数据评估和调整超参数,再使用独立的测试数据对最终泛化性能进行评估。

梯度下降系列算法,包括随机梯度下降 (SGD),是训练神经网络和其他机器学习模型时最常用的优化算法或学习算法。该模型的优化算法通过损失函数衡量预测结果与真实标签之间的差异:损失函数是一个衡量模型预测值与实际值之间差异的方程。

损失函数用于衡量预测值与实际值的偏差程度。其梯度指示了应调整模型参数以减少误差的方向。在整个训练过程中,优化算法会更新模型的参数,例如模型中的权重和偏置以优化模型。

由于大型数据集通常包含很多特征,因此数据科学家可以通过降维来简化这种复杂性。这种数据科学技术将特征数量减少到仅保留对预测数据标签最关键的特征,从而在提高效率的同时保持准确性。

监督学习的实例

以车辆图像分类为例,监督学习模型可以根据输入图像判断其中的车辆类型。类似的图像分类能力可以应用于计算机视觉系统,也可以支持要求用户识别汽车、摩托车或自行车等对象的 CAPTCHA 验证任务。

为了训练该模型,数据科学家需要准备一个标记训练数据集,其中包含大量车辆图像及其对应类别,例如汽车、摩托车、卡车和自行车。模型通过分析训练数据中的图像特征,学习输入图像与车辆类别之间的关系。

模型训练过程中,验证集用于评估模型表现并调整模型设置。如果验证结果未达到要求,团队可以继续调整模型或训练过程。模型开发完成后,再使用独立测试集评估模型对未见数据的预测性能。

泛化能力是指模型将在训练数据中学到的规律应用于新的、未见过的数据的能力。良好的泛化能力意味着模型不仅能记住训练样本,还能正确处理与训练数据具有相似特征和分布的新数据。

    AI 学院

    让 AI 服务于客户服务

    了解生成式 AI 如何提供更加无缝、令人满意的客户体验,并在以下三个关键领域提高组织的工作效率:自助服务、人工客服和联络中心运营。

    监督学习的类型

    监督学习任务主要可以分为:

    1. 分类任务
    2. 回归任务

    集成学习则是一种可用于分类或回归任务的模型组合方法,不宜与分类和回归并列为同层级的任务类型。

      分类

      机器学习中的分类使用算法将数据分类。它可识别数据集中的特定实体,并尝试确定这些实体应如何标记或定义。常见的分类算法包括线性分类器、支持向量机 (SVM)、、k 最近邻 (KNN)、逻辑回归以及随机森林。

      常见的分类算法包括:

      神经网络擅长处理复杂的分类问题。神经网络是一种深度学习架构,通过多层节点处理训练数据,模拟人类大脑的工作方式。每个节点由输入、权重、偏置(或阈值)和输出组成。深度神经网络包含多个隐藏层,是深度学习的主要模型架构之一。并非所有神经网络都属于深度学习,通常只有包含多个处理层的神经网络才被称为深度神经网络。

      回归

      回归用于理解因变量与自变量之间的关系。在回归问题中,输出是一个连续值,模型试图预测目标输出。回归任务包括销售收入或财务规划的预测。

      常见回归算法包括:

      • 线性回归
      • 套索回归
      • 岭回归
      • 多项式回归
      • 决策树回归
      • 随机森林回归

      集成学习

      集成学习是一种监督学习的元方法,其中多个模型在相同的分类或回归任务上进行训练。将池中所有模型的结果进行汇总,以找出解决该挑战的最佳整体方法。

      在更大的集成模型中,各个算法被称为弱学习器或基模型。一些弱学习器具有较高偏差,而另一些则具有较高方差。理论上,通过结合各个弱学习器的优点,结果可以缓解偏差-方差权衡问题。

      常见监督学习算法

      梯度下降等优化算法可训练在监督学习任务中表现出色的各种机器学习算法。

      • 朴素贝叶斯:朴素贝叶斯是一种分类算法,它采用了贝叶斯定理的类条件独立性原则。这意味着在某结果的概率中,一个特征的存在不会影响另一个特征的存在,并且每个预测变量对该结果具有相同的影响。

        朴素贝叶斯分类器包括多项式、伯努利和高斯朴素贝叶斯。这种技术常用于文本分类、垃圾邮件识别和推荐系统。

      • 线性回归:线性回归用于识别连续因变量与一个或多个自变量之间的关系。它通常用于对未来结果进行预测。

        线性回归将变量之间的关系表示为直线。当只有一个自变量和一个因变量时,称为简单线性回归。但若自变量的数量增加,则为多元线性回归。

      • 非线性回归:有时,输出无法从线性输入重现。在这些情况下,必须使用非线性函数对输出进行建模。非线性回归通过非线性函数描述变量之间的关系,适用于增长曲线、衰减过程或其他复杂模式。

      • 逻辑回归:逻辑回归通常用于预测二元类别的概率,例如真或假或正或负。虽然线性回归和逻辑回归模型都试图理解数据输入之间的关系,但逻辑回归主要解决二元分类问题,例如垃圾邮件识别。

      • 多项式回归:与其他回归模型类似,多项式回归模拟图表上变量之间的关系。多项式回归中使用的函数通过输入特征的多项式项表达变量之间的非线性关系。多项式回归是一种特殊的回归形式,其中输入特征被提升到幂次,使线性模型能够拟合非线性模式。

      • 支持向量机 (SVM):支持向量机用于数据分类和回归。也就是说,它通常处理分类问题。在这里,SVM 使用决策边界或超平面将数据点的类别分开。SVM 算法的目标是绘制使数据点组之间的距离最大化的超平面。

      • K 最近邻:K 最近邻 (KNN) 是一种非参数算法,它根据数据点与其他可用数据的接近度和关联度对数据点进行分类。此算法假定在以数学方式绘制时,可以在彼此附近找到相似的数据点。

        KNN 的模型训练过程相对简单,但预测时需要计算新样本与训练数据之间的距离。因此,当数据集规模较大或特征维度较高时,KNN 的预测成本可能显著增加。

      • 随机森林:随机森林是一种集成学习算法,可以用于分类和回归。它通过训练多棵决策树,并汇总各棵树的预测结果生成最终输出。随机森林通常结合不同的数据样本和特征子集训练决策树,以降低树之间的相关性、减少方差并改善泛化性能。

        监督学习与其他机器学习方法的对比

        监督学习并不是训练机器学习模型的唯一学习方法。其他机器学习类型包括:

        • 无监督学习

        • 半监督学习

        • 自监督学习

        • 强化学习

            监督学习与无监督学习

            监督学习与无监督学习的区别在于,无监督机器学习使用未标记的数据,且不依赖任何客观真实标签。该模型可以自行发现数据中的模式和关系。许多生成式 AI 模型通过自监督学习完成预训练,再使用监督微调和其他对齐方法进行优化。

            无监督学习可以帮助解决数据集内的共同属性不确定的聚类或关联问题。常见的聚类算法有层次、K 均值和高斯混合模型。

              无监督学习的优点

              • 探索性分析:当“不知道要寻找什么”时,无监督学习非常有用。它能够发现数据中人类可能未预料到的隐藏结构或异常情况。

              • 无需数据标记:大多数现实世界的数据是未标记的,而对数据进行标记需要耗费大量时间和精力。

              • 灵活性:无监督学习模型能够自主处理数据,因此能快速适应新数据。

              • 可扩展性:由于不需要真实标签,无监督学习技术可以轻松扩展到大规模数据集。

              无监督学习的缺点

              • 结果不够精确:在没有真实标记数据作为基础的情况下,无法立即判断无监督学习模型是否被正确训练。

              • 敏感性:嘈杂的数据集会对训练结果产生不利影响。特征工程可以帮助规范化数据集,从而使无监督学习更加顺畅。

              • 对优质数据的依赖:所有训练都需要优质数据。但如果没有客观的真实标签数据,数据中的偏差或其他错误可能导致模型强化这些误解。

              监督学习与半监督学习

              半监督学习指在使用少量标记输入数据的同时,利用大量未标记数据来训练模型。由于依靠领域专业知识为监督学习适当标记数据可能既耗时又昂贵,因此半监督学习可能是一种很有吸引力的替代方案。

                半监督学习的优点

                • 对标记的依赖更低:与监督学习相比,半监督学习对标记的需求较少,从而降低了模型训练的门槛。

                • 隐藏模式发现:与无监督学习类似,半监督学习利用未标记的数据可以发现原本可能被忽略的模式、关系和异常情况。

                • 更灵活:半监督学习通过真实标签数据创建基础,然后利用未标记数据进行增强,使模型具有更好的泛化能力。

                半监督学习的缺点

                • 噪声敏感性:噪声较高的未标记数据集可能会干扰训练结果,削弱模型性能。

                • 偏差传播:如果未标记数据包含系统性偏差,模型可能学习并放大这些偏差。

                • 更复杂:在单一训练过程中将标记数据与未标记数据结合,可能涉及复杂的数据处理技术,或需要更多计算资源。

                监督学习与自监督学习

                自监督学习 (SSL) 通常被描述为连接监督学习与无监督学习的桥梁。SSL 任务不是使用监督学习数据集中的手动创建的标签,而是通过配置任务让模型生成自己的监督信号(隐式标签或伪标签)。然后,模型的损失函数使用这些标签代替实际标签来评估模型性能。

                SSL 通常与迁移学习结合使用,在这一过程中,预训练模型被应用于下游任务。自监督学习在计算机视觉和自然语言处理 (NLP) 任务中得到广泛应用;这些任务需要大型数据集,而标记这些数据集的成本极其高昂且耗时。

                自监督学习的优点

                • 效率:SSL 不是让数据科学家标记数据点,而是通过将任务转移给模型来自动执行标记过程。

                • 可扩展性:SSL 对手动数据标记的依赖性较低,因此能够很好地扩展到更大的未标记数据池。

                • 对标记的低依赖性:在标记的真实标签数据稀缺的情况下,SSL 通过模型生成的理解来弥补不足。

                • 多功能性:自监督模型能够学习丰富且可迁移的特征,这些特征可针对多种特定领域任务和多模态任务进行微调。

                自监督学习的缺点

                • 计算密集型:处理未标记的数据集和生成标签需要大量的计算能力。

                • 复杂:为监督学习创建预设任务的过程,即初始学习阶段,需要较高的专业技能。

                • 可能不可靠:像任何去除人工监督的学习技术一样,其结果依赖于数据不含过多噪声、隐性偏差以及其他可能对模型理解产生负面影响的因素。

                监督学习与强化学习

                强化学习训练自主智能体,例如机器人和自动驾驶汽车,通过环境互动做出决策。强化学习不使用标记数据,也不同于无监督学习,它通过试错和奖励进行教学,而不是通过识别数据集中的潜在模式。

                强化学习的优点

                • 解决复杂任务:试错训练过程可以让模型逐步掌握应对复杂战略挑战的方法。

                • 不依赖标记:模型通过经验学习,而不是仅通过将输入与输出匹配进行理论学习。

                • 根据奖励反馈调整策略:模型在训练过程中犯错时,会不断调整和优化自身的行为。

                • 适应性强:模型可以适应新信息和不断变化的环境,即使结果尚未预定义。

                强化学习的缺点

                • 容易出现不一致的结果:试错学习在刚开始训练时可能显得随意且不可预测。

                • 环境数据需求:强化学习要求模型从其行为的后果中学习,这反过来又需要大量的环境数据。不过,智能体也可以在模拟环境中学习。

                • 奖励投机:模型可能利用奖励算法中的漏洞来获取奖励,而并未充分完成其任务。

                • 特定任务:强化学习在训练用于特定功能的模型方面表现出色。这些模型在将所学知识迁移到新任务中时可能会遇到困难。

                实际案例中的监督学习应用

                监督学习模型可以构建和推进业务应用,包括:

                • 图像和物体识别:监督学习算法可用于定位、隔离和分类视频或图像中的对象,使其可用于计算机视觉和图像分析任务。

                • 预测分析:监督学习模型创建预测性分析系统来提供洞察分析。这使企业能够根据输出变量预测结果并做出数据驱动的决策,进而帮助企业评估不同决策方案并制定数据驱动的行动计划或为组织的利益而进行调整。

                  回归还允许医疗保健提供方根据患者标准和历史数据预测结果。预测模型可根据患者的生理和生活方式数据,评估其罹患特定疾病或病症的风险。

                • 客户情绪分析:组织可以从大量数据(包括背景、情感和意图)中提取和分类重要信息,并将人为干预降至最低。情感分析可以更好地了解客户互动,并可用于改善品牌参与度。

                • 客户细分:回归模型可以根据各种特征和历史趋势预测客户行为。企业可以使用预测模型来细分客户群并创建买家角色,以改善营销工作和产品开发。

                • 垃圾邮件检测:垃圾邮件检测是监督学习模型的另一个例子。使用监督分类算法,组织可以训练分类模型识别新邮件中的语言和行为模式或异常,以有效地组织垃圾邮件和非垃圾邮件相关的通信。

                • 预测:回归模型擅长根据历史趋势进行预测,适合在金融行业使用。企业还可以使用回归来预测库存需求、估算员工工资并避免潜在的供应链问题。

                • 推荐引擎:借助监督式学习模型,内容提供商和在线市场可以分析客户的选择、偏好和购买情况,并构建推荐引擎,提供更有可能转化为销售额的定制推荐。

                    监督学习的挑战

                    尽管监督学习能为企业带来深入的数据洞察分析和更好的自动化等优势,但它可能并不是所有情况下的最佳选择。

                    • 人员限制:监督学习模型可能需要一定程度的专业知识才能准确构建。

                    • 人员参与:监督学习模型通常需要持续监测,并在数据或业务环境发生变化时使用新数据重新训练或更新。数据科学家必须验证模型的性能输出。

                    • 时间要求:训练数据集很大,必须手动标记,这使得监督学习过程变得非常耗时。

                    • 数据分布变化:当新数据与训练数据存在显著差异时,模型的预测性能可能下降。无监督学习模型可能更有能力处理新数据。

                    • 偏差:数据集更有可能出现人为错误和偏差,导致算法学习错误。偏差可能源于训练数据集不平衡、标注不当,或数据中反映出的历史不公平性。

                    • 过拟合:监督学习有时会导致过拟合,即模型与其训练数据集过于贴近。训练集表现远高于验证集或测试集表现,可能表明模型出现过拟合,而不是可泛用的优秀性能。避免过拟合需要使用与训练数据不同的数据来测试模型。

                      作者

                      Ivan Belcic

                      Staff writer

                      Cole Stryker

                      Staff Editor, AI Models

                      IBM Think

                      相关解决方案
                      IBM watsonx.ai

                      使用面向 AI 构建器的新一代企业级开发平台 IBM watsonx.ai,可以训练、验证、调整和部署生成式 AI、基础模型和机器学习功能。使用一小部分数据,即可在很短的时间内构建 AI 应用程序。

                      了解 watsonx.ai
                      人工智能 (AI) 解决方案

                      借助 IBM 业界领先的人工智能专业知识和解决方案组合,让人工智能在您的业务中发挥作用。

                      深入了解 AI 解决方案
                      AI 咨询与服务

                      通过增加 AI 重塑关键工作流程和运营,最大限度提升体验、实时决策和商业价值。

                      深入了解人工智能服务
                      采取后续步骤

                      一站式访问跨越 AI 开发生命周期的功能。利用用户友好型界面、工作流并访问行业标准 API 和 SDK,生成功能强大的 AI 解决方案。

                      1. 深入了解 watsonx.ai
                      2. 预约实时演示