跳至主要内容

什么是有监督学习?

什么是有监督学习?

有监督学习是一种机器学习(ML)训练方法,它需要使用带标签的数据。标签表示每个输入对应的期望输出,因此有监督学习模型会学习把输入映射到特定输出。其目标是训练模型学会泛化,这样它就可以预测未知输入的输出。例如,在用于预测信贷审批结果的有监督学习任务中,所使用的数据集包含信用评分、收入、就业经历等特征,以及标明信贷申请获批还是被拒的标签。模型会从这些数据中学习,并基于观察到的模式来预测新申请的信贷审批结果。

有监督学习是如何工作的?

机器学习模型或算法必须先使用与任务相关的数据集进行训练。您可以使用包含已知输入和输出的数据集,让算法学习它们之间的数学关系。模型一旦完成训练、测试和验证,就能根据新的、未知的输入生成准确的输出。为了获得具有高置信度的准确结果,有监督学习使用的数据集应当干净且足够大,能够充分反映现实世界数据的多样性。

有监督学习数据

原始的有监督学习数据集由一组数据点组成,每个数据点都包含一个或多个输入,以及一个或多个对应的输出。这个原始数据集会被划分为三个独立的集合:

  • 训练数据
  • 测试数据
  • 验证数据

在训练数据集和验证数据集中,每个数据点都包含输入,并附有标注好的原始输出。测试数据集则移除了输出,并将其单独放在一边。

带标签的数据集在许多网站上都可以免费获取或付费购买。组织也可以雇人来为数据打标签。

有监督学习流程

数据科学家首先选择并配置有监督机器学习模型。然后,他们将训练数据集输入该模型。模型会处理这个数据集,并通过数学计算得出给定输入与带标签输出之间的关系。

接下来,数据科学家将测试数据集作为输入,检查训练后模型的输出是否与原始带标签输出一致。他们还会使用验证数据集再训练一个模型,并将这两个有监督机器学习算法的结果与测试数据进行比较。

有哪些有监督学习模型?

有些类型的机器学习模型或算法,如果您想使用它们,就必须用带标签的数据进行训练。它们被称为有监督学习算法或有监督机器学习模型。它们大致可以分为两类:分类和回归。

分类

有监督机器学习中与分类相关的技术,会通过将输入数据归入特定类别来预测类别标签,例如判断一封电子邮件是垃圾邮件还是非垃圾邮件。下面举几个例子。

二元分类

二元分类根据对象的属性,将其划入两个预先定义且互斥的类别之一。根据诊断测试结果判断某人是否患有某种疾病的医学诊断,就是二元分类的一个例子。

多类分类

多类分类根据对象的属性,将其划入多个类别之一。一个例子是预测与某篇文本文档最相关的主题。文档可能被归类为宗教、政治或金融等主题,也可能被归入其他若干预定义主题类别之一。

逻辑回归

逻辑回归用于确定输入数据属于某一类别的可能性,无论该分类任务是二元分类(例如:是、否),还是多类分类(例如:苹果、橙子、梨)。

决策树

决策树基于“如果-那么-否则”的结构。例如,如果一个人有按时付款的记录,并且有多个推荐人,那么他也很可能会在提前通知后搬离。

随机森林

随机森林通过组合多棵决策树,得出比基于单棵决策树的有监督学习模型更准确的结果。

支持向量机

支持向量机能够更准确地拟合那些可能不符合典型逻辑回归数据分布的分类数据。它的做法是先将数据集转换到更高维度,然后再进行处理。

回归

回归模型或算法生成的是连续数值输出,而不是诸如温度、长度和成本等类别。无论是单输出回归还是多输出回归,都有相应的有监督学习模型。

线性回归

线性回归通过一条直线来拟合数据,被认为是最简单、最基础的机器学习算法之一。

多项式回归

顾名思义,多项式回归将数据拟合为一条多项式曲线。

决策树

决策树虽然可用于分类任务,但也同样适用于回归任务。

神经网络

神经网络是常用于多输出回归任务的机器学习算法。其隐藏层节点能够很好地胜任这类更复杂的关系建模任务。

有监督学习、半监督学习和无监督学习之间有什么区别?

有监督学习要求输入数据有对应的带标签输出数据。相比之下,无监督学习模型使用没有特定输出的输入数据进行训练。模型转而会从数据内部以及数据之间发现模式和关系。无监督学习中使用的模型类型包括聚类、关联规则学习和概率密度估计。

半监督学习融合了有监督学习和无监督学习两种技术。在这种方法中,有标签数据量较少,同时还有一个规模更大、没有明确输出的无标签数据集。模型首先在无标签数据集上进行训练,然后利用有标签数据集进一步优化输出建模。

如需更深入的说明,请访问有监督学习和无监督学习有什么区别?

有监督学习面临着哪些挑战?

根据任务的不同,找到或自行创建大型且具有代表性的数据集可能颇具挑战。数据集越大、越具代表性,有监督学习的结果就越准确,结果中的偏差也越小。例如,如果人脸识别任务只用某一个种族的数据进行训练,它将无法准确识别其他人群的面孔。

无标签数据

当数据集尚未打标签,或者包含大量无标签数据时,这项任务可能会耗费大量时间,具体取决于打标签的复杂程度和数据集的大小。人工打标签任务可能需要特定领域的专家知识,而这类人才可能很难找到。

模型选择

为当前任务选择合适的有监督学习模型也很重要。根据您的使用场景,某些有监督机器学习算法更准确、更具成本效益。虽然较基础的模型只需很少的时间和投入就能创建、训练和运行,但其他更复杂的模型则需要更多配置,并且在每个阶段的成本都更高。

结果不一致

有监督学习的输出质量可能因过拟合和欠拟合而变得不稳定。过拟合是指模型过度贴合训练数据中的模式,导致面对新数据时产生不一致的结果。欠拟合则是指所使用的模型对于数据而言过于简单,因而也会产生不准确的结果。例如,大多数现实世界的数据都无法用线性回归模型很好地拟合。

模型适应性

有时,由于现实世界的变化,标签可能不再准确。例如,在一个用于预测信用度的模型中,训练模型所用的经济指标和个人就业状况可能因经济衰退或繁荣而发生显著变化。即使数据只是略有变动,原始数据集和有监督学习训练也可能不再适用。此时,就需要对模型进行微调或重新训练,以确保结果准确。

AWS 如何助力有监督学习?

Amazon SageMaker 是一项完全托管的服务,提供一系列完全托管的基础设施、工具和工作流,能够为任何用例准备数据并构建、训练和部署有监督机器学习(ML)模型。它内置了多种有监督学习算法,可用于分类或回归问题。例如:

  • AutoGluon-Tabular 是一个开源 AutoML 框架,通过集成模型并将它们多层堆叠来取得良好效果。
  • 因子分解机算法是线性模型的一种扩展,旨在以经济高效的方式捕捉高维稀疏数据集中特征之间的交互作用。
  • LightGBM 实现了梯度提升树算法,并引入两项新技术,以提升有监督学习的效率和可扩展性。
  • DeepAR 预测算法是一种有监督学习算法,用于通过循环神经网络(RNN)预测标量(一维)时间序列。
  • Object2Vec 算法是一种新型的、高度可定制的多用途特征工程算法。它能够学习高维对象的低维稠密嵌入,进而生成有助于提升下游模型训练效率的特征。虽然因为训练需要带标签数据,它是一种有监督算法,但在许多场景中,关系标签可以完全从数据中的自然聚类获得,而无需任何显式的人工标注。

Amazon SageMaker Ground Truth 让您可以设置打标签任务、选择人工打标签人员,为有监督机器学习任务创建自己的数据集。

立即创建免费账户,开始在 AWS 上使用有监督学习。

Browse all cloud computing concepts

Browse all cloud computing concepts content here:

正在加载
正在加载
正在加载
正在加载
正在加载

Did you find what you were looking for today?

Let us know so we can improve the quality of the content on our pages