跳至主要内容

什么是随机森林回归?

什么是随机森林回归?

随机森林回归是一种机器学习算法,它根据不同的 if-then 条件剔除数据点,从而针对给定输入做出相当准确的预测。该算法结合了并行运行的多个决策树算法的输出,从而更有效地得出最终预测。随机森林模型作为分类算法,需要标注数据来进行初始训练。

随机森林回归中的决策树是什么?

决策树是随机森林回归模型用来进行高度准确预测的基本机器学习算法。它们是一种有监督学习算法,通常用于分类和回归任务。数据科学家使用决策树来确定对象属于哪个类别或根据历史数据预测未来事件的结果。应用决策树算法时,会从训练数据中学习,做出 if-then 预测。经过多次决策后,该算法会给出一个确定性结果。

您可以将决策树想象成倒着种的树,树枝向下展开。当树形图回答“是/否”问题时,它会从根部开始分支或一分为二。这些评测在决策节点中进行。该过程一直持续到达到一定深度,在叶子节点处结束,这会生成最终的预测。

示例

例如,决策树算法评估一个人的胆固醇水平是否高于某个阈值。如果答案为否,它会继续检查后续条件,直到能够有把握地判断此人是否健康。否则,该算法会评测其他健康因素以计算此人的健康风险。

挑战

决策树速度快,并且有助于确定输入特征之间的非线性关系。但是,它们很容易过拟合,特别是当分支延伸到一定深度时。过拟合是一种现象:机器学习模型在训练数据上表现准确,但在不熟悉的真实世界数据上表现不佳。决策树也极易受到数据变化和噪声的影响。如果训练数据略有变化,则该算法可能会产生明显不同的结果。

以图形表示的决策树示例。

随机森林回归的工作原理是什么?

随机森林回归模型结合了多个决策树的平均输出。它首先计算单个树的预测。然后,选择出现频率最高的预测。该模型不依赖单一的预测,而是综合所有决策树的多数投票来预测最终结果。

集成学习

随机森林使用集成学习来整合来自多个决策树的结果。有两种类型的集成学习:装袋方法和提升方法。

  • 装袋集成会创建多个独立的机器学习模型,并使用相同训练数据的子集对其进行训练。

  • 提升集成将多个机器学习模型串联在一起,生成强有力的预测。

两种类型的集成学习都使用相同的数据训练模型。随机森林回归器应用装袋集成方法进行更准确的预测并防止过拟合。

装袋

装袋,也称为引导聚合,是一种用于分类和回归模型的集成学习方法。引导聚合分为两个阶段。

  • 引导使用替代采样方法来确保从同一个数据集中创建多个随机样本。

  • 聚合允许机器学习算法整合预测任务中涉及的所有引导模型的结果。

引导聚合减少了样本之间的依赖项。由于样本是根据相同的训练数据集创建的,因此模型的方差不大。

您如何训练随机森林回归模型?

数据科学家使用装袋来训练随机森林回归。训练过程如下。

训练单个决策树

数据科学家通过引导采样或行采样随机选择数据集部分。对于每个样本,他们从同一个训练数据集中抽取少量数据,这个过程称为有放回抽样。然后,数据科学家为数据集的每个子部分创建单独的决策树。他们可以创建多个决策树,但必须确保这些决策树不相互依存。由于每个样本都来自同一个数据集,因此可能包含重复的数据。

特征采样

数据科学家应用特征采样来确保每个决策树都是真正独立的。特征采样从样本中提取训练数据集的特定列或特征,且为不放回抽样。这样,决策树可以根据不同的特征进行预测,而不必担心重叠。

如何评估随机森林回归模型?

数据科学家通过计算随机森林模型的袋外(OOB)分数和验证分数来评估其准确性。

袋外分数

袋外(OOB)是指使用替换方法创建训练样本子集时未选择的数据行。这些剩余的数据行被认为是袋外的,因为它们不用于训练随机森林模型。但是,OOB 数据可以帮助在训练后验证模型的准确性。为此,数据科学家向随机森林模型提供 OOB 数据并评估其预测。他们计算模型做了多少准确的预测,从而得出 OOB 分数。

验证分数

验证分数是另一个衡量模型准确性的指标,类似于袋外分数。但是,用于计算验证分数的数据集被故意放在一边,不用于采样。

随机森林回归有哪些优势?

随机森林算法对决策树进行了改进,如下所示。

准确性

聚合克服了决策树模型的过拟合问题。这也使随机森林受数据集变化的影响更小。通过单个决策树进行的一些不准确的预测不会影响最终结果,从而使随机森林模型更加准确。

计算速度

与决策树模型一样,随机森林在分析非线性输入特征方面非常出色。即使训练样本缺少数据,这些模型也可以做出预测。但是,随机森林中的决策树不是根据整个数据集进行训练的。相反,它只能从训练数据集的子部分中学习。例如,您需要使用所有客户数据训练信用评分决策树模型。但是,随机森林中的每个决策树仅使用来自某些客户的数据。这提高了计算速度,因为多个决策树可以并行预测并在以后整合其结果。

随机森林回归面临哪些挑战?

随机森林回归通过随机特征采样和自助聚合,克服了决策树容易出现的过拟合问题。这是数据科学家在各种应用场景中使用的更准确的分类算法之一。但是,随机森林模型有一些局限性。

可解释性较低

当决策树的深度增加时,随机森林回归模型的可解释性就会降低。每个树分成几层决策节点,因此很难确定做出特定预测的原因。

训练缓慢

使用随机森林模型进行训练和泛化要比其他类似模型慢。尽管使用多个决策树计算结果,但实现涉及行和特征采样的集成学习方法将使用更多的计算资源。

推断有限

随机森林无法推断特定目标变量的训练数据集中显示的值以外的结果。这意味着您无法使用随机森林进行时间序列预测,例如预测未来几十年的生活成本。这是因为随机森林模型会将其预测限制为训练数据中的最大值和最小值。

什么是随机砍伐森林回归?

随机砍伐森林(RCF)回归是 AWS 开发的一种特殊机器学习算法,用于检测大型数据集中的异常值。数据异常会不必要地使机器学习任务复杂化。RCF 识别时间序列数据中的异常数据,并为不同的数据点分配异常分数。通过这种方式,数据科学家可以移除与一般表示法有显著差异的数据。为此,RCF 随机选择几组数据点。然后,进行切割,使每个组的点数相同。然后,该算法为每个数据点组创建决策树。

与随机森林不同,RCF 中的树允许增量更新。它还适用于在无监督学习应用程序中处理高维和流式传输数据。

AWS 如何帮助满足您的随机森林回归需求?

Amazon SageMaker 提供一套内置算法、预训练模型和预构建解决方案模板,帮助数据科学家和机器学习从业人员快速地开始训练和部署机器学习模型。Amazon SageMaker 随机砍伐森林(RCF)是一种内置的无监督算法,用于检测数据集中的异常数据点。

同样,Amazon SageMaker Canvas 是一项无代码机器学习服务,支持整个机器学习工作流程,包括数据准备、模型构建和训练、生成预测以及将模型部署到生产环境。在集成模式下,Canvas 支持随机森林回归以及其他几种模型。

立即创建免费账户,开始在 AWS 上使用随机森林回归。

Browse all cloud computing concepts

Browse all cloud computing concepts content here:

正在加载
正在加载
正在加载
正在加载
正在加载

Did you find what you were looking for today?

Let us know so we can improve the quality of the content on our pages