什么是 Lasso 回归?
什么是 Lasso 回归?
Lasso 回归是机器学习中的一种统计技术,它通过将数据向中心均值收缩或缩减来减少过拟合。在机器学习(ML)中,回归分析用于确定不同数据点之间如何相互影响。训练数据被输入到机器学习算法(或模型)中,算法会尝试找出各种因素之间的关系。随后,它利用这种关系来预测未知输入的输出。然而,随着因素数量的增加,输入与输出之间的关系会变得更加复杂,需要进行额外的处理(即正则化)以提高准确性。Lasso(即最小绝对值收缩和选择算子)是统计模型中的一种正则化技术;它通过牺牲少量的训练准确性来换取模型泛化能力的提升。
什么是正则化?
正则化是一项技术,旨在提高机器学习模型在处理未见过的现实世界数据时预测准确性。机器学习模型在进行预测时会考量众多参数或特征。根据配置方式的不同,该模型可能会产生不准确或不一致的结果。数据科学家将此归因于模型的偏差和方差。
-
偏差是指模型预测结果偏离真实值的倾向。它将模型生成的预测值与绝对值进行比较。
-
方差是指模型在较窄的分布范围内保持预测一致性的能力。它衡量的是模型对训练数据变化的敏感度。
理想的模型应具备低偏差和低方差,但这几乎是不可能实现的。但是,正则化可以以略微增加偏差的代价降低模型的方差。它通过在模型的损失函数中引入惩罚项,来实现偏差与方差之间的最佳权衡。损失函数(通常表示为均方误差,即 MSE)用于衡量并比较模型的预测结果与预期结果。预测变量是模型生成结果时的输入,而目标变量则是预期的结果。因此,数据科学家通过应用损失函数惩罚项,降低了预测变量与目标变量之间的依赖关系。
机器学习工程师利用各种正则化技术来克服过拟合问题。
L1 正则化
L1 正则化是一种防止线性回归模型过拟合的技术。在计算均方误差(MSE)时,它会对较重要的特征施加惩罚,并将其余特征的系数降为零。
L2 正则化
L2 正则化的作用机制与 L1 正则化类似,即在模型训练过程中降低特征的权重。不过,它在损失函数中是将系数进行缩减,而不是将其降为零。
提前停止
提前停止是一种在验证准确率下降之前终止模型训练的技术。在机器学习中,模型首先从训练数据集进行学习。随后,工程师通过让模型处理一个不同的验证数据集来评估其预测准确率。尽管持续训练可以降低训练误差,但可能会导致验证误差上升。
数据增强
数据增强是机器学习工程师利用现有数据样本人工创建新样本的方法。这使该模型能够克服数据稀缺问题,因为数据稀缺可能会降低模型在处理真实世界数据时的泛化能力。
随机失活
随机失活是一种正则化技术,有助于神经网络克服内部节点之间的相互依赖关系。在训练过程中,会随机选择并舍弃部分正则化节点。在此设置下,每一层中处于活跃状态的节点数量是随机的。这些节点必须在不依赖于前一层节点所提供的可预测输入模式的情况下,尝试逼近输出结果。
权重衰减
权重衰减通过正则化手段提升神经网络的泛化能力。它与 L2 正则化目标相同。不过,权重衰减是在每次训练迭代中逐步减小权重,而不是在损失函数层面进行处理。
Lasso 回归与其他类型的正则化技术相比有何不同?
Lasso 回归是机器学习中针对线性模型应用 L1 正则化的一种方法。下文将 Lasso 回归与类似的回归方法进行比较。
Lasso 回归和岭回归
岭回归应用 L2 正则化来减少过拟合。在计算损失函数时,岭回归会对回归系数的平方进行求和。相比之下,Lasso 回归计算的是系数的绝对值。Lasso 回归和岭回归均用于对线性模型进行正则化处理。岭回归更适合在复杂模型中缩小系数,而 Lasso 回归则有助于进行特征选择。
Lasso 回归与线性回归
线性回归是 Lasso 回归所基于的正则化技术。标准的线性回归模型试图在分布的数据点之间拟合一条直线,以使预测变量与目标变量之间的误差最小化。但是,简单的线性回归并不像 Lasso 回归那样对权重施加惩罚。相反,它会增加被视为更重要权重的数值,从而加剧过拟合现象。
Lasso 回归与弹性网络
弹性网络正则化结合了 Lasso 回归和岭回归所使用的技术。在计算损失函数时,它同时包含了惩罚项的绝对值和平方值。这使得数据科学家在训练模型时能够进行特征选择,并解决严重的多重共线性问题。
Lasso 回归是如何工作的?
Lasso 回归允许数据科学家在训练机器学习模型时忽略不重要的特征。该技术还可以缩小特定特征的系数,从而在计算成本函数时降低其重要性。为了更好地理解 Lasso 回归,我们来看看它的基本公式。
损失函数 = 均方根均方误差 + 惩罚项。
Lasso 回归的惩罚项是系数绝对值与超参数 λ 的函数。其目标是通过调整并找到最佳的 λ 值来实现最小均方根误差(RMSE)— λ 值越大,损失函数受到的惩罚就越重。同时,将系数的绝对值替换为零,使得模型能够针对选定的特征进行训练。
这些是数据科学家在模型训练中应用 Lasso 回归时采取的步骤。
进行数据分析
分析数据集,检查是否存在缺失数据、变量间的高相关性以及其他异常情况。数据科学家会采取特征缩放、归一化和剔除冗余数据等补救措施,以确保数据集的质量。
准备训练集和测试集
将数据集划分为训练数据和测试数据。随后,确定训练集中的目标变量和预测变量。机器学习模型利用训练数据来分析并学习潜在模式,从而提高其泛化能力的准确性。与此同时,测试数据包含输入数据及预期结果,用于评估模型的性能。
实施 Lasso 回归技术
创建 Lasso 回归模型并将训练集输入其中。随后,模型将进行多次预测迭代,以寻找能产生最小均方根误差(RMSE)的 λ 值。在此过程中,Lasso 回归算法通过将不重要的系数替换为零来降低模型复杂度。
解读结果
在 Lasso 回归模型完成所有预测后,您可以评估各项指标,以判断该技术是否为您的数据集构建了一个更简洁且更精确的模型。
Lasso 回归有哪些应用场景?
Lasso 回归在这些场景中非常有用。
降维
降维技术使机器学习模型能够学习从复杂的高维数据中提取有意义的特征表示。高维数据集包含大量特征,例如图像或视频数据。利用 Lasso 回归,您可以通过剔除不必要的特征,构建既保留关键信息又更简单、更稀疏的模型。
特征选择
特征选择通过学习重要数据并舍弃无关数据来提升模型性能。在训练模型时,Lasso 回归可以将特定系数设为零,从而剔除不重要的特征。这使得模型在学习时更具选择性,优先关注有价值的特征,而非噪声或冗余数据。
多重共线性
多重共线性是指两个或多个预测变量之间存在相关性的情况。预测变量是指数据集中用于预测目标变量的特征。当存在多重共线性时,预测变量不仅能预测目标变量,还能相互预测。您可以使用 Lasso 回归来衡量数据中的多重共线性。
AWS 如何支持 Lasso 回归?
Amazon SageMaker 是一项完全托管的服务。借助该服务,您可以通过完全托管的基础设施、工具和工作流程为任何使用案例准备数据,并构建、训练和部署机器学习(ML)模型。它内置了线性回归和逻辑回归算法,以及其他多种统计软件包中的算法。
Amazon SageMaker Canvas 是一种通用的自动机器学习(AutoML)解决方案,适用于分类和回归问题,例如欺诈检测、流失分析和精准营销。
Amazon SageMaker Data Wrangler 可以简化数据准备和特征工程的流程。您可以在同一个可视化界面中完成数据准备工作流的各个步骤(包括数据选择、清洗、探索、可视化以及大规模处理)。SageMaker Data Wrangler 利用 Lasso 方法提供诊断可视化功能。它可以绘制基于您的数据训练出的 Lasso 模型的系数值。系数值接近零的变量可能是冗余的,且对机器学习模型的性能贡献可能不大。
立即创建账户,开始在 AWS 上使用 Lasso 回归。
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages