什么是无监督学习?
什么是无监督学习?
无监督学习是一种机器学习(ML)训练方法,无需人工监督或干预即可从未标记数据集中的数据中学习。无监督机器学习模型无需明确指令即可发现数据中的模式和见解。例如,无监督学习任务可以对文档档案进行分类。训练会自动生成“新闻稿”、“合同”和“财务文档”等类别标签。一旦训练,无监督学习模型还会自动对收到的新文档进行分类。
无监督学习有哪些应用?
无监督学习技术用于识别庞大数据集中的模式或关系。例如
-
欺诈检测包括学习正常的交易速度、金额和类型,以确定何时可能发生欺诈并停止交易。
-
医学成像分析包括学习典型的医学结构,以确定异常所在的位置。
-
入侵检测是通过学习正常的网络流量模式和识别异常实现的。
-
客户细分包括了解客户在不同的交易中属于哪种类型的客户群体。
无监督机器学习算法在遗传分析中也有应用。该算法学习关联模式,根据基因编码了解哪些条件通常同时发生。无监督学习的应用几乎是无限的,因为可以应用分类来解决不同领域的各种问题。
无监督学习有哪些类型?
以下是一些最常见的无监督学习方法。
聚类
聚类无监督学习算法通过数据点之间的相似度识别来自不同分类的数据,在图表中按点之间的距离显示。
硬聚类
硬聚类或排他性聚类是一种无监督学习方法,其中每个数据点仅属于一个集群。此方法用于边界清晰的数据,例如,识别单颗水果图像中的水果类型。K 均值聚类算法和分层聚类是特定的硬聚类方法。
软聚类
软聚类或重叠聚类是一种无监督学习方法,其中数据可以分成多个组。该算法将输出数据点在特定组中的适合程度。例如,模糊 C 均值和基于隶属度局部近似的模糊聚类(FLAME)无监督学习算法都是软聚类方法。
概率聚类
概率聚类或基于分布的聚类是一种无监督学习方法,其中概率表示数据点属于特定集群的机会。概率聚类可以是排他性的,也可以是重叠的。例如,在超市购物行为分析的客户细分中,一个人可能同时属于 35% 高支出、60% 中等支出和 15% 低支出这几个类别。高斯聚类方法,例如高斯混合模型(GMM),是一种概率聚类,其中数据遵循高斯分布。
关联规则挖掘
关联规则挖掘无监督学习方法可以在数据中的变量之间找到有趣的关系模式。最著名的关联规则挖掘应用是购物篮分析,它可以找出杂货店中哪些商品通常会一起购买,例如意大利面酱和意大利面。Apriori、Eclat 和频繁模式增长(FPG)无监督学习算法都是关联规则挖掘的类型。
密度估计
密度估计机器学习方法是指模型为数据集推测出一个底层的概率分布。例如,温度、湿度和光量等传感器数据可用于确定自运行的温室是否按预期运行或需要维护。内核密度估计是特定密度估计算法的一个示例。
异常检测
可以使用异常检测来评估数据集,进而找出数据中不太适合的异常值。例如,监控视频片段可用于识别可能的盗窃事件。异常检测算法的类型包括孤立森林和单类支持向量机。
降维
降维通常在其他无监督学习技术之前使用。这就是在预处理期间从数据中移除“噪音”(或多余的不必要变量)以减少模型训练开销的过程。
无监督学习中有哪些生成模型?
在无监督机器学习中,生成式人工智能模型是一种算法,这种算法学习未标记数据的潜在模式和结构,进而生成与原始数据相似的新数据实例。这些模型之所以被称为生成模型,是因为它们可以在从数据集中学习后创建或生成数据点。
在无监督机器学习中使用的生成模型的示例包括
GAN
生成对抗网络(GAN)涉及两个神经网络,即一个生成器和一个鉴别器,它们同时训练。生成器试图生成与真实数据无法区分的数据,而鉴别器则试图将生成的数据与真实数据区分开。这种对抗过程提高了所生成数据的质量和真实性。
VAE
变分自编码器(VAE)基于自编码器,自编码器是经过训练可在输出端重现其输入的神经网络。VAE 将输入数据表示为在潜在空间上的分布。这些编码器可以通过从这个潜在空间中采样来生成新数据。
自回归模型
像 PixelRNN 和 PixelCNN 这样的自回归模型按照指定的顺序一次生成一部分数据(例如,对图像逐像素生成),每一部分的生成都以之前已生成的部分为条件。
归一化流
归一化流学习将数据映射到更简单的分布(通常是高斯分布)的转换。它们可以通过逆转这些转换,从简单的噪声分布中生成新的数据实例。
有监督学习和无监督学习之间有什么区别?
有监督学习是指在已经标记的输入数据点上训练机器学习模型,然后以相同的方式标记新的传入数据。例如,预测信贷审批使用数据集,该数据集包含信用评分、收入、就业经历等特征,以及表明信贷申请获批还是被拒的标签。通过在新案例中输入这些详细信息,就会自动得出信贷获批还是被拒的假定结论。相反,无监督学习模型是在未标记的数据上训练的。
无监督机器学习方法通常比有监督学习方法更难实现。使用有监督学习方法,您已经将算法指向了正确的方向;使用无监督学习时,除了算法本身之外没有其他方向。无监督学习必须自行从输入数据中识别模式。
有时,只有部分数据集已被标记或能够手动标记。在这种情况下,您可以使用半监督学习。首先,您可以使用有监督学习在已标记的输入数据上训练模型,然后可以使用无监督学习训练剩余的未标记数据。
欲了解更多信息,请探索有监督学习和无监督学习之间的区别。
无监督机器学习面临哪些挑战?
我们在下面提出一些挑战。
模型选择
在任何机器学习任务中,选择正确的算法或模型都很困难。即使您知道自己需要硬聚类模型,为任务选择最合适的无监督学习算法也可能很困难。
训练数据大小
精确训练无监督学习模型需要大量的训练数据,尤其是生成式无监督学习模型。捕获这些训练数据并确保其干净且正确非常具有挑战性。
处理能力
无监督学习模型训练可能需要很长时间,并且需要大量的处理能力。这种处理能力可能需要外包,例如运行 Amazon EC2 P3 实例进行快速、按需、无监督学习模型训练。
不断变化的数据集
当数据随时间变化或增长,并且未使用微调或检索增强生成(RAG)等技术增强无监督学习模型时,其预测准确性可能会开始失效。
AWS 能提供哪些帮助?
Amazon SageMaker 是一项完全托管的服务,可通过完全托管的基础设施、工具和工作流程为任何使用案例准备数据,并构建、训练和部署机器学习(ML)模型。该服务提供多种内置算法,可用于各种无监督学习任务,例如聚类、降维、模式识别和异常检测。例如:
-
IP Insights 捕获 IPv4 地址与各种实体(例如用户 ID 或账号)之间的关联。
-
K 均值算法在数据中找到离散分组,其中一个组的成员尽可能相似,与其他组的成员尽可能不同。
-
主成分分析(PCA)算法通过将数据点投影到前几个主成分上来降低数据集中的维度。
-
随机砍伐森林(RCF)算法可检测数据集中与原本结构良好或模式化数据不同的异常数据点。
Amazon Bedrock 是一项完全托管的服务。可以使用该服务访问来自亚马逊和领先人工智能(AI)初创企业的基础模型(FM)或经过训练的深度神经网络。这些 FM 可通过 API 获得,因此您可以从各种选项中进行选择,以找到最适合自己需求的模型。可以在自己的 GAN 应用程序中使用这些模型。借助 Amazon Bedrock,可以快速开发和部署可扩展、可靠且安全的生成式人工智能应用程序。并且,您不必管理基础设施。
立即创建免费账户,开始在 AWS 上使用无监督学习。
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages