什么是重复数据删除?
什么是重复数据删除?
重复数据删除是指查找并删除相同数据的副本,以避免冗余和错误的过程。重复数据删除后,将仅保留数据的一个实例。重复数据删除可应用于文件、块、对象或记录级别的数据,查找和删除每种类型数据的流程也各不相同。在存储场景中,重复数据删除可节省空间和成本;在分析系统场景中,则可提高数据准确性。

什么是数据重复? 重复数据删除之前和之后
重复数据删除的类型有哪些?
重复数据删除有两种不同类型,每种类型都有其独特的处理方法和所解决的问题。
重复数据删除在存储级别是如何工作的?
存储级重复数据删除是一个旨在删除基础架构层冗余数据的过程。存储级重复数据删除可找到相同的数据段,并确保它们仅存储一次。这通常涉及删除重复项并将其替换为引用。存储级方法可以在文件级别(通过比较整个文件的哈希值)、块级别(将文件分成较小的段并删除重复项)或对象存储系统中执行。
存储级别的重复数据删除从检查数据开始。如果您正在执行块级重复数据删除,则需要将数据分成小段,称为数据块(chunk)。然后通过哈希对每个块(大小可以是固定的,也可以是可变的)进行指纹识别,从而为其提供唯一的参考标识。如果您正在执行文件级重复数据删除,则每个文件都会经过哈希处理。
然后,系统会将该块或文件的当前指纹与之前存储的所有数据指纹的哈希索引进行比较。如果存在匹配项,系统将不会再次存储该数据。系统只需创建一个参考,指向该数据在现有记录中的存储位置。然后,您可以运行后台垃圾数据收集,以回收参考点之外的存储空间。
但是,该系统在尝试存储加密或压缩数据时效果较差。特定的压缩技术和加密级别可能导致两条记录即使包含相同的数据,也不具有匹配的哈希值。
重复数据删除在记录级别是如何工作的?
记录级重复数据删除作用于已标准化的结构化或半结构化数据。此方法不仅可以查找完全匹配的内容,还可以查找格式不同但逻辑上等效的记录。实现这一目标的主要方法是使用基于规则的匹配和模糊匹配,从而帮助检测相似之处。机器学习模型还可以比较记录之间的相似程度,将达到特定阈值的记录标记为重复记录。您可以合并这些相似的记录,也可以将它们链接起来,具体取决于实际情况。
记录级重复数据删除在高度结构化的环境中最为常见,在这类环境中,一致性和准确性至关重要,例如客户关系管理系统或销售系统。
为什么重复数据删除很重要? 重复数据删除有哪些优势?
企业使用重复数据删除有多种原因。
提高数据完整性和质量
当您的企业处理重复记录时,可能会将相同的数据计入两次,误以为它们是两条不同的记录。如果某条记录已更新,但其重复记录未同步更新,则会导致数据不一致和数据过时。在分析密集型工作负载中,重复信息会影响数据完整性,并降低报告系统的准确性。在机器学习工作负载中,重复文件会干扰训练流程,并降低训练效率。
降低存储成本
随着时间的推移,冗余数据备份、同一文件的多个版本和虚拟机映像都会在业务系统中不断累积,从而占用存储空间并增加总存储成本。数据去重有助于定位冗余数据,将其删除并减少企业中存储的数据总量。存储的数据越少,企业需要支付的存储费用就越少。
消耗更少的带宽
通过查找并删除系统中的重复数据,您可以确保任何数据传输仅包含极少量的必要信息。传输含有重复数据块的数据会在传输过程中消耗更多带宽。重复数据删除是减少带宽消耗的有效方法,在云环境中尤为实用,因为在云环境中,迁移成本可能较高。
满足合规性目标
有关敏感数据,尤其是个人身份信息(PII)处理的法规要求您以一致且安全的方式管理数据。对每条信息保留单一的权威记录,可以更轻松地确保对该信息应用正确的数据保护措施。
重复数据删除计划有哪些类型?
数据重复不一定发生在数据生命周期的固定点。根据您的存储要求和性能需求,可以使用不同的重复数据删除计划。
内联重复数据删除发生在写入过程中,在将数据写入存储之前检查其是否为重复数据。虽然这样可以最大限度地减少存储空间占用,但由于必须在写入磁盘之前检查重复数据,因此会产生较高的写入延迟。
后处理重复数据删除允许您的系统立即写入数据。写入过程完成后,您的系统会扫描所有存储的数据,识别所有重复数据,然后将其删除。这样做可以解决写入延迟问题,但需要更高的临时存储开销,以应对进入您存储空间的重复数据。您可以将后处理重复数据删除计划设置为每天、每周或按任意选定的时间间隔运行。
重复数据删除的使用案例有哪些?
企业使用重复数据删除解决方案的原因有很多。
备份数据管理和灾难恢复
随着时间的推移,备份系统会在多个快照中生成大量冗余备份数据。重复数据删除可识别并删除重复数据,从而减少这些系统中的数据冗余。删除冗余记录有助于提高灾难恢复效率,同时降低存储成本。
文件共享和主目录
尤其是在协作型企业环境中,企业可能会为不同的团队或部门存储多份相同的文件。集中数据并消除重复数据,有助于提高存储利用率,在设置正确访问权限的同时释放存储空间。
软件开发环境
在软件开发生命周期中纳入重复数据删除流程,可确保您仅存储修改后的数据段。无需保存变更极少的多个软件工件版本,而是可以创建仅包含变更内容的副本,从而提高存储效率。
虚拟机存储
在虚拟环境中,多个实例依赖于同一个虚拟映像是很常见的。重复数据删除可确保映像存储库仅存储唯一的虚拟机映像,从而有助于降低大规模运行这些系统的数据存储需求。
客户数据平台
客户经常通过许多不同的系统与您的业务互动,并在此过程中产生数据。您可以合并数据集来改善数据管理并删除重复数据,而无需通过多个渠道为这些客户分别保留不同的记录。
医疗保健和金融数据
金融和医疗保健等受到严格监管的领域通常会使用数据复制来消除数据中的冗余。这样做可以减少数据管理中的不准确之处,同时降低遵守数据隐私法规的总体开销。如果您出于合规性原因需要提交记录,单一记录也更易于追踪审计。
重复数据删除最佳实践有哪些?
制定有效的重复数据删除策略有赖于周密的规划和明确的方向。以下是您可以遵循的一些最佳实践。
提前评估预期结果
提前明确记录您希望通过重复数据删除实现的预期结果,从而提高策略的有效性。提前评估您的系统,并在规划时加以考量。例如,如果您知道要处理存储中的加密或压缩数据,那么典型的重复数据删除策略不会产生太大影响。
在非高峰时段安排作业
实际的重复数据删除过程会给系统带来压力并消耗资源,进而引入延迟并占用带宽。为了规避性能影响,您可以将重复数据删除作业安排在非高峰时段执行。
在记录重复数据删除中使用模糊匹配
模糊匹配是一种策略,可用于大幅提高从不一致数据集中删除重复数据时的准确性。虽然直接匹配可以起作用,但模糊匹配在识别相似数据集方面更加一致且灵活。
制定删除计划
删除数据还需要删除所有未使用的数据块。正确处理数据集中的任何引用都需要仔细规划。请务必审核您的环境并制定明确的删除计划,以尽可能多地回收存储空间。
亚马逊云科技如何帮助您满足重复数据删除需求?
亚马逊云科技支持对您的存储和记录进行重复数据删除,以下服务提供原生重复数据删除功能:
- Amazon FSx 让您可以轻松且经济高效地在云端启动、运行和扩展功能丰富的高性能文件系统。该服务凭借其可靠性、安全性、可扩展性以及针对 NetApp ONTAP、OpenZFS 和 Windows File Server 的广泛功能,为各种工作负载提供支持。您可以启用重复数据删除功能,通过仅存储数据集中的重复部分一次,自动降低与冗余数据相关的成本。
- Amazon Glue 可帮助您清理和准备数据以供分析,无需您成为机器学习专家。它的 FindMatches 功能可对记录进行重复数据删除,并找到彼此之间不完全匹配的记录。然后,系统将会学习您将一对记录判定为“匹配”的标准,并构建一个 ETL 作业,供您用于查找单个数据库中的重复记录或两个数据库中的匹配记录。
立即创建免费账户,开始在亚马逊云科技上进行重复数据删除。
亚马逊云科技重复数据删除后续步骤
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages