什么是数据归档?
什么是数据归档?
数据归档是指将不再使用的数据转移至长期存储系统的过程,通常会采用更紧凑的格式进行存储。组织主要通过数据归档来保存记录和遵循合规要求。大多数归档数据在最终停用之前不会再被调取使用。数据归档与数据备份的区别在于:归档数据的用途主要是供日后查阅参考,而非用于系统恢复。数据归档生命周期是一个框架,用于管理数据在归档系统中的流转过程。
数据归档与数据备份
数据归档和数据备份都涉及数据存储操作,但两者的目的不同。
数据存档
数据归档是将不活跃数据从主存储移动到长期存储以进行保存的过程。归档的目标是保留数据,用于历史参考和记录保存。例如,归档数据可能包含不再频繁使用但必须保留数年或数十年以满足监管和法律要求的固定记录。归档数据是不可变的:一旦存储,便不得更改。
数据备份
数据备份是指针对正在使用的数据创建“时间点”副本的过程。数据备份旨在确保在发生数据丢失事件时,能够恢复这些活动数据。例如,在发生硬件故障或意外删除数据后,您可以恢复丢失或损坏的文件。由于活动数据会频繁发生更改,因此备份是可变的,这意味着它们可以定期更新或覆盖。
数据归档与数据仓库
数据归档和数据仓库都涉及存储海量信息,但它们使用的 IT 资源不同,应用场景也截然不同。
数据存档
数据归档是对陈旧、非活跃数据进行的冷存储。您可以将数据从主系统移至归档存储,以释放空间、降低高维护成本基础设施的开支,并满足关于数据保留期限的合规要求。归档数据存储在专为长期保存而设计、具有成本效益的基础设施上,而非用于频繁查询和分析的系统。
数据仓库
数据仓库以高度结构化且针对查询优化的格式,存储来自多个来源的海量数据。数据仓库专为活跃的数据分析而设计。您可以使用数据仓库进行复杂分析、生成商业智能并快速检索汇总结果。数据仓库中的数据处于使用状态,或准备在近期投入使用。
为什么数据归档很重要?
专为活跃的日常使用而设计的数据存储系统,其维护成本可能很高且过程复杂。此类数据存储被称为主存储。随着企业使用的数据量不断增长,将所有数据保留在主存储中可能会导致效率低下。建立结构化的数据归档策略,可以解决 IT 和数据管理团队面临的几个核心运营挑战:
法律和监管合规性
许多行业都有严格的法规,要求组织保留记录数年甚至数十年。配置得当的数据归档系统可以提供满足 HIPAA 或 GDPR 等法律标准所需的不可篡改且安全的存储环境。数据归档可确保历史数据随时可用,以应对可能出现的任何审计或数据调取请求。
降低成本
主存储提供高速访问能力,因此也是维护成本最高的存储层级。识别非活跃数据并将其迁移到次级、更冷的存储环境中,可以显著降低存储成本。
灾难恢复和业务连续性
当归档数据被配置为以只读、不可篡改的格式存储时,这些机制有助于防范数据窃取、勒索软件攻击或意外删除等事件。
数据生命周期管理
归档是管理信息生命周期(从创建到最终处置)中一个实用且必要的环节。将旧数据系统性地从活跃系统中移出,可以保持系统整洁并有助于维持系统性能。
通过归档静态的历史信息,您还可以有效地将其从定期和日常备份流程中剔除。缩小活跃数据集的规模,能让日常备份更快速、更可靠,并且随着时间的推移更易于管理。
数据归档是如何运作的?
现代数据归档工具将数据管理分为四个阶段:
数据分类和分层
只有在对数据进行分类和“分层”后,数据归档才有效。层级是根据访问需求定义的不同数据存储类别:
- 热存储:频繁访问的主存储
- 温存储:偶尔访问的辅助存储
- 冷存储:很少访问的归档存储
管理员创建自动化数据生命周期策略,以触发存储系统中的归档流程,将数据从热存储层移动到冷存储层。层级间数据移动的规则基于特定标准,例如文件年限、访问频率下降或文件大小。
摄取和传输
数据满足数据迁移策略标准后,便进入摄取和传输阶段。根据组织的需求,其归档系统可以通过在非高峰时段进行计划的批量传输,或者通过连续归档管道来移动数据。持续归档适用于实时应用,例如合规性日志记录或事务审计。在传输之前,系统通常会执行压缩和去重,以最大限度地减少数据占用空间。压缩有助于最大限度地提高存储效率,并通常降低长期成本。
索引和元数据管理
由于检索原始归档文件可能速度慢且成本高昂,因此归档系统会在存储数据之前构建可搜索的索引。这涉及附加元数据或标签,例如文件类型、创建日期、作者和主题。归档系统使用元数据模式来确保数据易于搜索。归档系统还可以应用自动标签和目录条目来描述每个文件的内容。管理员需要特定记录时,可以查询此索引,而无需访问底层归档。
检索
由于归档存储针对成本效益进行了优化,因此访问受检索延迟层级的约束。根据所选的存储类别,检索数据所需的时间可能从几毫秒到几分钟不等,甚至可能长达数小时或数天。现代归档解决方案还支持部分恢复,这意味着您可以仅提取所需的特定文件,而无需恢复整个数据卷。

通常归档哪些类型的数据?
归类为长期存储的数据通常分为三个主要类别之一:
结构化数据
结构化数据具有高度的组织性和严格的格式,使其易于搜索和查询(例如在关系数据库中)。归档结构化数据的常见示例包括历史数据库记录、交易日志和需要保留多年合规性审计的财务记录。
非结构化数据
非结构化数据是不遵循预定义数据模型的任何数据。绝大多数业务数据都属于此类,例如扫描文档、消息、内部文档以及大型媒体文件(例如图像、录音和视频)。
半结构化数据
半结构化数据并不驻留在严格的关系数据库中,但它确实包含有助于组织数据的内部标签、元数据或结构标记。归档的半结构化数据通常包括旧的 JSON 和 XML 日志、历史 IoT(物联网)传感器遥测数据和原始事件日志流。非关系数据库、对象存储和数据湖是通常用于存储半结构化业务数据的系统。
数据归档有哪些关键特征?
数据归档服务遵循几项关键原则。
不可变性
数据一旦归档,便不可更改或覆盖。为了遵循不可变性原则,大多数企业级数据归档解决方案都采用“一次写入,多次读取”(WORM)的存储模式。
持久性
其存储环境专为记录的安全、长期保存而设计,可确保存储时间长达数年甚至数十年。
可检索性
归档数据经过全面索引,管理员可以轻松搜索归档内容并有选择地恢复数据。
成本效益
该系统采用低成本的冷存储层,该存储层经过优化,可存储海量非活跃数据。
受限访问控制
严格的安全权限确保只有获授权人员才能访问或检索敏感的历史记录。审计日志记录哪些用户访问了哪些数据。
数据归档生命周期包含哪些阶段?
数据归档生命周期有助于确保信息从离开主存储到最终被永久删除的整个过程中,都能得到妥善处理。
- 识别:根据数据的价值、敏感度和特定保留要求对数据进行分类。
- 定义策略:针对数据制定必要的规则,包括保留期限、必须遵守的合规性要求,以及不同人员读取和检索数据的访问层级。
- 数据迁移:数据归档服务自动将数据从主存储系统移动到指定的归档存储中。
- 验证:您与服务方共同使用校验和验证等方法来确认数据的完整性。
- 管理:数据归档服务通过持续的索引和访问控制来维护归档数据,并在必要时实施法律保全。
- 处置:系统根据归档策略定义的保留期限,在期限届满后安全地删除数据。
数据归档有哪些关键考量因素?
在将数据迁移到长期归档服务之前,组织必须评估几个关键因素,以确保归档方案满足其运营和合规需求:
合规性与法律保全
不同行业和地区对数据留存的监管要求各不相同。例如,GDPR、HIPAA、PCI-DSS 和 SEC 17a-4 等法规都对记录的保存期限及安全保护提出了明确要求。此外,归档系统还需支持“法律保全”功能,以便在进行中的诉讼或审计期间妥善保存历史数据。
检索服务水平协议(SLA)
权衡总存储成本和检索速度。例如,对于预计不会频繁访问的数据集,您可以利用速度较慢、层级更深的存储类型来降低数据归档成本。但是,您必须制定明确的检索 SLA,以确保在收到请求时,能够在规定的时间范围内恢复数据。
存储格式与长期可用性
在规划长达数十年的数据保留时,必须考虑格式过时的风险。目前使用的专有文件格式,在二三十年后的软件系统中可能完全无法读取。
安全性
安全的归档方案需要对静态数据和传输中的数据进行加密。管理员还必须实施基于角色的访问控制并维护详细的访问日志,以降低数据被篡改的风险。
数据归档的最佳实践有哪些?
为了维护安全且高效的归档系统,请考虑采用以下最佳实践:
- 定义数据保留策略:明确记录哪些数据需要归档、保留期限以及何时销毁数据。
- 实现生命周期转换自动化:利用自动化规则将数据从主存储迁移至归档层。
- 使用开放数据格式:以标准、开放的文件格式存储归档数据,以确保数十年后仍能读取这些数据。
- 使用加密和访问控制:对静态数据和传输中数据进行加密。强制执行零信任访问控制模型,以限制有权访问归档数据的人员。
- 定期测试检索:安排定期的恢复测试。
- 维护访问和修改审计日志:记录访问归档数据的人员及时间。
AWS 如何满足您的数据归档要求?
AWS 提供一系列数据归档服务,旨在满足您的数据保留策略和存储类别要求:
- Amazon S3 Glacier 专为数据归档而构建,为您提供云端性能最高、检索灵活性最强且成本最低的归档存储服务。您可以从三种针对不同访问模式和存储时长进行优化的归档存储类别中进行选择。
- 对于需要立即访问的归档数据(例如医学影像、新闻媒体资产或基因组学数据),请选择 S3 Glacier Instant Retrieval 存储类别。
- 对于不需要立即访问,但需要能够在不产生检索费用的情况下灵活检索大量数据的归档数据(例如备份或灾难恢复场景),请选择 S3 Glacier Flexible Retrieval。
- 对于长期归档存储(例如合规性归档和数字媒体保存),请选择 S3 Glacier Deep Archive。这是云端成本最低的存储服务,数据检索时间在 12 小时以内。
- Amazon S3 Intelligent-Tiering 存储类别旨在优化存储成本,当访问模式发生变化时,它会自动将数据移动到最具成本效益的访问层。
立即创建免费账户,开始在 AWS 上使用数据归档。
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages