跳至主要内容

什么是操作型数据存储?

什么是操作型数据存储?

操作型数据存储(ODS)是一种集中式数据存储库,可收集和存储来自多个事务系统的数据,以支持实时分析。组织通常会为 CRM、会计、销售等业务分别使用不同的软件系统,而这些系统中存有组织运营其他方面的数据。操作型数据存储将来自各种来源的数据整合起来,生成组织当前运营状况的快照。它会持续以原始格式整合数据,并实时更新。商业智能工具可以访问操作型数据存储,对其中的数据进行实时处理。

操作型数据存储有哪些优势?

组织部署操作型数据存储,主要是因为它能够实时整合来自多个来源的数据。否则,若分别在各个独立系统中报告数据,只会得到孤立且不完整的业务运营视图。例如,您可以通过销售 CRM 找到新客户名单,但只有会计系统知道每位客户的订单金额。要找出今天新注册的高价值客户名单,您必须同时查看这两个系统的数据。操作型数据存储恰好能帮您做到这一点,从而实现高级的实时运营智能。其优势包括以下几个方面:

增强决策能力

操作型数据存储让管理者和决策者能够从全局把握业务。借助 ODS 提供的实时洞察,决策可以更有依据、更加及时。组织可以更快地响应不断变化的市场状况和客户需求。例如,当库存水平降至特定阈值以下时,零售企业可以立即对即将售罄的产品推出折扣。

提高数据质量

ODS 可以在多个系统之间实施统一的数据质量检查。它可以发现和纠正错误,并移除重复数据。数据质量得到提升后,用于分析和决策的信息会更加准确、可靠,进而带来更好的结果。

提高运营效率

ODS 能够简化组织内部的数据流转,减少跨不同系统访问和分析数据所需的时间与精力。这种效率提升可以加快运营流程,并减轻 IT 部门的工作负担。团队能够快速获取所需数据,从而更快做出响应,并提高整体生产力。

灵活性和可扩展性

操作型数据存储的设计兼具灵活性和可扩展性,能够适应组织不断变化的数据需求。只需极少改动,就能扩展以接入新的数据流,从而确保数据架构始终稳健,并能支撑组织实现其目标。

操作型数据存储如何运作?

操作型数据存储架构包含多个组件,它们协同工作,共同实现实时数据捕获。

数据摄取层

操作型数据存储中的数据摄取组件负责从各类源系统收集数据,这些源系统可能是您的业务运营系统、事务型数据库,也可能是社交媒体平台或第三方 API 等外部数据源。数据源通过变更数据捕获机制,将数据推送到 ODS。

变更数据捕获(CDC)是一种捕获源系统中增量变更的方法,例如新增条目、现有条目更新或删除。系统会监控源数据库的变化,只有发生变化的数据才会自动传输到 ODS。这种方式能够最大限度减少任一时刻需要移动的数据量,降低网络资源负载,并提升数据摄取过程的效率。

数据摄取组件通过 API 调用、直接连接数据库或其他机制,将数据变更写入 ODS。

数据转换层

该层中的组件会使用预定义映射、数据模型以及对时间敏感的业务规则,将摄取的数据转换为标准格式。它们还可能对数据进行优化,以加快处理和检索速度。例如:

  • 对大型数据集进行分区,优化存储利用率。
  • 为频繁查询的属性创建索引。
  • 为频繁访问的数据设置缓存机制。

这样做的目标是整合数据,提供统一且连贯的运营数据视图,同时最大限度提升检索和报告效率。

数据表示层

该层中的组件让业务用户能够访问并理解数据,从而基于实时数据提炼洞察、做出明智决策。借助用户友好的界面以及可视化和查询工具,业务用户可以独立与 ODS 交互。他们可以运行复杂查询,全面了解当前运营数据。例如,您可以执行以下操作:

  • 创建结构化报告,以清晰易读的格式呈现相关业务指标。
  • 生成交互式图表、图形和仪表板,让复杂数据一目了然、更易理解。
  • 无需具备深厚的技术能力,也能探索数据集,发现其中的模式、趋势和洞察。

该层既支持按计划自动生成运营报告,也支持按需生成报告。

数据治理层

该层中的组件支持全面的数据管理,以满足治理与合规要求。具体包括:

  • 访问控制、加密及其他数据安全机制,用于防止未经授权的访问。
  • 审计跟踪记录,用于实现数据可追溯并支持合规与治理。
  • 数据质量流程,如验证、剖析和监控,用于维护数据完整性。
  • 元数据存储库,用于存储有关数据来源、映射、转换及其他元数据的信息。

这些机制可确保操作型数据存储中的数据使用与组织的整体数据战略保持一致。

操作型数据存储与其他相关数据工程技术有何不同?

数据工程还包括关系数据库、数据仓库、数据湖、数据集市等技术。这些技术大致可分为事务型技术和分析型技术。

事务型技术旨在实时管理和存储日常业务事务。它们针对高并发数据读写、极低延迟的操作进行了优化。相比之下,分析型技术旨在支持数据分析和报告。它们针对数据读取和复杂查询进行了优化,支持对来自不同来源的大量数据进行聚合、汇总和分析。

ODS 充当事务型技术和分析型技术之间的桥梁。它以事务数据为输入,并将其整理为可供分析的形式。不过,与其他分析型技术相比,它可能无法提供同等深度的数据分析能力。

数据仓库

数据仓库是一个中央信息库,可用于分析,从而帮助做出更明智的决策。它可以存储来自各个地方的数据,包括用于归档的历史数据。相比之下,操作型数据存储仅在有限时间内提供有限的信息。例如,ODS 可能只存储过去 12 小时的销售记录。

在数据管道中,ODS 充当数据仓库的另一个数据来源。传统数据仓库不具备 ODS 所拥有的快速、实时分析能力。不过,现代数据仓库能够针对事务数据提供高速、实时的数据可用性,完全消除了对 ODS 的需求。

数据集市

数据集市是一种数据存储系统,专门存放与组织内单个业务部门相关的信息。它只包含公司存储在更大型存储系统中的一小部分选定数据。

数据集市从数据仓库中提取面向主题的信息,而操作型数据存储则将信息发送到数据仓库中进行处理。数据集市提供可供您分析的历史信息,而 ODS 则提供当前运营的最新视图。例如,您可以使用数据集市来识别上个季度的销售模式,同时接收来自 ODS 的每小时销售数据更新。

操作型数据存储有哪些局限性?

尽管操作型数据存储非常适合实时快照报告,但它们无法提供深入的数据仓库分析能力。对于高级用例,您无法运行复杂查询,也无法分析历史数据。

此外,操作型数据存储往往需要频繁维护且不够稳定。数据集成可能中断,或者一旦数据来源格式发生变化,系统可能就无法按预期运行。扩展 ODS 也颇具挑战,有时甚至根本无法扩展。

借助零 ETL 克服局限性

零 ETL 是一套集成方案,让您可以直接在数据仓库解决方案中对事务数据运行分析。通过零 ETL 集成,您可以将来自多个运营系统的数据直接摄取到企业数据仓库,并几乎即时提供用于分析。您无需暂存流数据以进行转换,也无需使用操作型数据存储。无论是实时仪表板、优化游戏体验、数据质量监控,还是客户行为分析等用例,您都能获得更准确、更及时的洞察,而且无需部署多套解决方案。

AWS 如何支持您的操作型数据存储需求?

Amazon Redshift 是一项完全托管的分析服务,可使用 SQL 来分析数据仓库、操作型数据库和数据湖中的结构化与半结构化数据。它依托 AWS 设计的硬件和机器学习技术,能够在任何规模下提供最佳性价比。借助 AI 驱动的大规模并行处理(MPP)架构与零 ETL 方式,您可以将全部数据统一整合,用以支持强大的分析、近实时用例以及 AI/ML 应用。

Amazon Aurora 是一项现代关系数据库服务,可在规模化场景下提供高性能和高可用性;它提供与开源 MySQL 和 PostgreSQL 完全兼容的版本,并配备一系列开发者工具,用于构建无服务器应用和机器学习(ML)驱动的应用。

Amazon Aurora 与 Amazon Redshift 的零 ETL 集成,让您能够使用 Amazon Redshift 对 PB 级事务数据进行近乎实时的分析和机器学习(ML)。事务数据写入 Amazon Aurora 后短短几秒内,零 ETL 就能无缝地在 Amazon Redshift 中提供这些数据,因此无需再构建操作型数据存储。

AWS 会代您完成操作型数据存储和数据仓库的设置、运营及扩展工作,让您能够专注于业务流程。

立即创建免费账户,开始在 AWS 上使用操作型数据存储。

Browse all cloud computing concepts

Browse all cloud computing concepts content here:

正在加载
正在加载
正在加载
正在加载
正在加载

Did you find what you were looking for today?

Let us know so we can improve the quality of the content on our pages