为代理式人工智能构建数据基础的必备指南
简介
大多数组织都在投资人工智能以提高工作效率。许多组织已经实施了一定程度的生成式人工智能,现在正着眼于下一步,即利用代理式人工智能实现复杂工作流程的自动化。
代理式人工智能的成功取决于诸多因素,但其中最重要的莫过于数据基础(使组织中的人工智能代理能够安全高效地处理高质量数据的架构准备、流程和机制)。
人工智能代理与基于查询和响应模式的传统数据工作流程有明显的不同,前者能够独立推理、规划和执行复杂任务,从而在极少人工干预的情况下实现预定目标。为了实现最佳预期结果,人工智能代理需要发现并访问高质量数据。它们需要在合适的上下文、内存和延迟条件下运行,才能快速提供相关结果。由于它们能够自主处理大量数据,因此数据治理至关重要。
为代理式人工智能构建数据基础是一个循序渐进的过程,并不意味着从零开始。您可以从自身现状出发,并在构建过程中评估当前能力的局限性。根据您当前的状况部署人工智能代理可以帮助您确定投资的优先领域。
本指南围绕一些关键问题展开,旨在帮助您了解人工智能代理需要怎样的数据基础。
问题 1:您的数据基础是否为互操作性而构建?
数据通常分散在各个业务部门、遗留系统和供应商平台。这通常是由于分散的采购决策、各业务部门需求的差异以及业务的快速增长造成的。然而,这会导致数据孤岛的形成,而克服这些数据孤岛的成本可能很高,而且过程也十分繁琐。此外,由于底层系统是为支持特定的、已定义的访问模式而构建的,因此扩展以支持人工智能代理带来的额外负载变得十分困难。基于开放标准构建的数据基础架构使组织能够大规模地让人工智能代理访问其数据,同时在整体架构中规划未来的灵活性。
开放表格式
Apache Iceberg 等开放表格式(OTF)为数据湖带来了类似数据库的功能,包括 ACID 事务和数据结构演进的能力。至关重要的是,OTF 实现了互操作性,这意味着任何兼容的工具、引擎或人工智能代理都可以安全地处理相同的数据,而无需重新格式化或复制数据。这一点尤为重要,因为人工智能代理需要跨多个引擎和工具运行才能完成工作流程。
开放表格式(OTF)也是数据湖仓架构的基础,它将基于 OTF 的数据湖与集中式治理层相结合,使其能够像数据仓库一样运行。数据湖仓架构具有可扩展性、灵活性,并提供统一的数据存储和处理系统。它们能够更轻松地将数据集整合为可重复使用的模式(通常称为数据产品),并具有广泛的分析工具兼容性和集中式访问控制。
开源软件
PostgreSQL(用于事务性数据)、Apache Kafka(用于数据流式传输)、Apache Spark(用于数据处理)和 OpenSearch(用于搜索)等开源技术为组织提供了经过验证且广泛采用的构建模块。由于这些技术基于开放标准构建,并拥有广泛的社区支持,因此人工智能代理可以受益于更广泛的公开代码、文档和其他信息,从而做出更准确的决策。
开放协议
开放协议为人工智能代理之间以及与周围环境的交互提供了一种标准化的方式。模型上下文协议(MCP)将人工智能代理连接到外部数据来源、工具和 API,以便它们可以检索上下文并采取行动。Agent2Agent 协议(A2A)使基于不同框架构建的人工智能代理能够相互通信。这些协议共同作用,意味着人工智能代理可以从推理链中的多个数据来源获取信息,并将任务移交给其他人工智能代理。
问题 2:您的人工智能代理能否发现正确的数据?
人工智能代理需要能够找到适合其使用案例的数据,并且通常需要在单个工作流程中使用多种数据类型。这些数据包括结构化数据(例如客户记录、交易和库存水平)、存储在 HTML、JSON 或 XML 文件中的半结构化数据,以及非结构化数据(例如文档、支持工单或电子邮件存档)。当数据分散在不同的系统和格式中时,人工智能代理必须能够定位并评估每一种数据。
数据目录在帮助人工智能代理发现可用数据、数据含义以及数据存储位置方面发挥着重要作用。数据目录包含元数据,元数据是对数据的描述性信息,包括模式、数据类型、世系、新鲜度和所有权。这对于帮助人工智能代理理解数据来源中包含哪些数据尤为重要。
当组织出于性能、合规性或业务原因维护多个目录时,目录联合身份验证人工智能代理发现跨系统存储的数据。一些组织更进一步,将结构化、半结构化和非结构化数据整合到单个存储层中。这简化了数据发现过程:减少了人工智能代理需要查找的位置,并提供了一种统一的方法来查找和评估各种类型的数据。
问题 3:您的数据是否已为人工智能代理做好充分准备?
在人工智能代理能够有效利用数据之前,通常需要对数据进行清洗、丰富和转换。原始数据可能包含不一致的格式、缺失值或冗余记录,这些都会降低人工智能代理的推理准确率。尽管人工智能代理可以在运行时执行一些数据准备工作,但数据转换工具和管道能够可靠地大规模处理数据准备工作。用于代理式人工智能的数据转换管道还可以包括向量嵌入生成、用于检索增强生成(RAG)的数据分块、元数据生成和丰富以及数据质量检查。
分层数据架构可用于为人工智能准备高质量、可信的数据。这种方法通常在数据湖仓中实施,其中 OTF 提供维护各层之间一致性所需的事务保证。该方法根据数据使用准备情况将数据组织成不同的区域:原始区域,用于存放来自源系统的原始数据;清洗区域,用于存放经过验证和标准化的数据;以及精选区域,用于存放针对下游使用优化的业务就绪数据集。这提供了一种结构化的方法来清洗和格式化数据,以便其满足预期用途。
许多人工智能代理依赖于能够反映当前状况的高质量数据。直接连接到业务数据库是确保人工智能代理能够获取与应用程序相同的最新信息的一种方法。对于依赖多个数据来源且需要近乎实时响应的使用案例,或者当直接访问业务数据库会带来性能或安全风险时,可以使用流式传输管道持续接收事件和更新。流式传输管道使用变更数据捕获(CDC)流程来捕获业务数据库中的变更,并将其发布到事件流中,以便其他下游系统能够使用,这通常只需几毫秒即可完成。
在将流式数据传递给人工智能代理之前,组织应考虑对传入的数据事件应用确定性清洗规则。这些规则可以快速发现较大的质量问题,并与人工智能代理协同工作,后者可以捕获确定性规则未过滤掉的数据中的细微质量问题。
问题 4:您的数据基础能否大规模实现数据和人工智能治理?
实施数据和人工智能治理是确保人工智能代理能够在高质量数据上安全可靠运行的关键初始步骤。治理对于人工智能代理尤为重要,因为它们会动态地发现和访问数据以做出决策,如果缺乏适当的控制措施,则会增加泄露敏感数据或访问超出其预期范围的资源的风险。
数据敏感度和访问管理
一般来说,尤其是在高度监管的环境中,应审核数据的敏感度并对其进行适当的标记和分类,高度敏感的信息应保留在安全的环境中。访问管理应遵循最低权限原则,这意味着仅应授予完成任务所需的信息访问权限。应密切监控授予的任何角色和访问权限,并确保其可撤销,以确保大规模安全性。
审计、世系和可观测性
有效的治理实践对于审计和合规性尤为重要,这通常需要记录所采取的操作并能够解释决策的原因。世系跟踪通过记录访问了哪些数据以及如何转换数据来实现问责。这使得审计人工智能代理所遵循的数据路径成为可能。可观测性通过实时监控人工智能代理的行为、跟踪其正在采取的行动、检测异常情况并标记策略违规行为来补充世系跟踪。
数据质量
稳健的数据治理实践可为持续获得高质量数据奠定基础。治理可确保正确的流程和策略到位,从而有效地管理数据访问,数据质量则指数据本身的准确性、可靠性和实用性。对于在多步骤推理链中自主运行的人工智能代理而言,数据质量差可能会导致级联错误。评估其用于代理式人工智能的数据基础的组织应考虑实施一个数据质量框架,该框架应针对每个使用案例解决完整性、一致性、准确性、相关性和及时性等核心维度。
安全与责任
随着人工智能代理承担更多自主决策任务,底层数据基础的安全性变得更加重要。组织应确保人工智能基础设施、数据和模型免受未经授权的访问和恶意攻击,具体措施包括加密、网络隔离、访问控制和威胁检测。
同样重要的是确保人工智能代理以负责任的方式运行。信任护栏有助于降低人工智能代理生成有害内容或虚假信息、泄露敏感信息以及产生幻觉的风险。这些保障措施可以帮助组织在部署人工智能代理的同时,满足监管和道德标准。
问题 5:人工智能代理能否理解贵组织的上下文?
尽管人工智能代理可以仅基于通用知识运行,但大多数组织通过利用组织特定上下文定制人工智能代理,可以获得更大的价值。这有助于人工智能代理在业务中做出更明智的决策,保持信息的时效性,并减少幻觉。
用于定制人工智能代理的领域特定数据通常存储在知识库中。RAG 是指从这些知识库中检索信息,并增强大语言模型(LLM)提示,从而使人工智能代理能够生成更及时、更相关的响应的流程。RAG 的实施通常依赖于向量嵌入,即捕捉文档、图像和支持文章等内容语义的数值表示。基于嵌入的检索并非精确匹配关键字,而是查找上下文相似的内容,这使得人工智能代理能够处理存储在难以查询的来源中的大量组织知识。
语义层通过帮助人工智能代理理解业务逻辑来补充 RAG。它们定义表关系、业务指标和共享术语,确保人工智能代理能够跨团队一致地解读“收入”或“活跃客户”等术语。语义层可以基于本体和知识图谱、维度模型、表关系以及指标定义构建,这些定义映射了指标、逻辑及其互连联系,并将意图转化为业务定义。
问题 6:人工智能代理是否拥有维护上下文和有效协调所需的内存?
上下文可帮助人工智能代理在当下做出相关的决策,而内存则可帮助其了解过去。LLM 是无状态的,这意味着每个请求到达时都不会记住之前发生的事情。如果没有在其之上叠加内存架构,人工智能代理就无法进行推理、适应或协调,并且会因为反复推导出相同的答案而浪费时间和资源。由于人工智能代理在一个循环(推理、行动、记忆、重复)中运行,内存可以防止重复工作,并在迭代过程中保持进度的连贯性。上下文和内存共同作用,使人工智能代理从一次性的、单回合的响应者转变为能够随着时间积累专业知识的系统。
代理内存存在于一个连续体上。短期内存位于左侧,被频繁、高速访问。中期内存位于中间,在代理需要时通过工具检索。长期内存位于右侧,配置频率较低,更像是基础设施。每种类型都有其独特的访问模式、延迟要求和数据管理职责。
短期内存
这是代理的工作内存,类似于 RAM。它保存当前对话轮次、最新的工具结果、多阶段工作流中的活动步骤,以及任务完成后重置的瞬态状态。Strands Agents 和 LangGraph 之类的框架通常会为您管理这一层,但底层存储必须提供微秒级的读取延迟,因为即使在单次交互中,代理也会频繁访问此内存。
短期内存还可扩展到人工智能代理之间的共享状态。当多个人工智能代理协作完成一项任务时,共享文件系统允许其交换中间结果并以低延迟访问维护检查点。
中期内存
这是与现有数据工具和系统(包括数据湖、目录和知识库)关系最密切的层。它涵盖人工智能代理在执行期间通过工具调用检索的事实、关系和经验,也是汇集大部分数据准备工作的位置。它包括以下内容:
-
语义内存保存关于事实、概念和关系的结构化知识,无论这些知识是在何时、何地获得的。这是一个长效知识库,人工智能代理可以使用它来对全新场景开展推理,无需从头推导答案。数据库、向量存储、知识图谱和数据仓库都可作为语义内存的后端。
-
用户配置文件内存捕获人工智能代理所服务对象的持久身份信息,包括偏好、沟通风格、过往选择以及用于跨会话个性化行为的累积属性。
-
情景内存保存特定事件和交互的时间戳记录。语义内存是抽象的,而情景内存是具体的。它使人工智能代理能够回忆起先前系统中某种方法失败的情形,并据此进行调整。这使人工智能代理能够在部署过程中不断改进,而无需持续重新训练。会话日志、交互历史记录和事件存储都为情景内存提供数据。
中期内存与短期内存的关键区别在于,前者存在于上下文窗口之外,需要通过工具访问。人工智能代理可以决定何时需要信息并调用相应的工具,这意味着数据来源必须易于发现且响应迅速,足以保证推理循环持续进行。
长期内存
这是变化最少的一层,它从根本上塑造了人工智能代理的自我意识及其做出的决策。长期内存包括系统提示、护栏、人工智能代理角色定义以及程序例程。当创建一个人工智能代理来扮演保险承保代理人的角色时,相关的指令以及它必须遵循的规则、约束和行为边界都会存储在此处。这一层还包含程序性内存,它会对人工智能代理的技能和例程编码,使其无需在每个步骤进行思考即可获得内置的操作知识。长期内存构件可以作为基础设施即代码进行管理,并存储在版本控制的代码库、配置管理系统或键值存储中。
问题 7:您的数据基础是否支持持续的低延迟响应?
传统应用程序的工作流程遵循固定的、确定性的路径。当用户完成一项任务时,系统会对数据库执行相同顺序的查询。这使得索引调优、结果缓存和容量预测具有可预测性。然而,人工智能代理每次完成同一任务时,都可能采用不同的路径,并根据其对中间结果的推理选择不同的查询。这种可变性使得预测负载和有效优化查询模式更具挑战性。
在某些情况下,可以使用语义缓存来解决这个问题。缓存会返回语义相似的请求的已存储响应,而不是触发新的调用。这可以降低成本、提高性能并增加代理应用程序的吞吐量。
为了进一步支持人工智能代理的不可预测性,底层基础设施应构建为可自动扩展。无服务器架构无需预先分配资源;不必按最大容量来规划基础设施规模,资源会根据需求自动扩缩,无需人工干预。这对于人工智能代理尤为重要,因为它们的行为可能具有突发性。当任务启动、工具调用或工作流扩展时,活动可能会突然激增,然后回落至零。由于无服务器容量是按需提供的,因此可以减少资源浪费,企业只需为实际使用的资源付费。
除了利用无服务器资源满足需求外,企业还应优先考虑具有自动失效转移和冗余功能的高可用性基础设施,以支持持续正常运行时间。当这些措施到位时,即使单个组件发生故障,也不会中断人工智能代理完成其工作的能力。
为代理式人工智能构建数据基础
为代理式人工智能准备数据基础可能是您在这十年承担的最重要的项目。本指南中的问题代表了您的数据基础有效支持人工智能代理所需的关键能力:互操作性、发现、数据准备、治理、上下文、内存和低延迟。目前很少有组织能够完全具备所有这些能力,这也在意料之中。为代理式人工智能构建数据基础是一个循序渐进的过程,您增强的每项能力都会提升人工智能代理所能提供的价值。AWS 针对上述每个领域都提供了专门构建的服务,以帮助您构建、扩展和运营代理式人工智能的数据基础。
入门
20 多年来,数百万客户信赖 AWS 提供安全、可靠且可扩展的云服务,并具备业界领先的性价比。下面将介绍 AWS 如何为您的代理式人工智能数据基础提供支持。
开放数据架构
AWS 采用开放标准,因为它们能够为客户提供灵活性和最佳价值。这包括通过 Amazon Aurora 和 Amazon Relational Database Service(Amazon RDS)提供的 PostgreSQL、通过 Amazon Managed Streaming for Apache Kafka(Amazon MSK)提供的 Apache Kafka、通过 Amazon OpenSearch Service 提供的 OpenSearch、通过 Amazon EMR 提供的 Apache Spark,以及通过 Amazon Athena 提供的 Trino。AWS 在 AWS Analytics 堆栈中提供原生 Apache Iceberg 支持,包括通过 Amazon S3 表类数据存储服务提供的完全托管的表类数据存储,使人工智能代理能够互操作地访问分析数据,而无需重新格式化或复制数据。AWS 还支持开放代理协议(包括 MCP 和 A2A),使人工智能代理能够连接到数据来源、工具以及相互连接。
“让 Amazon Web Services 这样的公司来支持开源产品,并照顾到高可用性、可扩展性和整体数据管理等重要属性,这种想法太棒了。”
—BMC Helix ITSM 研发高级副总裁 Raj Cheruvu
为人代理式人工智能堆栈的每一层量身定制的服务
本指南涵盖的功能(从数据准备到内存和低延迟性能)需要能够持续大规模运行的基础设施。AWS 提供久经考验的可靠性、可扩展性和性价比,让您可以在卓越的基础上进行构建。
为了帮助确保数据为人工智能代理做好充分准备,AWS Glue 提供大规模的无服务器数据集成和转换,让您可以轻松地发现、准备、移动和集成来自多个来源的数据。AWS Glue 数据质量自动监测功能是 AWS Glue 的一个无服务器开源组件,可让您直接在数据管道中衡量和监控数据质量并强制执行质量规则。
对于近实时数据,AWS 提供了一套托管服务,可实现端到端的流式传输数据管道。Amazon Kinesis Data Streams 和 Amazon MSK 可以处理高吞吐量数据摄取,适用于 Apache Flink 的亚马逊托管服务提供流式处理,Amazon Data Firehose 则将数据传输到目标位置,帮助人工智能代理在条件变化时对高质量的最新数据进行推理。
为了支持上下文信息,AWS 数据库(包括 Amazon Aurora、Amazon RDS、Amazon Neptune 和适用于 Valkey 的 Amazon ElastiCache)提供原生向量支持,用于 RAG 检索,从而在查询时为人工智能代理提供快速、相关的上下文信息。Amazon OpenSearch Service 为代理式人工智能、搜索和分析提供了一个托管的开源检索引擎。它将向量检索、词汇检索、混合检索和代理式检索整合到单个系统中,在 PB 级规模下以低延迟提供高度相关的结果。
对于存储优先的替代方案,Amazon S3 Vectors 可以将上传、存储和查询向量的总成本降低高达 90%,从而使创建和保留大型向量数据集在经济上可行,这些数据集可以改善人工智能代理的内存和上下文信息。
“AWS 的基础设施为我们奠定了基础,使我们能够专注于真正重要的事情。我们构建了像人类一样推理的视频人工智能:它不仅理解发生了什么,还理解为什么这件事很重要,以及各个时刻是如何跨越时间相互联系的。”
—TwelveLabs 首席执行官兼联合创始人 Jae Lee
眼见为实——TwelveLabs 利用 S3 Vectors 为世界释放视频的全部潜力
AWS 数据库产品组合跨越了内存连续体的三个区域。适用于 Valkey 的 Amazon ElastiCache 可提供代理式人工智能所需的微秒级延迟,用于缓存工具结果、保留会话上下文并维持驱动连贯多步骤推理的短期工作内存。Amazon DynamoDB 能够处理情景日志记录和会话状态跟踪中频繁追加的写入模式,在任何吞吐量下都能实现个位数毫秒级的读取速度。Amazon Aurora 和 Amazon RDS 非常适合长期内存,尤其适用于持久化多步骤任务进度。Amazon Neptune 为基于图的语义内存和情景内存提供支持,用于关系遍历。
为了支持人工智能代理之间的状态共享,Amazon S3 Files 提供对 Amazon S3 中数据的低延迟文件系统访问,使代理能够交换中间结果并在多代理管道中维护检查点。这些服务共同涵盖了内存连续体中的所有延迟层级、写入模式和持久性要求,因此您可以构建可扩展且性能无损的内存架构。了解 Trend Micro 如何使用 Amazon Neptune 构建具有短期和长期内存功能的 AI 安全助手。
AWS 数据库服务旨在自动扩展并适应实时工作负载变化,因此非常适合人工智能代理生成的多变且突发的工作负载。Amazon DynamoDB 和 Amazon ElastiCache 每秒可响应数亿个请求,同时实现微秒级到个位数毫秒级的延迟预算;Amazon Aurora 可即时扩展,并完全兼容 PostgreSQL 和 MySQL,能以十分之一的成本提供与商业数据库相同的性能、可用性和可扩展性。
如果您的组织在本地或 Amazon EC2 上运行 SQL Server 或 Oracle 等商业数据库,那么构建 AI 就绪型数据基础的第一步就是将其迁移到 Amazon RDS。利用您的商业数据资产赢得代理式人工智能阐述了 Amazon RDS 如何提供代理式人工智能应用所需的自动化管理、高性能、高可靠性和安全性。IDC 的研究报告 Amazon RDS 的商业价值则展示了迁移到 RDS 的财务影响:三年投资回报率高达 258%,受访机构的服务质量也显著提升。
值得信赖的 AI 基础
能够动态发现和访问数据以制定自主决策的人工智能代理需要能够随之扩展的治理和安全保障。AWS 旨在成为最安全的云基础设施,默认启用数据加密,并提供可扩展至人工智能代理的细粒度访问控制。AWS 数据治理确保只有合适的用户才能访问合适的数据,访问控制符合策略和安全标准。内置的合规性功能支持不断变化的全球法规,而系统化的验证流程则可维护治理良好的数据管理,为可信 AI 提供保障。AWS 致力于提供可信赖且富含上下文信息的数据,确保数据在人员、人工智能代理和应用程序之间安全流动,即使是最敏感的工作负载也不例外。
找到今天要查找的内容了吗?
请提供您的意见,以便我们改进网页内容的质量