Amazon CloudWatch Omni
面向人工智能时代的可观测性
Amazon CloudWatch Omni 是 Amazon CloudWatch 的下一个演变:一种重新构想的可观测性体验,由人工智能驱动,建立在开放标准之上,在 AWS 管理控制台之外交付。CloudWatch Omni 专为人工智能时代而构建,将对智能体、应用程序和基础设施的监控统一到一个解决方案中。
您运行的一切都只有一种体验
您的应用程序和智能体终于共享一个视图。CloudWatch Omni 将基础设施和智能体的可观测性融合到单一体验中,通过企业 SSO 在 IDE 或 Omni Web 用户界面中交付。自动发现的拓扑可以映射各个账户和区域的服务、依赖项和黄金指标,无需手动配置。只需通过 OTLP 进行一次检测,也可以使用现有的 CloudWatch 遥测数据,无需重新配置。最终用户不需要 AWS 管理控制台。
放心交付智能体
评估驱动的可观测性为您提供了每次智能体调用的持续质量分数,涵盖正确性、可信度以及工具选择的准确性。跟踪完整的执行路径,在客户之前发现无声的回归。针对生产流量进行在线评估,对捕获边缘案例的版本化数据集进行离线评估。质量分数作为一流信号,与您的跟踪和指标并列存在,而不是放在单独的工具中。使用 Amazon Bedrock AgentCore 内置评估器或自备评估器。
自带堆栈
只需通过 OTLP 进行一次检测,保留您已经使用的智能体框架,比如 LangChain、CrewAI、Strands 和 OpenAI SDK。从 AgentCore 内置评估器、Braintrust、DeepEval、Ragas 或自定义 LLM-as-a-judge 中进行选择。在开发和生产中使用相同的评估器界面,这样您的投资就可以继续使用。原生支持 Python 和 TypeScript,任何运行时都可通过 OTLP 到达,并且没有专有格式或供应商锁定。
从一开始就有答案
停止仅仅为了提问而构建控制面板。应用程序拓扑显示了智能体及其所依赖的服务、API 和基础设施。用通俗易懂的英语提问,让人工智能助手指导您进行从症状到根本原因的调查。跨指标、跟踪和日志为您生成 SQL 和 PromQL。原生警报会在您的遥测数据满足条件时触发,并路由到 Amazon SNS 和 Slack。
从头开始使用人工智能进行构建
每项可观测性任务背后都有智能。CloudWatch Omni 生成查询,关联指标、跟踪和日志中的信号,并推动由 AWS DevOps 智能体提供支持的调查。工程师和人工智能助手在共享会话中共同调查,因此下一个人在已经具备完整上下文的情况下加入。随着应用程序的发展,系统会自动发现服务、映射依赖项并调整警报。
客户和设计合作伙伴
Sony Group Corporation
“在 Sony,我们的企业级智能体人工智能平台现在支持数百个概念验证和生产工作负载。在这个规模上,可观测性和评估至关重要。有了 Amazon CloudWatch Omni,我可以从单一跟踪直接转到评估、人工智能分析、比较或数据集创建,一切都可以。单击一下即可根据实时跟踪创建数据集的能力尤其令人印象深刻。组装用于评估的数据集通常是业务方面的瓶颈,而能够直接从跟踪中创建数据集可以显著降低这一门槛。此外,能够在我的开发环境中无缝处理本地和云数据,这使得整个体验非常易于使用。”
Sony Group Corporation 数字与技术平台人工智能加速部高级总经理 Masahiro Oba
Crest Data
“Amazon CloudWatch Omni 为客户所需的智能体提供了强大的端到端可观测性。零配置跟踪捕获非常可靠,包括多智能体支持、无需手动设置和 IDE 支持。令牌数量可以准确地聚合各种检测惯例,而涵盖数据集策划、LLM-as-judge 评估器和人工注释的“评估”支柱是端到端工作的。总体而言,Amazon CloudWatch 为全面的可观测性功能提供了坚实的基础,并且在智能体可观测性领域具有持续创新的巨大潜力。”
Crest Data 工程总监 Nirav Kelaiya
Capital One
“Capital One 运营着金融服务领域最大的可观测性足迹之一。作为 Amazon CloudWatch Omni 的设计合作伙伴,我们帮助设计了一个由人工智能驱动的可观测性解决方案,该解决方案将为我们的工程师提供从单一表面对所有遥测数据进行拓扑感知情报和自然语言查询,并通过 OpenTelemetry 获得全部数据所有权。对于大规模的 AIOps 和韧性,这是一种截然不同的运营模式。”
Capital One 云平台和韧性工程执行副总裁 Parvez Naqvi
使用案例
在一个视图中查看您运行的所有内容
自动发现的拓扑可以映射各个账户和区域的服务、依赖项和黄金指标。使用自然语言提问,让人工智能指导您的调查,通过企业 SSO 在 AWS 管理控制台之外开展工作。CloudWatch Omni 围绕服务和用户旅程而不是单个资源来组织控制面板,为您提供以应用程序为中心的视图,反映您的团队对系统的实际看法。
无论您的工作负载跨一个账户还是跨多个区域的数百个账户,拓扑都是自动构建的,无需手动配置或标记。操作员可以获得统一的起点,无需在脑海中将来自彼此割裂的控制台的信号拼接在一起。
通过人工智能驱动的调查查询所有遥测数据
使用 SQL、PromQL 或普通英语查询日志、指标和跟踪。人工智能助手关联信号,并指导您从症状定位到根本原因。AWS DevOps 智能体充当您的内置调查员。问一个问题,比如“为什么结账服务的延迟会激增?”,智能体会将相关的日志、指标和跟踪汇总在一起,引导您逐步完成分析。
原生警报会将调查发现路由到 Amazon Simple Notification Service 和 Slack,这样您的团队就会在出现问题降级时收到通知。与其在每种遥测类型的不同工具之间切换上下文,不如在一个地方搜索所有信号,让人工智能显示原本需要花费数小时手动查找的连接。
通过根据真实世界的跟踪进行评估,而不是综合测试,从而更快交付
评估会针对实时流量持续运行,因此您可以在警报中先于客户发现质量下降。操作员可以将延迟、错误、成本和评估分数作为一流信号在整个实例集中获得可见性。
针对生产流量运行在线评估,对捕获边缘案例的版本化数据集进行离线评估,这些数据集由 Amazon Bedrock AgentCore 以及 Braintrust、DeepEval、Ragas 和自定义 LLM-as-judge 评估器等集成提供支持。测量每次智能体调用的正确性、可信度、幻觉、毒性和工具选择的准确性。质量分数作为一流的可观测性信号与您的跟踪和指标并存,而不是在单独的工具中,因此您可以像对错误率或 p99 延迟发出警报一样,设置评估回归警报。
使用完整的执行上下文在几秒钟内修复损坏的智能体
当某些内容失败时,直接在编写代码的地方获取跟踪、会话路径和根本原因。人工智能辅助调试取自实际生产信号,因此您无需切换上下文即可更快地解决问题。CloudWatch Omni 为 VS Code、Kiro 和 Cursor 提供扩展,为您的开发工作流程带来全面的可观测性。
直接在编辑器中跟踪完整的智能体执行路径,从每次 LLM 调用、工具调用到推理步骤。由于支持 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Vercel AI SDK 和 Strands 等跨框架的 Python 和 TypeScript,您无需离开构建智能体的环境即可对其进行检测、测试和调试。
同时观测智能体及其交互的应用程序
智能体调用 API,从知识库中检索并在基础设施上运行。CloudWatch Omni 使用自动发现的拓扑和黄金指标在单一视图中显示智能体和应用程序组件。全栈关联将智能体推理与应用程序运行状况再到基础设施联系起来,因此,当智能体产生的响应不佳时,您可以将问题从评估分数到检索调用,跟踪到下游 API,再到计算层,所有这些都无需切换工具。
这种统一视图至关重要,因为智能体不是孤立运行的;它们依赖于与应用程序相同的服务、数据库和网络,任何一层的故障都可能级联成智能体行为降级,而传统的孤立监控永远无法发现这种问题。
找到今天要查找的内容了吗?
请提供您的意见,以便我们改进网页内容的质量