跳至主要内容

Amazon EC2

Amazon EC2 G7e 实例

基于 NVIDIA GPU 的高性能实例,适用于 AI 推理、科学计算和空间计算工作负载

为什么选择 Amazon EC2 G7e 实例?

由 NVIDIA RTX PRO™ 6000 Blackwell 服务器版 GPU 加速的 Amazon Elastic Compute Cloud(Amazon EC2)G7e 实例可为生成式人工智能推理工作负载提供经济高效的性能,并为空间计算工作负载提供顶级性能。相较于 G6e 实例,此款实例的 GPU 内存翻倍(96 GB)、GPU 显存带宽提升 1.85 倍、GPU 间通信带宽最高提升 4 倍,Elastic Fabric Adapter(EFA)网络带宽同样提升 4 倍。G7e 实例的推理性能最高可达 G6e 实例的 2.3 倍。

客户可以使用 G7e 实例来部署大语言模型(LLM)、代理式人工智能模型、多模态生成式人工智能模型和物理人工智能模型。此外,G7e 实例可用于加速包括空间计算、科学计算在内的各类工作负载。

G7e 实例配备多达 8 个 NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU,GPU 总内存达 768 GB(每个 GPU 96 GB 内存),并搭载第五代英特尔至强可扩展处理器(Emerald Rapids)。G7e 实例最高支持 192 个 vCPU、1600 Gbps EFA 网络带宽、2 TiB 系统内存以及 15.2 TB 本地 NVMe SSD 存储。

优势

    G7e 实例的推理性能最高可达 G6e 实例的 2.3 倍。NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU 的内存带宽为 G6e 实例的 1.85 倍,可支持用户部署实时代理式人工智能与多模态 AI 推理工作负载。相较于 G6e 实例,G7e 实例的 CPU 至 GPU 带宽最高提升 4 倍,可提升推荐系统与检索增强生成(RAG)工作负载的推理性能。此外,更高的 GPU 间带宽以及基于 PCIe 实现的 NVIDIA GPUDirect P2P 技术支持,让 G7e 实例能够在多 GPU 环境下运行更大规模模型的推理任务。

    NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU 搭载第四代 NVIDIA 光线追踪核心,专为基于神经图形的技术打造,同时配备针对神经着色器进行优化的全新流式传输处理器。G7e 实例的核心 TFLOP 性能为 G6e 实例的 1.7 倍,可为空间计算工作负载以及机器人仿真、虚拟形象聊天助手、数字孪生等图形与人工智能融合类工作负载提供顶级性能。G7e 实例可以为同时需要图形处理能力与人工智能的应用场景提供经济高效的高性能。

    相较于 G6e 实例,G7e 实例的 TFLOP 性能最高提升 1.27 倍、GPU 内存翻倍、GPU 间带宽最高提升 4 倍。这使其非常适合用于对自然语言处理(NLP)、计算机视觉及中小型生成式人工智能模型进行经济高效的单节点微调或训练。此外,这款实例的 EFA 网络带宽较 G6e 实例提升了 4 倍(达到 1600 Gbps),并且支持多 GPU 实例的 NVIDIA GPUDirect RDMA 技术,使客户能够使用 G7e 实例开展小规模多节点模型微调和训练。

    G7e 实例基于 AWS Nitro System 构建,该系统是专用硬件和轻量管理程序的组合,几乎将主机硬件的所有计算和内存资源都提供给您的实例,从而提供更好的整体性能。借助 G7e 实例,Nitro 系统可以在穿透模式下预置 GPU,从而提供与裸机相当的性能。AWS Nitro System 配备专用的硬件和固件,旨在实施访问限制,以便防止包括 AWS 内部人员在内的任何人访问您的敏感人工智能工作负载和数据。此外,在保持运行状态的同时,处理网络、存储和其他 I/O 功能的 Nitro System 可以部署固件更新、错误修复和优化技术。该特性能够提升系统稳定性、减少停机时间,对在生产环境部署人工智能应用程序至关重要。

功能

    G7e 实例最高搭载 8 个 NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU。单个 GPU 提供 96 GB GDDR7 内存,内存带宽可达 1597 GB/s。该 GPU 搭载第五代 NVIDIA 张量核心,支持 FP4 精度计算,可提升 AI 运算速度并降低 GPU 显存占用;配备第四代 NVIDIA 光线追踪核心,可充分发挥 RTX 巨型几何架构等神经图形技术优势;搭载全新流式处理器,可在可编程着色器中集成神经网络能力。此外,每个 GPU 均内置 4 台第九代 NVENC 编码引擎和 4 台第六代 NVDEC 解码引擎,支持 4:2:2 格式编解码。该 GPU 还兼容 DLSS 4.0 多帧生成技术。

    借助 EFA 和集群放置组,G7e 实例最高支持 1600 Gbps 网络带宽,带宽规格为 G6e 实例的 4 倍。多 GPU G7e 实例支持在 EC2 UltraClusters 中通过 EFAv4 支持 NVIDIA GPUDirect RDMA 技术,相较于 G6e 实例,能够有效降低小规模多节点工作负载的延迟。同时,G7e 实例还支持基于 PCIe 的 NVIDIA GPUDirect P2P,可满足多 GPU 架构下机器学习推理与图形密集型应用的低延迟需求。

    G7e 实例最高配备 2048 GiB 系统内存和 15.2 TB 本地 NVMe SSD 存储。可在本地存储大型模型和数据集,用于机器学习推理、模型微调和训练。G7e 实例的 GPU 和本地存储间带宽是 G6e 实例的 4 倍,使客户能够将模型从本地存储快速加载或置换至 GPU 内存。此外,多 GPU G7e 实例通过 FSx for Lustre 支持 NVIDIA GPUDirect 存储技术,相较于 G6e 实例,进一步提升了实例整体数据吞吐能力。

    G7e 实例可为客户提供 NVIDIA RTX Enterprise 和游戏驱动程序,无需额外付费。NVIDIA RTX Enterprise 驱动程序可用于为各种图形密集型工作负载提供高质量虚拟工作站。NVIDIA 游戏驱动程序可为游戏开发提供无可比拟的图形和计算支持。此外,G7e 实例还支持 CUDA、cuDNN、NVENC、TensorRT、cuBLAS、OpenCL、DirectX 11/12、Vulkan 1.3 和 OpenGL 4.6 库。

产品详细信息

实例类型

实例大小
GPU
GPU 内存(GB)
vCPU
系统内存(GiB)
实例存储(TB)
EBS 带宽(Gbps)
网络带宽(Gbps)
g7e.2xlarge

1

96

8

64

1.9 x 1

最高 5

50

g7e.4xlarge

1

96

16

128

1.9 x 1

8

50

g7e.8xlarge

1

96

32

256

1.9 x 1

16

100

g7e.12xlarge

2

192

48

512

3.8 x 1

25

400

g7e.24xlarge

4

384

96

1024

3.8 x 2

50

800

g7e.48xlarge

8

768

192

2048

3.8 x 4

100

1600

客户评价

Agility Robotics

“Agility Robotics 的使命是打造可辅助人类作业的机器人伙伴,最终让人类更有人性。Agility 突破性的双足人形机器人 Digit,是全球首款以人为核心的通用工作机器人。搭载 NVIDIA RTX PRO 6000 Blackwell GPU 的 Amazon G7e 实例兼具高速度和大容量内存,能够帮助我们更快地为人形机器人训练高性能全身控制。它们是目前大规模开展机器人仿真到现实强化学习的最佳设备。”

Pras Velagapudi - Agility Robotics 首席技术官

Missing alt text value

Synopsys

Synopsys 是从芯片到系统全链路工程解决方案领域的领军企业,可帮助客户快速开创人工智能赋能型产品。该公司提供业界领先的硅设计、IP 以及仿真和分析解决方案。

“Synopsys 的仿真分析软件可用于预测各类产品的实际表现,覆盖结构分析、流体动力学、电子设备等多领域仿真场景。工程师需要平衡多项相互制约的设计指标,这不仅需要高精度的设计工具,还需要缩短仿真耗时。相较于上一代实例,搭载 NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU 的 Amazon EC2 G7e 实例大幅提升了 Ansys Fluent 和 Ansys Mechanical 仿真任务的运行性能。我们很高兴向我们的客户推荐 Amazon G7e EC2 实例,这是一个更经济高效的选项,性能比上一代 GPU 实例更优异。”

Synopsys 产品管理高级总监 Richard Mitchell

Missing alt text value

ARI

“ARI 致力于大规模研发超级智能人形机器人,为人类提供充足的实体劳动力。我们通过基础模型赋予机器人在现实世界感知、推理和安全实操的能力。在人形机器人基础模型的训练工作中,Amazon EC2 G7e 实例为我们带来了极大的加速效果。该集群运行稳定,可支持大规模训练任务,让我们能够更快迭代复杂模型,同时控制成本。G7e 实例为我们提供了不断突破具身人工智能边界所需的可靠性和性能。”

Assured Robot Intelligence(ARI)联合创始人王小龙

Missing alt text value

Brave

“Brave 是一款独立浏览器与搜索引擎,拥有超一亿用户,具备业界领先的隐私与安全防护能力,让网络使用更安全、更便捷。Brave 搜索的独立搜索堆栈涵盖大规模嵌入模型、重排序模型和大语言模型集群,需要高性能 GPU 实例支撑。我们发现,与上一代相比,由 NVIDIA RTX PRO™ 6000 GPU 加速的 G7e 实例带来的巨大性能提升对我们而言具有颠覆性意义。该实例不仅能够优化响应质量,还可以显著降低延迟。”

Brave Search 首席工程师 Remi Berson

Missing alt text value

Innoactive

“Innoactive 致力于为企业普及工作站级 XR 应用。随着公司扩展数字孪生、空间计算和协同设计评审业务,保持稳定的 GPU 性能变得至关重要,尤其是对于团队分散办公、跨设备协作的情况。通过在由 NVIDIA RTX PRO™ 6000 Blackwell 服务器版提供支持的 Amazon EC2 G7e 实例上运行 Innoactive,我们可以按需提供 RTX 加速的 XR 流式传输服务,并提供生产环境所需的高可靠性、安全性和可扩展性。这使我们的客户能够像参加会议一样轻松地部署高级 XR 应用程序(如 NVIDIA Omniverse),同时保持对性能和企业基础设施的完全控制。”

Innoactive 首席增长官 Hervé Fontaine

Missing alt text value

人工智能应用场景入门

    Amazon SageMaker AI 是一项完全托管的服务,用于构建、训练和部署机器学习模型。借助 Amazon SageMaker HyperPod,G7e 实例可扩展至数十个 GPU,从而快速完成模型训练,无需设置和管理弹性训练集群。

    AWS Deep Learning AMI(DLAMI)可为机器学习从业人员和研究人员提供基础设施和各种工具,从而加快在云中进行任意规模的深度学习的速度。 AWS Deep Learning Containers 是预先安装了深度学习框架的 Docker 映像,可以让您跳过从头构建和优化环境的复杂流程,从而简化自定义机器学习环境的部署。

找到今天要查找的内容了吗?

请提供您的意见,以便我们改进网页内容的质量