亚马逊公司 (Amazon.com, Inc.) 旗下的亚马逊云科技 (AWS) 和 NVIDIA 宣布大幅扩展战略合作,以应对全球对 AI 基础设施日益高涨且不断加速的需求。基于客户对亚马逊云科技上的 NVIDIA 加速计算的快速采用,双方计划在亚马逊云科技的全球基础设施中新增部署 200 万个 NVIDIA GPU,并在 AI 工厂、CPU、网络、开放模型、数据处理和机器人领域深化合作,提供共同打造的 AI 解决方案,助力客户以前所未有的规模加速 AI 开发和部署。
AI 工作负载正在迅速扩展,从模型的训练和运行方式,到数据处理、索引和用于驱动智能应用的方式均在快速演进。客户正在从试点阶段转向生产阶段,并在代理式 AI、科学发现、企业自动化和机器人领域扩展工作负载。他们需要更广泛的模型选择、更快速的数据管线以及针对物理 AI 等新兴用例的新功能。他们还需要确保底层基础设施能够跟上他们自身的创新能力,同时为关键任务工作负载保持高水平的安全性与可靠性。
为了满足来自前沿实验室、全球企业、初创公司和政府机构不断增长的需求,亚马逊云科技和 NVIDIA 基于长达 16 年联合创新,进一步扩大 AI 计算能力,并更快地为客户提供全新联合打造的解决方案。作为扩展合作的一部分,双方正致力于:
● 将于 2027-2028 年间,在亚马逊云科技的全球基础设施中新增部署 200 万个 NVIDIA GPU
● 将基于 NVIDIA Vera CPU 的基础设施引入亚马逊云科技
● 使用 NVIDIA 定制高带宽内存 (NVHBM) 扩展 NVIDIA NVLink Fusion™
● 为政府构建 AI 工厂,包括在亚马逊云科技安全的基础设施上部署 10 万个 GPU,用于运行国家级安全工作负载
● 将 NVIDIA 平台与亚马逊云科技 Nitro 系统和 Elastic Fabric Adapter (EFA) 集成,以增强安全性与可靠性
● 继续支持 Amazon Bedrock 和 Amazon SageMaker 上的 NVIDIA Nemotron™ 开放模型,为客户提供更丰富的开放模型选择
● 使用 NVIDIA cuDF 和 cuVS CUDA-X™ 库加速 Amazon EMR 和 Amazon OpenSearch 上的数据处理和向量索引,实现更快、更合算的分析和 AI 应用
● 通过 Amazon Robotics 采用 NVIDIA 物理 AI 平台,进一步推进机器人工作负载,加速仓库自动化和新一代机器人的创新
大规模扩展 AI 计算能力
亚马逊云科技提供了所有云服务商中最广泛的基于 GPU 的实例,以支持各种 AI 和机器学习工作负载。在 NVIDIA GTC 2026 上,亚马逊云科技宣布计划从 2026 年开始,将增加超过 100 万个 NVIDIA GPU。需求从那时起已经超过了预期。亚马逊云科技计划于 2027-2028 年间,在其包括 AI 工厂在内的全球基础设施中部署另外 200 万个 NVIDIA Blackwell Ultra、Rubin 和 Rubin Ultra GPU。这些新增的算力将支持客户从智能体 AI、科学发现到企业自动化和物理 AI 的各种工作负载。此外,亚马逊云科技将扩展 NVIDIA Blackwell 的算力容量,包括为 Amazon EC2 G7 实例配备 NVIDIA RTX PRO™ Blackwell 服务器版 GPU。与上一代 G6 实例相比,G7 实例的 AI 推理性能提升了 4.6 倍,图形性能提升了 2.1 倍。亚马逊云科技也是首家提供由 RTX PRO 4500 加速的计算实例的主要云服务商。同时,亚马逊云科技和 NVIDIA 正在 NVIDIA Spectrum-X™ 以太网网络方面展开合作,以进一步优化跨 GPU 集群大规模 AI 训练工作负载的网络性能。
亚马逊云科技引入 NVIDIA Vera CPU
亚马逊云科技正与 NVIDIA 合作,将基于 Vera CPU 的基础设施引入亚马逊云科技,为那些需要加速基础设施与高性能 CPU 计算协同运行的智能体 AI 工作负载提供额外选项。Vera 专为下一代 AI 量身打造,它进一步完善了亚马逊云科技提供广泛计算选择的战略 —— 从亚马逊云科技自研芯片到合作伙伴提供的最新加速器和 CPU 都可以覆盖。
基于 NVIDIA NVLink Fusion 和 NVHBM 的异构 AI 基础设施
在 re:Invent 2025 大会上,亚马逊云科技宣布下一代 Trainium 芯片支持 NVIDIA NVLink Fusion 高速芯片互连技术。目前,NVIDIA 和亚马逊旗下的 Annapurna Labs 正在进一步扩大合作:双方将与内存供应商合作,共同推进对 NVIDIA 全新定制高带宽内存 (NVHBM) 技术的支持,使 Trainium 能够采用更快、更高效的内存。结合 NVLink Fusion,Annapurna Labs 现可利用 NVIDIA 的定制内存技术和纵向扩展架构,将 Trainium 和 GPU 无缝集成到相同的机架级架构中,从而提高 AI 工作负载的性能和效率。
以最高安全级别赋能 AI
政府机构需要安全的 AI 基础设施,以满足国家安全需求。亚马逊云科技和 NVIDIA 计划为政府建立 AI 工厂,提供 NVIDIA 的 AI 技术栈,并计划在亚马逊云科技的安全基础设施上为国家级安全工作负载提供 10 万个 GPU。此次合作使亚马逊云科技和 NVIDIA 成为推动国家安全 AI 发展的核心力量,助力政府机构大规模部署 AI,用于处理影响级别 6 (IL6) 及以上的机密工作负载。
以下新承诺建立在亚马逊云科技和 NVIDIA 深度技术集成的基础之上,相关技术集成已经为客户带来切实成效,包括:
● 借助亚马逊云科技 Nitro 系统和 EFA 增强安全性与可靠性 —— 在此次扩展合作中,所有基于 NVIDIA GPU 和 Trainium 的 EC2 实例,包括采用 NVLink Fusion 的实例,都基于亚马逊云科技 Nitro 系统构建,并通过 EFA 进行互连。基于 GPU 加速和 Trainium 的 EC2 实例将继续基于 Nitro 系统构建,并依托 EFA 进行横向扩展。Nitro 和 EFA 共同确保了在亚马逊云科技扩展 NVIDIA GPU 集群并集成新互连技术的同时,客户仍能够保持其在大规模量产级 AI 工作负载中所依赖的安全性、可靠性和网络性能。
● 亚马逊云科技上的 NVIDIA Nemotron 模型 —— 作为亚马逊云科技向客户提供更广泛 AI 模型选择承诺的一部分,NVIDIA 的 Nemotron 系列开放模型可在 Amazon Bedrock 上作为全托管无服务器模型提供,同时也可在 Amazon SageMaker 上提供,供希望在自有基础设施上部署和微调的客户使用。通过这种集成,客户可以利用亚马逊云科技的安全性、可扩展性和运营工具,访问 NVIDIA 最新开放模型。
● GPU 加速的数据处理和向量索引 —— 随着数据量的增长,特征工程、大规模 ETL 和实时分析等工作负载对处理速度的要求不断提高。亚马逊云科技正在和 NVIDIA 合作,通过 Amazon EC2 G7 实例和 NVIDIA cuDF 库在 Amazon EMR 上实现 GPU 加速的数据处理,与基于 CPU 的配置相比,处理速度可提升至原来的 3.7 倍,性价比提高 30%。另外,随着 AI 应用、检索增强生成工作流和语义搜索将向量数据库推向数十亿条记录,索引构建和优化成为瓶颈。Amazon OpenSearch Service 上的 GPU 加速向量索引功能可将索引构建任务卸载至专用 GPU 上,以四分之一的成本实现高达 9 倍的向量索引速度提升。该功能在托管集群和 Amazon OpenSearch Serverless 中均可使用。
● 面向机器人的物理 AI —— Amazon Robotics 正与 NVIDIA 展开合作,加速开发集成 NVIDIA 全栈物理 AI 平台的新一代机器人,涵盖 NVIDIA Jetson™ 平台、NVIDIA Omniverse™ 库和 NVIDIA Isaac™ 开放机器人开发平台。此次合作的领域包括仿真、合成数据生成、机器人训练、路线优化、功能安全和从现实到仿真验证,所有环节都运行在 GPU 加速的 Amazon EC2 实例上。亚马逊云科技和 NVIDIA 共同助力提升大规模机器人工作负载所需的能力:大规模仿真、多样化训练数据和持续的现实世界验证。



