SpaceX 达成每月 9.2 亿美元云服务协议,获海量算力支持

Nvidia
SpaceX Secures Massive Compute Influx in $920 Million Monthly Cloud Deal
SpaceX 与 Google 达成了一项史无前例的多云计算协议,锁定了 11 万块 Nvidia GPU 的使用权,旨在为航空航天模拟及工厂自动化机器人提供算力支持。

在 raw compute(原始算力)变得与 raw steel(生钢)或 liquid methane(液态甲烷)同等重要的工业格局中,航空航天制造业正与超大规模人工智能基础设施发生剧烈碰撞。最近的财务披露指出了一项重大的计算配置协议:SpaceX 已与 Google 达成一项多方面的云算力协议,估值约为每月 9.2 亿美元。此次大规模部署的核心是专用分配约 110,000 个高性能 Nvidia 企业级图形处理器(GPU),这是工业制造商与公有云超大规模服务商之间达成的规模最大的持续计算资源分配协议之一。

尽管面向消费者的 AI 模型和大语言网络吸引了公众的注意力,但现代航空航天硬件背后的工程基础设施需要前所未有的并行张量处理量。SpaceX 在分布式发射平台、庞大的轨道卫星星座以及位于德克萨斯州 Boca Chica 的 Starbase 昼夜不停的火箭生产线上运行,需要高密度的计算能力来解决基础物理和遥测挑战。获得 Google Cloud 基础设施上 110,000 个 Nvidia 加速器的使用权,从根本上改变了轨道制造的单位经济效益,将繁重的模拟任务从本地机房集群转移到了全球分布式、液冷的现代数据中心机架上。

110,000 个加速器的热能与计算规模

要理解 110,000 个 Nvidia 数据中心 GPU 的工程规模——主要包括 Hopper 架构的 H100、H200 以及初步分配的 Blackwell B200 架构——必须审视数据中心楼层的物理现实。每个加速器模块在与主机 CPU、液冷板和高速网络架构结合时,在重型持续张量工作负载下,需要 700 到 1,200 瓦的持续电力。将 110,000 个此类单元聚合在一起,意味着持续电力负荷惊人地超过 110 到 140 兆瓦,堪比中型大都市工业区的用电量。

在专用设施内管理这种热力学足迹,是航空航天企业选择向专业超大规模服务商租赁,而不是从零开始构建私有物理服务器机房的主要原因。Google Cloud 的现代超大规模设施采用闭环芯片直冷液冷系统和定制的后门热交换器,每个服务器机架的散热能力超过 100 千瓦。对于一家已经运营着资本密集型低温推进剂工厂和真空炉铸造设施的企业来说,将物理空间、变电站和冷却塔的任务委托给成熟的超大规模服务商,使工程团队能够专注于软件建模、自动化机械制造和高节奏的发射物流。

此外,部署如此规模的阵列需要先进的网络拓扑结构。Nvidia 的 Quantum-2 InfiniBand 和 Google 专有的 Jupiter 光电路交换架构提供了将数万个计算芯片连接起来所需的二分带宽,消除了延迟瓶颈。在重型工业模拟中,如果网络瓶颈迫使工作节点在跨节点同步矩阵状态时处于闲置状态,资本投资回报率将急剧下降。在 110,000 个节点之间建立专用管道,保证了实时计算流体动力学和多体引力模拟所需的微秒级延迟阈值。

高超音速流体动力学与火箭发动机模拟

现代火箭技术早已超越了二十世纪航天所定义的经验性“建造-测试”迭代周期。可重复使用重型运载火箭(如 Starship 和 Super Heavy 助推器)的开发和部署,完全依赖于在极端热力学、压力和化学条件下求解复杂的 Navier-Stokes 方程。SpaceX Raptor 3 发动机的燃烧室压力超过 350 bar,氧气和甲烷在挑战航空级高温合金物理极限的条件下燃烧。

以亚毫米网格分辨率模拟这些环境,每毫秒需要数万亿次的浮点运算。高密度 GPU 集群使计算流体动力学求解器能够实时模拟大气再入过程中的湍流边界层分离、音速转换和高温等离子体复合。SpaceX 的工程师无需仅依赖从物理地面测试台或海洋溅落捕获的飞行后遥测数据,就可以通过并行计算实例,让整个发射系统的数字孪生体经受数百万次合成大气扰动,在制造金属件之前快速测试新型气动表面设计、栅格舵几何形状和热分离动力学。

同样的物理原理也适用于覆盖在运载器上的热防护系统屏蔽层。通过地球高层大气进行高超音速减速时,对数千块陶瓷隔热瓦的热力学传递进行建模,需要大量的有限元分析和辐射传输计算。通过将这些高计算量的模拟过程通过并行化的 Nvidia 张量核心进行处理,机械工程师可以评估结构疲劳、气动颤振和局部热点形成,从而显著压缩车辆周转计划并加快轨道飞行认证。

工厂车间的视觉引导机器人

除了轨道力学和高速热力学之外,高端 GPU 计算的工业影响在 Starbase 和 McGregor 发动机测试设施的制造工厂中表现得尤为明显。现代火箭制造正日益转变为自动化的、视觉驱动的生产环境。埋弧焊、激光引导的轨道管件装配以及结构焊缝的自动化无损检测,都会产生海量的多光谱传感器数据,必须进行瞬时处理以确保结构完整性。

在自动化生产线上,计算机视觉算法运行高帧率空间映射模型来检查摩擦搅拌焊缝和冷轧不锈钢接缝。在数百万份历史 X 射线和超声波扫描数据集上训练的神经网络,可对物理结构组件进行微米级的分析,识别出在高压低温载荷下可能导致灾难性故障的局部孔隙或亚表面夹杂物。这种局部的实时推理需要大规模的上游训练集群来摄取、标记和更新视觉模型,且不能中断持续的工厂轮班。

此外,在大型构造综合体内集成自动移动机器人和机械臂操作,依赖于空间智能架构。负责定位结构环、喷涂绝缘材料或扭紧机械紧固件的机器人,必须适应钣金公差和环境条件的微小偏差。通过在强大的 110,000 个 GPU 网络上集中化机器学习流程,制造工程师可以将持续更新的控制策略部署到车间边缘控制器,从而在减少人工装配干预的同时提高制造精度。

Starlink 星座的动态路由需求

SpaceX 的运营范围远不止静态工厂,还包括一个由 6,000 多颗在轨运行的 Starlink 卫星组成的活跃轨道星座。在这一庞大的空间网格中动态路由高吞吐量互联网流量,是现代电信领域最复杂的分布式网络挑战之一。每颗卫星都作为一个自主路由器,通过光链路与相邻航天器通信,同时跟踪覆盖不同地理区域的数千个动态相控阵地面终端。

优化这一全球网格网络需要大规模的预测建模。轨道力学规定卫星以每小时约 27,000 公里的速度飞行,这导致网络拓扑结构不断变化,与地面站、客户终端和海上节点的视线矢量每几分钟就会发生变化。基于云的神经网络模拟全球动态流量需求,预测特定监管区域的带宽拥塞,预测天气引起的信号衰减,并动态优化激光交叉链路路由路径,以最大限度地减少跨洲的数据包延迟。

除了通信路由,空间态势感知也是一项绝对的计算先决条件。随着数千个在轨资产在拥挤的近地轨道区域运行,实时轨迹建模对于跟踪空间碎片和生成自动化碰撞评估警报至关重要。当识别出潜在的碰撞矢量时,自动化系统会计算出高置信度的避碰机动,在确保有效载荷零运营中断的同时将燃料消耗降至最低。在多天的预报窗口内同时解析数千个资产的轨道星历,需要持续、弹性的高性能计算分配。

超大规模租赁的财务演算

每月约 9.2 亿美元的经常性运营支出代表了巨大的资本承诺,预示着年度云服务和基础设施的运营率将超过 110 亿美元。在资本市场严格审查基础设施支出和企业资产负债表的时代,将如此庞大的流动资金分配给离线算力资源,需要严谨的财务和运营证明。高端计算的经济性已受到芯片可用性、生命周期折旧以及采购企业级变压器和公用事业互连许可证所带来的严重交货周期的制约。

直接购买 110,000 个 Nvidia 企业级 GPU,以及配套的服务器机箱、交换节点、配电系统和冷却基础设施,将需要立即投入数十亿美元的资本支出。然而,实物购买价格只是总拥有成本的一小部分。由于重型公用事业设备的全球供应链紧缩,建造、调试和维护运营此类集群所需的 100 多兆瓦变电站通常需要数年的交货时间。通过 Google Cloud 将此容量作为运营服务进行保障,SpaceX 规避了公用事业级别的基础设施延误,立即锁定了今天即可投入使用的专用算力引擎。

这种安排还在不断发展的硬件领域提供了快速的灵活性。随着 Nvidia 将其硅片路线图从 Hopper 架构加速到 Blackwell 以及最终的 Rubin 级节点,长期的资本所有权会使公司面临资产快速折旧和技术过时的风险。灵活的、超大规模的多年期云合同使工业巨头能够动态扩展工作负载,在清理生产线的同时,用更密集、更节能的架构替换旧的计算集群。在商业化深空探索、规模化轨道互联网网络和简化自动化重型制造的高风险竞赛中,对运营级芯片的即时获取,在可靠性上远超持有物理基础设施的长期持有成本。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q SpaceX 与谷歌的云协议中包含了哪些硬件?
A SpaceX 获得了托管在谷歌云基础设施上约 110,000 个企业级英伟达图形处理器的使用权限。此次部署主要采用 Hopper 架构的 H100 和 H200 加速器,以及初步分配的下一代 Blackwell B200 架构。这些处理器通过英伟达 Quantum-2 InfiniBand 和谷歌 Jupiter 光路交换结构互连,以确保海量并行计算任务所需的高吞吐量和低延迟性能。
Q 为什么 SpaceX 在火箭开发中需要高密度 GPU 计算?
A SpaceX 使用高密度 GPU 集群来运行复杂的计算流体动力学和有限元分析模拟。这些模拟旨在求解控制高压“猛禽 3”(Raptor 3)发动机内部湍流燃烧、飞行器表面气动载荷,以及大气再入过程中热防护瓦的等离子体传热的复杂纳维-斯托克斯方程。在数字环境中对这些物理力进行建模,可以减少物理测试失败的次数,并显著加快设计迭代速度。
Q 为什么 SpaceX 选择超大规模云提供商而不是建立本地集群?
A 运行 110,000 个企业级加速器需要 110 到 140 兆瓦的持续电力,其能耗相当于一个中型工业区。像谷歌云这样的超大规模云提供商已经拥有配备了大容量变电站和芯片直接液冷系统的专业设施,能够管理巨大的热负荷。与云服务提供商合作,使 SpaceX 能够跳过繁琐的基础设施建设,专注于核心航空航天工程。
Q 计算能力的扩展如何支持 SpaceX 的制造业务?
A 除航空航天模拟外,这些计算能力还支持星际基地(Starbase)和麦格雷戈(McGregor)生产设施中的视觉引导机器人和自动化制造系统。高性能计算实现了实时传感器处理、质量控制自动化以及引导机器人装配臂的计算机视觉模型。这些自动化工作流程简化了火箭机身和发动机的制造,在提高制造精度的同时,加快了高频轨道发射任务所需的生产节奏。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!