SpaceX 计划发射百万颗 AI 卫星,打造轨道数据中心

xAI
SpaceX Files for One Million AI Satellites to Build an Orbital Data Center
SpaceX 瞄准近地轨道人工智能算力市场,计划部署多达一百万颗专用“Starmind”卫星,这些卫星将在德克萨斯州的专属工厂进行制造。

陆基人工智能集群正迅速撞上行星基础设施的物理极限。变电站变压器的积压订单排到了四年之后,区域地下水位因蒸发冷却塔而枯竭,电网也因难以分配吉瓦级的持续电力而捉襟见肘,陆地超大规模数据中心已无增长空间。SpaceX 正在提出一种基于轨道的激进方案,以替代传统的地面计算:构建一个由专用数据中心卫星组成的巨型星座,旨在太空中处理高强度的模型工作负载。

该计划在内部被称为 Project Starmind,预计最早于 2027 年将专用计算航天器发射至近地轨道。在 xAI 完成业务整合后,提交给联邦通信委员会(Federal Communications Commission)的监管文书概述了一个轨道部署框架,该框架最终可扩展至一百万个工作节点。与 Starlink 宽带网络那种仅将航天器视为通信中继的做法不同,SpaceX 重新定位的架构将轨道硬件视为分布式、共址的计算集群,并完全利用直接太阳通量进行不间断运行。

AI1 平台与 Bastrop 制造中心

该星座的核心计算构件是一个被称为 AI1 的专用卫星平台。与优先考虑高频无线电发射器和平板相控阵天线的传统通信卫星不同,AI1 从底盘设计之初就围绕加速卡和配电单元进行构建。初步技术文档显示,每个基准节点被设计为消耗约 120 千瓦的持续电力,并由宽大的双翼光伏阵列提供支持。

这些专用节点的制造将集中在得克萨斯州 Bastrop 新建立的 Gigasat 工厂。SpaceX 不打算采用航空航天制造业中典型的定制化无尘室装配线,而是计划引入在其 Starlink 总线装配线上优化过的大规模自动化生产方法。即便要实现申报文件中所列数字的一小部分,也需要前所未有的工业产出率,将卫星装配从一门航空航天学科转变为一条连续的重工业制造流水线。

轨道热力学的辐射挑战

在地球上,从密集处理硅片集群中散发热能主要依靠对流和相变。液体冷却剂通过直接安装在处理器芯片上的冷板循环,将热能传递给大型冷水机组、冷却塔或外部空气热交换器。在近地轨道的真空中,除了航天器本身的密封舱外,不存在传导和对流。板载人工智能处理器产生的每一瓦热量都必须完全通过热辐射散发出去。

电网互联积压与发射质量经济性

轨道数据中心的理念吸引力与目前困扰陆地电力基础设施的后勤瘫痪程度成正比。在北弗吉尼亚州、硅谷和西欧等主要的超大规模数据中心走廊,获得一份 500 兆瓦的电网互联协议通常需要数年的行政审查、环境影响评估和公用事业输电升级。在轨道上,太阳辐照度比海平面高出约 30%,且完全没有大气衰减、云层遮挡或太阳同步轨道上的昼夜停机影响。

包括 OpenAI 首席执行官 Sam Altman 在内的批评者此前曾质疑轨道计算的经济合理性,理由是昂贵的单位质量发射成本、无法维修损坏的硬件以及会使半导体硅片退化的恶劣辐射环境。陆基集群受益于便于现场维护、低延迟光纤骨干网和标准化的商用硬件。相比之下,每一个发射到轨道上的组件都必须承受严重的机械冲击、上升过程中的振动声载荷以及持续的宇宙射线轰击。

SpaceX 的反驳论点建立在其完全可重复使用的 Starship 重型运载火箭的飞行经济性之上。如果 Starship 能够达到其预期的飞行频率和边际发射成本,那么近地轨道的有效载荷损失将降低到足以从根本上重塑数据中心的单位经济效益。计算平台无需支付不断上涨的陆基购电协议、工业用水费和房地产税,只需针对硬件和发射服务的初始资本成本进行运营成本摊销。来自 Google 和 Anthropic 等科技公司的报道兴趣突显了整个行业对于无约束权力的渴求,无论这种权力来自何处。

真空中的网络架构

现代人工智能工作负载的并行处理严重依赖 NVLink 或 InfiniBand 等低延迟、超高带宽的网络架构,以便在不同的处理器节点之间同步数百万个参数。将这些工作负载从单个高架地板数据厅转移到穿梭于轨道平面的分布式星座中,带来了一个复杂的网络挑战。虽然陆地节点通过以米为单位测量的无源光纤进行通信,但轨道节点必须在数公里的真空空间中进行通信。

SpaceX 打算使用下一代光卫星间链路来弥合这一差距。现代空间激光通信系统具有太比特级的吞吐量,在太空中运行,光速比在陆地二氧化硅光纤中快约 40%。通过将 AI1 星座编织成一个动态路由、网状联网的光学架构,同一轨道壳层内的相邻卫星可以作为一个统一的分布式计算超级集群运行。

对于大规模模型推理任务——即离散任务可以在没有持续参数同步的情况下异步分配——轨道架构表现得尤为出色。训练基础前沿模型(需要跨海量共享内存池进行微秒级同步)在轨道上仍然是一个悬而未决的工程问题。解决这一问题需要新颖的算法分区,将模型层分布在各个轨道壳层中,同时减轻动态轨道几何结构带来的延迟惩罚。

轨道碎片动力学与工业先例

运营一个规模达数十万(最终甚至一百万)个独立航天器的星座,带来了重大的轨道安全和可持续性挑战。近地轨道已经十分拥挤,增加数量空前的重型计算卫星将大大增加轨道碰撞的风险。一个大规模运行的密集巨型星座必须保持完美的运行安全裕度,以防止连锁碎片事件损坏整个轨道带。

Starmind 的工程验证将完全取决于原定于 2027 年进行的演示发射。如果 AI1 总线能够有效演示稳态排热、承受持续的总电离辐射剂量,并通过激光下行链路将具有成本竞争力的浮点运算反馈给地面站,那么它将成为全球计算架构的一个结构性转折点。从陆地服务器向轨道星座的过渡标志着,人工智能的未来可能不再受限于地球表面的地理或电气限制。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 什么是“星智计划”(Project Starmind),其主要目标是什么?
A “星智计划”是 SpaceX 发起的一项倡议,旨在近地轨道构建一个轨道数据中心星座。通过部署多达一百万颗专用的 AI1 计算卫星,该项目旨在绕过陆地基础设施的瓶颈,如电网互联延迟、土地资源稀缺以及用于冷却的大量水资源消耗。该星座通过利用持续的直接太阳通量,在太空中执行高强度的人工智能工作负载。
Q AI1 卫星如何在轨道上发电并管理散热?
A 每颗 AI1 卫星节点的设计功率约为 120 千瓦,由在无大气干扰下运行的宽大双翼光伏阵列维持持续供电。由于近地轨道是真空环境,没有空气进行对流或蒸发冷却,卫星无法使用标准的地面冷水机组或散热器。因此,板载人工智能加速器产生的所有热能必须完全通过热辐射散发出去。
Q Starmind 卫星将如何通信以协调分布式人工智能工作负载?
A 为了匹配 InfiniBand 等地面网络结构所具备的低延迟和高带宽,该星座采用了先进的光学卫星间链路。这些激光通信系统构建了一个动态路由的网状网络架构,能够在真空环境中实现公里级的太比特级吞吐量。由于光在真空中的传播速度比在地面二氧化硅光纤中快约 40%,该系统能够促进轨道节点间复杂模型参数的快速同步。
Q 哪些关键物流因素使得轨道数据中心对 SpaceX 而言在财务上可行?
A SpaceX 依托其位于德克萨斯州巴斯特罗普工厂采用的“星链”(Starlink)大规模制造技术,并结合其完全可重复使用的“星舰”(Starship)重型运载火箭的经济性。尽管航天硬件面临宇宙辐射退化且在部署后无法进行物理维护,但单位重量发射成本的大幅降低,使得运营商能够避开不断上涨的地面电力采购协议、市政用水成本和房地产开销,从而转向摊销发射资本的模式。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!