OpenAI 推出 10 万亿参数 GPT-6,打破预训练性能瓶颈

OpenAI
OpenAI Shatters the Pre-Training Wall with 10-Trillion Parameter GPT-6
据报道,OpenAI 正准备在 8 月发布代号为“Astra”的 GPT-6 模型。该模型拥有 10 万亿参数,旨在超越 Anthropic 并夺回人工智能领域的领先地位。

在过去两年里,人工智能行业一直处于高性能优化的停滞期。自 GPT-4 问世以来,主要参与者——OpenAI、Anthropic 和 Google——大多专注于优化现有架构。虽然我们见证了训练后处理(post-training)、人类反馈强化学习(RLHF)以及推理时扩展的兴起,但驱动这些模型的核心引擎一直相对静态。这种优化时期似乎即将结束。来自行业内部人士和技术分析师的报告显示,OpenAI 正准备部署代号为 Astra 的 GPT-6 模型,该模型拥有惊人的 10 万亿参数。这不仅使其规模比前代产品扩大了五倍,也对 Anthropic 目前的高端产品主导地位构成了直接挑战。

对于我们这些跟踪 AI 机械和工业需求的人来说,这种转变不仅仅是一次软件更新;这是一项巨大的工程任务。训练一个 10 万亿参数的模型所需的计算密度和热管理水平,正在冲击当前数据中心基础设施的极限。如果这些传言属实,OpenAI 正在跨越许多批评家认为会阻碍大语言模型发展的“预训练墙”。这不仅仅是对算法的调整,而是对自 2024 年春季以来一直驱动 OpenAI 产品的底层引擎的彻底更换。

从 GPT-4 到 Astra 的技术飞跃

围绕 Astra 的猜测表明,它是建立在一个超越以往数据集的新预训练基础上的。报告提到,其训练语料库约为 10 万亿个 token,并配有可达到 150 万个 token 的上下文窗口。对于工业应用而言,这种扩展的上下文窗口是最关键的指标。它允许将海量的技术手册、整个代码库或复杂的供应链清单纳入模型的活动内存,提供了一种前几代模型无法比拟的运营连续性。这不仅仅关于模型是否变得“更聪明”;更在于模型拥有了用于复杂逻辑推理的更大工作空间。

此次发布背后的紧迫性很大程度上归因于来自 Anthropic 的竞争压力。在 AI 开发的高风险博弈中,随着 Anthropic 的 Fable 和 Opus 模型在推理基准测试中获得进展,OpenAI 感到了压力。8 月的战略似乎是一次“强行发布”,尽管面临监管审查和内部安全暂停,项目仍在推进。这表明 OpenAI 的领导层将当前的市场地位视为一场零和博弈,认为在通往下一个规模前沿的竞赛中屈居第二是一种生存风险。

缩放定律是否正在重申其主导地位?

代号为 Doug 的项目被描述为一个定于年底发布的“史诗级庞然大物”。与旨在吸引即时市场关注并对抗 Anthropic Fable 5.1 的 Astra 不同,据报道,Doug 正在 Nvidia 的下一代 Vera Rubin 架构上进行训练。如果说 Astra 是 GPT-4 的五倍,那么据传 Doug 的复杂程度要高出一个数量级。这种双轨战略揭示了 OpenAI 的路线图:利用 Astra 在 8 月稳定市场,并利用 Doug 在 11 月前确立无可争议的领先地位。

向 Vera Rubin 芯片的过渡是一个重要的技术细节。这些芯片代表了超越 Blackwell 架构的下一次进化,提供了更高的内存带宽和更高效的 HBM3e 集成。利用这种硬件表明 OpenAI 已经获得了优先的供应链地位,使其能够使用尚未广泛部署的芯片。从机械工程的角度来看,这些集群的功耗将是前所未有的,可能需要先进的液冷解决方案来维持训练过程中涉及的数十万个 GPU 的稳定性。

与 Anthropic 的竞争及田忌赛马策略

GPT-6 泄密的时间点与 Anthropic 为 Fable 5.1 所做的准备不谋而合。行业分析师将其比作“田忌赛马”策略——这是一种经典的中国军事隐喻,即利用不同层级的资产来应对对手的动作。据报道,Anthropic 扣留了其最强大的模型 Opus 5 作为隐藏储备。通过在 8 月发布 Fable 5.1,他们意在与 Astra 正面交锋,迫使 OpenAI 在年底前亮出底牌。

这种竞争压力实际上已经结束了 AI 开发的平静期。两年来,行业依赖于训练后优化,因为它们更便宜、更安全。现在,战斗又回到了核心引擎上。“预训练墙”本质上是数据质量和硬件可靠性的瓶颈。通过 Garlic 等项目——一个为 Doug 铺平道路的较小规模验证实验——解决这些问题,OpenAI 似乎已经找到了前进的道路。重点不再仅仅是模型如何推理,而是其在 10 万亿 token 的大规模预训练阶段所建立的初始世界模型的广度。

这对工业机器人和供应链自动化的影响是深远的。一个拥有 Astra 逻辑深度的模型可以作为复杂机器人集群的中央控制器,处理当前系统感到棘手的边缘情况。在我研究机器人与工业接口的工作中,主要障碍一直是缺乏在非结构化环境中的通用推理能力。一个在更多样化的多模态数据上训练出的 10 万亿参数模型,可以提供弥合执行脚本任务的机器人与能够适应不断变化的工厂车间的机器人之间差距所需的“大脑”。

AI 权力结构的变动

随着 OpenAI 和 Anthropic 为这场决定性的战斗做准备,传统“三巨头”中的第三位——Google——似乎正处于结构不稳定期。Jeff Dean(近三十年来 Google AI 研究的基石)的近期离职,以及 DeepMind 的 Demis Hassabis 转任主席,预示着领导层的更迭。曾经作为 Transformer 架构诞生地 Google,正日益被视为其更灵活竞争对手的人才库。

这使得通往人工超级智能(ASI)的道路成为了一场双雄对决。虽然 Google 的 Gemini 3 仍然是一个强大的竞争对手,但势头已经转向那些愿意承担与 10 万亿参数模型相关巨大财务和技术风险的实验室。单是训练 Doug 的成本可能就高达数十亿美元,这还得计入硬件采购、能源消耗以及高质量专有数据的获取成本。

GPT-6 是否会在 8 月以完全成熟的产品形态出现,还是以“强制”发布的形式出现,仍有待观察。然而,仅从技术规格来看,增量增长的时代已经结束。我们正在进入一个大规模暴力缩放的阶段,由有史以来最复杂的机械和计算基础设施作为后盾。对于我们这些在这一领域的人来说,问题不仅在于缩放定律是否有效,还在于我们将如何管理维持它们运行所需的巨大工业动力。当我们展望年底时,Astra 和 Doug 的到来将决定未来十年 AI 能力的上限。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q OpenAI 传闻中代号为“Astra”的 GPT-6 模型有哪些核心技术规格?
A 据报道,代号为 Astra 的 GPT-6 是一个参数量高达 10 万亿的巨型模型,规模较其前代产品增加了五倍。预计其训练语料库约为 10 万亿 token,上下文窗口可达 150 万 token。这种扩展后的记忆能力使其能够摄入海量数据集,包括完整的代码库和复杂的工业手册,从而显著增强逻辑推理能力和工业实用性。
Q OpenAI 如何定位 Astra 以与竞争对手 Anthropic 展开竞争?
A 据报道,OpenAI 将 Astra 作为对抗 Anthropic 高端模型(如 Fable 和 Opus)的直接手段,这些模型近期在推理基准测试中取得了进展。8 月份的发布被视为夺回市场主导地位并保持规模竞赛领先优势的战略举措。这种竞争压力使行业重心重新转向大规模预训练,而非仅仅通过后训练和优化技术来改进现有架构。
Q 在 OpenAI 的“Doug”项目长期规模化战略中,Nvidia 硬件扮演了什么角色?
A 据报道,OpenAI 正在开发一个代号为 Doug 的更复杂模型,计划于年底发布,该模型将使用 Nvidia 的下一代 Vera Rubin 架构进行训练。与目前的 Blackwell 芯片相比,这种硬件提供了更优越的内存带宽和 HBM3e 集成。向 Vera Rubin 的过渡需要先进的液冷解决方案,以应对训练此类巨型模型所需的数十万个 GPU 所产生的前所未有的功耗和热量输出。
Q GPT-6 的规模将如何影响工业机器人和供应链自动化?
A 像 Astra 这种 10 万亿参数模型的逻辑深度和广阔的上下文窗口,可能通过充当复杂机群的中央控制器来彻底改变工业机器人技术。与当前在非结构化环境中表现吃力的系统不同,这些先进模型具备通用的推理能力。这使得机器人能够处理工厂车间不可预测的极端情况,并管理复杂的供应链清单,从而弥补脚本化任务与真正自适应、自主工业操作之间的鸿沟。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!