OpenAI 与 Cerebras 携手,以 GPT-5.6 Sol “超快模式”突破推理性能极限

OpenAI
OpenAI and Cerebras Shatter Inference Limits with GPT-5.6 Sol Ultrafast
由 Cerebras 晶圆级硬件驱动的 OpenAI 全新“超快模式”(Ultrafast mode),使 GPT-5.6 Sol 的推理速度达到每秒 750 个 Token,从根本上重塑了实时人工智能的应用潜力。

多年来,人工智能行业一直遵循着一个心照不宣的妥协:你可以拥有前沿水平的智能,或者拥有极致的速度,但两者不可兼得。随着大型语言模型(LLM)从数十亿参数扩展到数万亿参数,生成每个单词(即 token)所需的计算成本呈指数级增长。高推理能力模型往往迫使用户陷入漫长的等待,响应时间以分钟而非毫秒计。随着 GPT-5.6 Sol 在 Ultrafast 模式下的发布,这一范式在今天发生了改变。

硬件瓶颈与晶圆级解决方案

要理解为何这是一项里程碑式的成就,我们必须跳出软件层面,审视现代数据中心的物理现实。目前大多数 AI 模型运行在传统的图形处理单元(GPU)集群上。虽然 GPU 在并行处理方面表现出色,但它们深受“内存墙”问题的困扰。在标准 GPU 集群中,模型权重(即定义 AI 知识的数万亿个数字)存储在处理器外部的内存芯片中。AI 每生成一个 token,这些权重就必须从内存移动到计算核心。这种数据传输是速度的主要瓶颈。

Cerebras 采取了一种本质上不同的方案。Cerebras 没有将硅晶圆切割成数百个小芯片再进行互连,而是保持了整个晶圆的完整。他们的晶圆级引擎(WSE)是迄今为止制造出的最大处理器,尺寸大约相当于一个餐盘。通过将整个模型保留在单片硅片上,他们消除了缓慢的片外数据移动需求。其结果是内存带宽的巨大提升。对于像 GPT-5.6 Sol 这样复杂的模型,这种架构上的转变意味着流量从“涓涓细流”变成了“洪水”。通过为 Ultrafast 层提供算力,Cerebras 证明了前沿 AI 的未来可能不在于更多小芯片的集群,而在于重新思考处理器本身的物理规模。

量化前沿智能的跨越

高推理任务速度提升 7 倍尤为重要,因为这是在没有“牺牲质量”的前提下实现的。从历史上看,模型的“高速”版本往往是其更智能版本经过蒸馏后的简化版。而在本例中,Sol 模型的基础智能保持不变。速度是硬件效率的产物,而非算法捷径。在衡量经济价值知识工作的 GDP-Val 基准测试中,Ultrafast 模式实现了 5.6 倍的端到端加速。这表明模型不仅生成文本的速度更快,而且能以支持人机实时协作的节奏得出正确、复杂的结论。

为何每秒 750 个 token 至关重要?

人们可能会问,既然人类阅读速度有限,为什么 AI 需要以每秒 750 个 token 的速度输出?答案在于从“聊天机器人”向“智能体”的转变。当 AI 被用作智能体时——执行多步推理、浏览网页或调试数百万行代码——输出的内容不仅仅是给人看的,也是给 AI 自己看的。模型可能需要生成十个不同的解决方案版本,进行内部测试,然后呈现出最优解。在标准速度下,这一过程需要几分钟,导致人类用户丢失语境或不得不切换到其他任务。而在每秒 750 个 token 的速度下,整个内部迭代循环仅需几秒钟即可完成。

在关键的工业环境中,这种延迟的降低具有变革意义。想象一下,安全运营中心面临零日网络攻击。识别漏洞和制定遏制策略每延迟一秒,都可能导致灾难性的数据丢失。Ultrafast 推理模型可以实时摄取日志、识别攻击模式并编写缓解代码。同样,在自动化制造和供应链管理领域,能够在几秒钟而非几小时内查明全球网络生产中断根本原因的 AI,能够保障现代工业所需的关键运行时间。

实时推理的经济可行性

从机械工程和工业的角度来看,这项公告最引人注目的方面在于其提升 AI 基础设施投资回报率(ROI)的潜力。传统上,高推理模型速度太慢,无法用于离线分析或非时间敏感型研究以外的领域。通过使 GPT-5.6 Sol 实现“超快速”,OpenAI 正在为其融入工业工作流的关键路径打开大门。这使得该技术从后台走向了前线。

OpenAI 的研究人员已经指出,延迟的消失从根本上改变了他们的工作方式。一位研究人员指出,以前需要两分钟时间去查看邮件或喝杯咖啡的任务,现在在他还没来得及把视线移开屏幕前就已经完成了。这种持续的“心流”状态对于复杂的工程和编码任务至关重要。如果工程师可以与一位响应瞬间的博士级助手共同迭代设计,那么该公司的创新步伐不仅会翻倍,更会进入一个新的生产力维度。与 Cerebras 的合作——该公司最近报告称金融和国防部门对其技术表现出强烈兴趣——凸显了市场对这种深度与速度的特定结合有着迫切需求。

高速 AI 能否重新定义机器人与自动化?

对机器人和物理自动化的影响或许最为深远。为了让机器人在动态的、有人类存在的环境中安全运行,其“思维周期”必须近乎瞬时。虽然大部分底层电机控制由专用微控制器处理,但高层推理——例如决定如何避开复杂障碍物或解读细微的口头指令——一直受限于基于云的 LLM 的速度。如果 GPT-5.6 Sol 能够以亚秒级延迟提供复杂的推理能力,我们正迈向一个人形机器人不仅能感知环境,还能以曾经仅存在于科幻小说中的复杂程度去理解并做出反应的世界。

此外,通过 OpenAI API 实现的这种速度民主化意味着,较小的公司和独立开发者现在可以构建曾经只有拥有大规模本地计算集群的科技巨头才能开发的应用程序。无论是能在几秒钟内扫描 500 页文档并找出差异的实时法律助手,还是能在瞬息间重新计算百万个变量风险的金融模型,高速、高智能服务的准入门槛正在降低。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q GPT-5.6 Sol Ultrafast 每秒 750 个 token 的速度有何意义?
A GPT-5.6 Sol Ultrafast 的生成速度达到每秒 750 个 token,比以往的高推理模型快了约七倍。这种速度对于代理式人工智能(agentic AI)至关重要,因为系统在呈现最终答案之前必须通过多次内部解决方案进行迭代。通过将等待时间从分钟缩短至秒级,它使工程、软件开发和网络安全等高风险领域的专业人员能够保持持续的思维流。
Q Cerebras 晶圆级引擎(Wafer-Scale Engine)与传统的 GPU 架构有何不同?
A Cerebras 使用了一种晶圆级引擎,它将整个硅晶圆保持完整,而不是将其切割成较小的芯片。这种餐盘大小的处理器允许整个 AI 模型驻留在一块硅片上。通过消除在独立内存芯片和计算核心之间传输数据的需求,该架构提供了巨大的内存带宽。这种物理层面的转变是 Apollo Thirteen 报告中前所未有的速度背后的主要驱动力。
Q 什么是“内存墙”,GPT-5.6 Sol 是如何克服它的?
A “内存墙”是传统 GPU 集群中的一种物理瓶颈,模型权重存储在处理器外部的内存芯片中。每当 AI 生成一个 token 时,数据必须在内存和计算核心之间传输,从而产生显著的延迟。GPT-5.6 Sol 通过使用 Cerebras 硬件将权重保留在芯片上来绕过这一限制,将数据传输从缓慢的“涓涓细流”转变为高速的“洪水”,从而实现实时推理。
Q Ultrafast 模式如何影响工业工作流程和 AI 代理?
A 在工业工作流程中,Ultrafast 模式允许在安全运营中心等高风险环境中进行实时协作。它使模型能够几乎即时地摄取日志、识别网络攻击并编写缓解代码。在制造业中,这种速度能够实现对全球网络生产中断的快速根本原因分析。这一进步将前沿人工智能从后台工具转变为能够在一秒钟内做出复杂决策的前线运营资产。
Q 高速推理对机器人领域有何影响?
A 在机器人领域,高级推理一直受限于云端模型的延迟。GPT-5.6 Sol Ultrafast 提供了机器人实时导航动态环境和解读复杂人类指令所需的亚秒级延迟。这一突破缩短了自动化系统的思考周期,使机器能够执行精细任务,并在没有以往阻碍复杂自主运动的延迟的情况下,与人类安全地并肩工作。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!