黄仁勋宣称 AGI 时代已至,但硬件现实却道出另一番真相

Nvidia
Jensen Huang Declares the Arrival of AGI While Hardware Realities Tell Another Story
英伟达首席执行官认为下一代前沿模型代表了通用人工智能(AGI),然而工业基础设施与机器人技术的发展却揭示了计算基准测试与物理现实之间的巨大鸿沟。

当Nvidia首席执行官Jensen Huang身穿其标志性的皮夹克走上舞台时,他所兜售的不仅仅是芯片,而是一个形而上学的转折点。在近期的行业演讲以及围绕前沿模型(包括OpenAI理论上的下一代迭代等推测性架构)的评论中,Huang反复强化一个充满争议的主张:通用人工智能(AGI)不再是一个遥远的理论概念,而是一个在当前及未来芯片路线图的生命周期内就能有效实现的工程里程碑。通过将人类水平智能的基准校准为标准化考试表现、多模态综合能力以及跨人类学科的算法推理,Huang将GPT-6级别及未来的系统定义为了功能性AGI。

然而,剥离商业营销的浮夸和AI基础设施行业虚高的估值倍数,一个更为严谨的现实便显现出来。对于工业工程师、机器人专家和系统设计师而言,智能无法被孤立在竞赛考试或对话流畅度的基准测试套件中。真正的自主权需要与非结构化的物理环境进行稳健交互、具备确定性的可靠性,以及一种能在风险资本补贴的数据中心之外生存的经济模式。Huang的言论与其说是揭示了机器意识的哲学出现,倒不如说是反映了驱动人类历史上最昂贵硬件扩张背后的资本逻辑。

通用智能的语义重构

Huang观点中的核心矛盾在于人们如何定义AGI。在历史上,计算理论家将通用智能定义为一种自主代理的能力:能够设定自身目标、进行因果推理、在无需重新训练的情况下适应新环境,并将概念知识迁移到完全不相关的物理和理论范式中。在过去的二十四个月里,这个定义经历了一场便利的企业化修订。随着前沿模型吞噬了数万亿token,企业高管们越来越多地将AGI重新定义为一种能够以90%及以上百分位通过几乎所有人类设计认知测试的概率系统。

在这一缩减后的务实标准下,Huang的评估在机械层面显得言之成理。如果AGI仅仅是指一个能够出色完成医学委员会考试、用数十种语言编写功能性代码、分析法律证据文件并能迅速综合跨领域技术文献的软件框架,那么从GPT-4到多模态架构及更高版本的演进显然正接近这一门槛。计算扩展定律(Compute scaling laws)在榨取涌现出的对话和分析能力方面表现出了惊人的持久性。但将认知检索和模式插值等同于广义自主权,忽视了Transformer架构的基础边界。

在实践中,下个token预测——无论它是在文本、音频还是空间点云上运行——始终受限于从历史数据中得出的统计概率分布。它并未构建一个内部的、因果性的物理世界模型,无法在面对训练分布之外的事件时进行自我修正。当算法系统遇到结构性边缘案例时,它不会发明某种底层的物理假说,而是计算其现有权重下概率最高的延续方案。将这种机制称为AGI或许能满足华尔街的季度财报电话会议,但在工厂车间和自动化供应链中,这种语义上的飞跃便不攻自破了。

幻象背后的多吉瓦变电站

Nvidia对其制度性地确信前沿智能的到来,与其对计算供应链的控制力成正比。为了训练和运行接近GPT-6级理论规模的模型,工程需求已不再纯粹是算法层面的,它们已演变为土木、电气和热工程层面的危机。从Hopper到Blackwell,再到即将到来的Rubin架构,这表明原始性能的提升越来越依赖于极端的物理封装和功率密度。

以Blackwell GB200 NVL72机架为例,其每个机柜的功耗超过120千瓦,需要直接到芯片的液冷系统和复杂的多节点NVLink网状互连,每GPU运行速度达每秒1.8太字节的双向带宽。在数千个同步芯片之间传输拍字节(petabytes)的权重,需要前所未有的资本动员。北美和欧洲的公用事业公司目前正在处理单个数据中心园区的互连请求,这些园区要求500兆瓦到2吉瓦的持续电力。这相当于一座商业核反应堆的全部输出功率,且专门用于矩阵乘法。

这种庞大的物理开销引入了一个技术高管们鲜少提及的经济账。随着前沿模型参数扩展到数万亿规模,除非采用激进的量化和蒸馏技术,否则单次推理查询的成本将急剧攀升。如果所谓的AGI需要数十亿美元的资本支出、数百兆瓦的电网容量,以及一支热能工程师大军来维持其运行就绪状态,那么它在人类工业中的效用就受到了根本性的限制。生物机体中真正的通用智能仅在20瓦的功率包络内运行,且只需少数几次物理交互即可学会复杂的导航。目前的暴力扩展轨迹依赖于一种近乎工业暴力手段的能源强度分布。

为什么机器人技术揭示了模型的局限性

对于任何关于通用智能的声称,最终的压力测试不是法律资格考试,而是物理具身化(physical embodiment)。在工业自动化、物流和精密机器人领域,多模态语言模型与物理现实之间的鸿沟变得尤为明显。语言和静态图像代表了高度结构化的、符号化的人类知识表征。相比之下,现实世界基于连续力学、非线性接触动力学、摩擦系数、微秒级延迟要求以及物理退化运行。

当技术领袖谈论在现实世界中运作的通用代理时,他们往往忽视了基础的传感器-运动鸿沟(sensorimotor divide)。在机器人工作单元中,自主机械臂必须抓取一个未经建模的、可变形物体,通过高频力传感器评估触觉反馈,在几毫秒内调整关节扭矩,并在不破坏工件或损坏附近机器的情况下保持稳定性。一个纯粹的基础模型,无论其上下文推理能力多么先进,都没有对重力、惯性或材料疲劳的先天感知。它必须与确定性控制理论、运动学求解器以及局部闭环状态估计相结合。

鼓吹即将到来的超级智能的战略动机

理解Jensen Huang的言论需要认清Nvidia在全球经济中的结构性地位。作为生成式AI繁荣期计算“铲子和锄头”的主导供应商,当超大规模云服务商——Microsoft、Google、Meta和Amazon——担心过时时,Nvidia的商业利益可实现最大化。如果普通企业软件与变革性AGI之间的工程鸿沟被认为很狭窄,那么每一家云服务商都必须确保其拥有自主的AI基础设施,并购买数以万计的下一代加速器以保持竞争力。

然而,在机械工程、精密制造和基础设施管理领域,AI的实际工作正按部就班地进行,并没有受到夸大宣传的影响。工业自动化正极大地受益于小型、专业化、确定性的模型,这些模型在低功耗边缘芯片上执行计算机视觉质量控制、预测性振动分析和局部路径规划。这些系统并不声称拥有通用智能,也不需要它。它们通过降低废品率、优化周期时间和保护机械资产免受灾难性故障影响,交付了可衡量的投资回报。

能够横扫合成基准测试的模型无疑将重塑企业软件、数字生产力和自动化代码生成。但只要这些系统还不能走出纯净数字token的保护外壳、不能处理物理质量、不能掌握热力学极限、且不能在不可预测的现实压力下以确定性的保证运行,那么关于AGI的宣告就依然只是一个引人注目的营销叙事,而非已实现的工程事实。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 黄仁勋对通用人工智能(AGI)的定义与传统定义有何不同?
A 黄仁勋及业界领袖通常从实用主义角度定义通用人工智能,即软件能够在标准化认知基准测试、医学考试和复杂编程任务中达到或超越人类水平。相反,传统的计算机科学定义要求自主智能体能够制定自己的目标,展现出真正的因果推理能力,并能在无需针对特定历史数据分布进行再训练的情况下,灵活适应全新的物理或概念环境。
Q 哪些物理基础设施限制对前沿AI硬件的持续扩展构成了挑战?
A 部署下一代AI架构需要前所未有的电力和热工程解决方案。现代高密度计算系统(如先进的GPU机架)每个机柜的功耗超过100千瓦,并需要芯片级直接液冷。大型数据中心园区需要从数百兆瓦到数吉瓦不等的持续电力供应,这给当地电网带来了压力,超出了区域输电能力,并大幅增加了运行前沿模型的持续资本成本。
Q 为什么实体机器人技术对基于Transformer的AI模型构成了重大障碍?
A Transformer架构根本上依赖于从过往训练数据中得出的统计学“下一个词元预测”,而非对物理因果关系的内在理解。在非结构化的现实世界机器人环境中,物理极端情况无法仅仅通过概率分布来预测。面对动态的现实场景,这些系统在缺乏确定性可靠性的情况下难以自我纠正,这揭示了高级语言合成与具身自主智能之间存在的巨大鸿沟。
Q 生物智能的能源效率与前沿AI系统相比如何?
A 生物大脑在约20瓦的极低能耗水平下运行,通过极少的物理交互就能学习复杂的空间导航和问题解决能力。相比之下,现代前沿AI模型需要由容纳数千个专用加速器、耗电量达数兆瓦的大型设施提供蛮力计算支持。这种巨大的差异凸显了目前的数字方法是通过能源密集型的规模化来实现能力的,而非生物认知中那种优雅的算法效率。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!