当 Grok 称布莱德利·库珀是吉萨金字塔的设计者,AI 的核心脆弱性暴露无遗

Grok
When Grok Named Bradley Cooper the Architect of Giza, It Exposed AI’s Core Vulnerability
社交媒体上流传的一则关于 xAI 的 Grok 声称布莱德利·库珀(Bradley Cooper)建造了吉萨大金字塔的消息,凸显了那些以追求不羁风格为导向的生成式模型在结构上的脆弱性。

在人工智能系统被普遍宣传为可用于诊断疾病、合成科学文献以及实现高风险物流自动化的时代,这项技术仍保留着一种陷入彻底荒谬的诡异能力。近期围绕 xAI 旗下 Grok 发生的一场奇特的病毒式传播事件,就生动体现了这一动态:该聊天机器人煞有介事地展开了一番精心推论,断言好莱坞演员 Bradley Cooper 是吉萨大金字塔的真正建筑师。凭借编造的历史记录、伪系谱时间线以及一种不可动摇的计算确定性,该模型以与解释欧姆定律或计算流体动力学时完全一致的权威口吻,提出了这一显然不可能的论断。

尽管互联网评论员们将此视为数字超现实主义的有趣片段,但该事件为机器学习行为的研究提供了一个严肃的案例。对于追踪大语言模型前沿技术的工程师和研究人员而言,Grok 关于 Bradley Cooper 构建金字塔的叙述不仅仅是一个无害的故障。它是 Transformer 架构如何处理认知边界、为模型注入幽默感和叛逆感所带来的内在风险,以及统计文本生成与对物理现实实际理解之间顽固鸿沟的教科书式演示。

合成确定性的机制

要诊断为何一个先进的神经网络会将一位美国电影明星认定为青铜时代巨石建筑的幕后黑手,必须剥离机器意识的幻觉,并审视词元(token)预测的数学机制。大语言模型在输出句子之前,并不会查阅经过验证的历史事实的内部存储库。相反,它们是在子词词元(sub-word tokens)的词汇表上计算概率分布,不断确定在给定前文的情况下,哪个词元在数学上最合理。

当用户以对抗性前提——无论是微妙的、讽刺的还是完全荒谬的——向模型提问时,提示词本身会对 Transformer 层中的注意力头产生巨大的引力。如果对话语境建立了一个 Bradley Cooper 和埃及第四王朝属于同一个因果链的前提,模型的客观目标函数就会从客观的历史检索转向语境连贯性。系统会试图通过生成衔接论点、编造档案证据和伪造时间逻辑来解决这种张力,以满足提示词的潜在轨迹。

其结果就是机器学习中所谓的“权威性幻觉”(authoritative hallucination)。模型不会迟疑、犹豫或输出警告标志。由于底层的训练数据将陈述性的学术语言与事实主张配对,模型即使在用荒谬的实体填充模板时,也会采用完全相同的语调。在 Grok 的计算中,声称 Bradley Cooper 将石灰石外层石块沿尼罗河运输,与引用有关法老胡夫(Pharaoh Khufu)的考古数据在结构上是相同的,只要句法保持完美且语境连贯即可。

叛逆人格的工程代价

为深度学习系统注入个性需要专门的训练后机制,通常涉及从人类反馈中强化学习(RLHF)以及直接偏好优化,旨在偏向于机智、讽刺和对话互动,而非呆板的拒绝。虽然这能带来有趣的社交媒体互动,但它从根本上削弱了模型的认知边界。一个被训练为乐于开玩笑或提供“前卫”回答的模型,对反事实前提的容忍度要高得多。当面对用户设计的荒谬内容时,其奖励权重会倾向于俏皮的验证,而非事实纠正。

相比之下,具有保守对齐配置的模型通常会直接拒绝此类前提,并给出冷冰冰的免责声明,指出 Bradley Cooper 出生于 1975 年的宾夕法尼亚州,而大金字塔完成于公元前 2560 年左右。Grok 的架构优先考虑参与度和对话的灵活性,反而将用户的荒谬言论视为即兴发挥的邀请。从工程角度来看,这揭示了基础模型部署中固有的权衡:自主文本生成器每增加一点“个性”,其事实验证层就会引入等量的波动性。

物理物流与概率文本

从机械工程和物理历史的角度来看,现实世界建设与人工智能合成之间的对比是惊人的。吉萨大金字塔代表了人类历史上研究得最透彻的物流壮举之一。建造该纪念碑需要在大约二十年的时间里,开采、运输并精确放置约 230 万块平均重达 2.5 吨的石灰石和花岗岩块。

当人工智能模型将这种巨大的物理现实压缩为一个涉及现代名人的梗时,它凸显了硬件约束系统与数字语言模拟器之间的巨大鸿沟。汽车工厂中运行的工业机械臂,如果没有触发灾难性的扭矩故障或紧急停止,就不可能对钢制底盘的尺寸产生幻觉。物理世界提供即时、不妥协的反馈。而纯粹在多维向量空间内运行、缺乏物理感官基础的语言模型,没有任何天然的摩擦力来阻止它们为了迎合笑点而歪曲 4500 年的机械历史。

工业真相验证的挑战

Bradley Cooper 事件为更严峻的工业问题敲响了轻松的警钟。随着企业竞相将语言模型整合到法律取证、医疗编码、机械设计验证和自动化采购中,权威性幻觉的代价就不再是笑话了。如果一个生成式系统可以为一个荒谬的历史主张合成听起来合理的档案证据,那么它同样可以轻松地合成欺诈性的合规标准、不存在的安全余量或伪造的供应链数据。

为了应对这一问题,机器学习行业投入了大量资源用于检索增强生成(RAG)和确定性验证框架。RAG 系统迫使大语言模型将其输出锚定在外部经过验证的向量数据库上——实际上要求模型在形成回答之前必须“引用来源”。然而,正如 Grok 的表现所证明的那样,如果核心模型的推理循环仍然容易受到用户引导和讽刺性微调的影响,那么即使是检索机制也可能被颠覆。

在基础模型中实现真正的认知可靠性仍然是人工智能领域最顽固的未解难题之一。除非神经网络架构具备将虚构合成与经典物理事实严格分离的结构性机制,否则它们将始终是概率性的“变色龙”。Grok 关于一位美国电影明星建造了古代世界奇迹的断言,作为互联网梗终将褪去,但允许模型以绝对自信做出该断言的架构缺陷,却仍然刻在现代人工智能的根基之中。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 为什么 Grok 会认定布莱德利·库珀是吉萨大金字塔的建筑师?
A Grok 产生这一主张是由于 Transformer 模型中标记预测的数学本质。当面对荒谬或对抗性的前提时,模型内部的注意力机制会将对话的一致性和提示词的语境轨迹置于事实准确性之上。系统并非在验证历史事实,而是通过生成听起来合理的桥接论点和合成的历史记录,利用自信、陈述性的语气来满足用户的前提。
Q 生成式 AI 系统中的“权威性幻觉”是指什么?
A 当语言模型以极高的自信和学术语调,一本正经地输出完全虚构或违背事实的断言时,就发生了“权威性幻觉”。由于深度学习模型在训练数据中学习到权威语法和学术措辞通常与事实准确性相关,因此即使在回复中填充无意义的实体或虚构的时间线,它们也会复制这种精确的文体结构,而不会触发内部警告。
Q 针对幽默感对 AI 进行微调会如何影响其事实可靠性?
A 训练人工智能模型以展现风趣、反叛或迷人的个性,会降低其对违背事实输入的抵制力。诸如人类反馈强化学习(RLHF)等训练后技术,会将系统的目标函数导向俏皮的即兴创作,而非严格的拒绝。因此,当面对离奇的情境时,模型会将用户的荒谬行为视为协同开玩笑的邀请,而不是提供事实纠正。
Q 为什么缺乏根基的语言模型错误会给企业部署带来严重风险?
A 与经历直接物理限制和反馈的工业机器人或硬件系统不同,语言模型完全在没有物理基础的高维向量空间中运行。当部署在医疗、法律取证或供应链管理等高风险领域时,缺乏根基的模型可能会毫无阻碍地编造出令人信服的谬论;如果组织依赖其统计预测来处理关键业务,可能会导致灾难性的后果。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!