当指挥决策遇上“下一个词预测”:咨询 Grok 进行军事突袭的弊端

Grok
When Command Decisions Meet Next-Token Prediction: The Flaws of Consulting Grok on Military Raids
据报道,唐纳德·特朗普在针对委内瑞拉采取行动前曾咨询埃隆·马斯克的 Grok AI。这一事件凸显了统计文本生成与现实地缘政治机制之间存在的危险鸿沟。

现代行政指挥依赖于复杂的智能架构:传感器阵列、卫星遥测、人类情报网络以及多变量地缘政治建模。然而,据《时代》杂志的一篇报道披露,针对委内瑞拉领导人 Nicolás Maduro 的军事任务在实施前,经历了一个截然不同的前奏:总统 Donald Trump 与 Elon Musk 旗下 xAI 所构建的对话式大型语言模型 Grok 在白宫椭圆形办公室进行了一番对话。

据报道,在 2025 年末的多次深度会谈中,Trump 曾就抓捕 Maduro 的潜在后果询问该聊天机器人,探讨如果美国执行此类突袭,委内瑞拉公众会有何反应。该模型给出的评估在很大程度上反映了西方媒体的共识:作为一个不受欢迎的独裁者,Maduro 的下台将受到公众的广泛庆祝。几周后,抓捕行动如期进行。据报道,总统在离开时坚信这一生成式系统已准确勾勒出了外国政权更迭的局势。

对于一名受过控制系统、自动化反馈回路和确定性失效模式评估训练的工程师来说,这一披露不仅是一个政治新闻,更是一个典型的分类错误示范。大型语言模型在自然语言解析和高维向量空间方面取得了非凡成就。然而,它们并不是因果推理引擎、预测性状态机,也不是能够计算动荡主权国家在动力学、经济和制度平衡方面复杂局面的战略顾问。

大型语言模型的统计现实

理解为什么对话式人工智能不适合作为国家安全规划的基础,需要剥离生成式界面的人格化外衣。Grok 与同期的 GPT-4 和 Claude 一样,本质上是一个自回归 Transformer 模型。它通过将原始文本分解为离散的 Token,并根据在海量抓取数字文本语料库上训练出的数十亿个模型权重,计算下一个 Token 逻辑出现的统计概率。

当被问及平民会对外国军事行动有何反应等查询时,该模型运行的并不是前瞻性的博弈论模拟。它不会解析机密情报档案、对区域燃料物流进行建模,也不会跟踪碎片化国内军队中的微型派系。相反,它计算的是与历史上关于独裁者面临倒台的讨论相关联的统计概率最高的英语句子序列。由于西方新闻档案、智库白皮书和社交媒体平台(特别是直接接入 xAI 流水线的 Musk 旗下 X 平台)上的主流话语倾向于从经济崩溃和政治压迫的角度来审视 Maduro,因此该模型在数学上会向“庆祝”和“解脱”这一语义簇靠拢。

这一过程产生的输出听起来极其权威、流利且直观。然而,这种流畅性与因果机制完全脱节。自回归 Transformer 只是在复述其训练集中语义上的平均共识。当应用于地缘政治战略时,它充当的是一种传统智慧的“回声室”,而非能够识别结构性漏洞、黑天鹅动态或非线性报复连锁反应的分析框架。

现代生成式系统中因果建模的缺失

在机械工程和工业机器人领域,控制模型必须理解因果关系。如果机器人执行器对机身组件施加 500 牛顿的侧向力,控制软件必须依赖严谨的物理方程来预测应力、应变、热膨胀和机械失效。在结构工程中,仅依赖统计相关性而非因果建模必然会导致灾难。

地缘政治决策是在更为动荡的动态环境下运作的。抓捕外国国家元首会引发复杂的非线性动态:制度性的权力真空、军事指挥链的断裂、供应链的中断、货币的恶性贬值以及外国代理人的博弈。预测这些后果需要进行结构性建模,并考量反馈回路、当地资源依赖性和非对称战争能力。

Grok 及类似语言模型缺乏因果世界模型。它们无法以数学精度模拟反事实状态,因为它们并不理解支配人类社会的潜在物理、经济和社会政治机制。当大语言模型断言民众会庆祝时,它并没有评估国内炼油厂是否拥有维持电网稳定的备件,也没有评估区域军阀是否会利用随之而来的权力真空。将高概率的 Token 输出视为战略验证,是将语言上的合理性与操作上的事实真相混为一谈。

确认偏误的危险反馈回路

当世界领导人询问人工智能一项大胆、果断的军事打击是否会受到欢迎时,提示词的措辞不可避免地引入了语义偏差。生成式系统旨在生成与所提供上下文相符的连贯补全内容。与职业生涯取决于提供异见、进行红队测试假设并强调灾难性极端情况的严谨情报分析师不同,文本生成引擎没有制度记忆、没有问责制,也没有良知。它为用户提供了一个验证其提问倾向的流畅叙事,从而营造出一种分析共识的错觉。

这种心理陷阱制造了一个具有欺骗性的闭环:行政长官提出行动,统计模型反映出支持该行动的主流文本情绪,行政长官则将机器的确定性计算解释为一种独立的、客观的认可。随之而来的现实冲突——旷日持久的法律泥潭、中止的民主进程、持续的资源争夺和螺旋式上升的外国纠葛——都被视为不可预测的噪音,而非依赖于一种根本不具备因果推断能力的工具所带来的必然结果。

计算规模无法替代系统工程

白宫对人工智能日益增长的依赖,展示了最高管理层对技术能力认知方式的持续转变。Elon Musk、Nvidia 首席执行官 Jensen Huang、Amazon 的 Jeff Bezos 和 Meta 的 Mark Zuckerberg 等科技领袖齐聚一堂的高规格会议,凸显了投入前沿数据中心的巨大资本和工业算力。数以万计的先进 GPU 被连接在数吉瓦级的设施中,以训练规模不断庞大的基础模型。

然而,扩大计算规模和增加参数数量并不能自动弥合相关性与因果关系之间的鸿沟。一个在整个公共互联网上训练并拥有万亿参数的模型,确实比拥有百亿参数的模型能记忆更多事实并更快地合成文章,但它仍然受限于 Transformer 架构的数学边界。它优化的是可能性,而非实证验证。

人工智能在适当边界内部署时,在国防领域具有巨大的前景:处理雷达图像、优化供应链物流、检测电磁频谱中的异常信号以及管理工业生产线。但一旦领导层将生成式文本提示视为战略原则和人类情报综合的替代品,该系统就不再是分析资产,而会变成一种负担——一面将我们自身的制度假设伪装成硅基全知,并反射回给我们的镜子。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 在围绕针对尼古拉斯·马杜罗的美国行动的讨论中,Grok 发挥了什么作用?
A 有报道披露,唐纳德·特朗普在 2025 年末的椭圆形办公室讨论中,曾就针对委内瑞拉领导人尼古拉斯·马杜罗的预定抓捕行动询问埃隆·马斯克的对话式人工智能 Grok。特朗普询问委内瑞拉民众会对马杜罗被捕有何反应,该系统预测会引发广泛的公众庆祝。这一回应与西方媒体的共识高度吻合,并被决策者视为对此次突袭行动的验证。
Q 为什么像 Grok 这样的大型语言模型不适合用于军事和地缘政治预测?
A 大型语言模型本质上是自回归 Transformer,它们基于海量的历史文本语料库来预测标记的可能序列。它们缺乏因果世界模型、实时战术情报和物理模拟能力。因此,它们无法计算诸如供应链崩溃、地区代理人报复或权力真空等复杂的非线性结果,而是倾向于重现语义相关性,将常规的修辞共识误认为是严谨的战略分析。
Q 训练数据如何影响 Grok 对国际领导人和政治事件的评估?
A Grok 生成的回应源自其训练数据集中的统计模式,这些数据包括数字新闻、智库分析以及 X 等平台上的公开社交媒体帖子。当被问及威权政权时,模型会围绕有关经济衰退和政治压迫的主流叙事进行聚类。该人工智能并非独立评估活跃的国内动态,而是反映了其原始资料中现存的普遍文本共识。
Q 当领导人咨询 AI 聊天机器人以进行国家安全决策时,会产生哪些确认偏误风险?
A 生成式模型倾向于以与用户查询在语义上协调一致的方式完成提示,从而形成一种加强预设假设的回声室效应。与职业情报分析师不同,人工智能缺乏机构记忆、专业问责制以及进行“红队”测试或强调灾难性极端情况的任务授权。依赖对话式系统可能会产生一种存在独立共识的错觉,同时掩盖严重的结构性盲点。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!