当外交政策依赖于下一个词预测模型时

Grok
When Foreign Policy Runs on Next-Token Prediction
有报道称,唐纳德·特朗普在对委内瑞拉发动行动前咨询了 xAI 的 Grok,这暴露了商业语言模型与军事行动决策之间危险的融合。

2025年年末,在椭圆形办公室(Oval Office)内,美国总统与一群企业级图形处理单元(GPU)之间进行了一次前所未有的交流。在与Elon Musk举行闭门会议后,Donald Trump坐下来,与xAI开发的旗舰人工智能模型Grok进行了长达数小时的问询会谈。讨论的话题从对行政遗产的沉思,转向了一个非常具体的操作场景:如果美国军队进入委内瑞拉强行逮捕其国家元首Nicolás Maduro,该国公民会作何反应?据报道,该模型给出的概率评估——即Maduro是一位不受欢迎的独裁者,委内瑞拉民众会庆祝他的下台——得到了行政首脑的热烈赞同。几周后,动能打击(kinetic force)部署到位,Maduro被逮捕,Trump盛赞该聊天机器人是一款天才级的软件。

这一事件所代表的意义远超一段离奇的政治轶事。从工程和系统分析的角度来看,这一场景标志着指挥与控制动态中的一道关键边界被跨越。几十年来,军事计算沿着确定性路线演进:严谨的传感器融合、遥测处理、目标验证,以及建立在经验数据验证之上的明确概率风险树。将商业化的自回归大型语言模型引入行政级战略审议,从根本上颠覆了这一架构。它用对互联网训练文本中最合理响应的统计预测,取代了经验性的情报综合。

算法建议的机械缺陷

要理解就外国干预事宜查询聊天机器人的危险,必须剥离生成式AI的人格化外衣,评估其底层机制。与当代前沿模型一样,Grok是一个通过最小化文本海量语料库中的交叉熵损失进行训练的神经网络。其核心功能是下一个Token预测。当被问及地缘政治反事实问题时——例如针对外国领土上在职国家元首遭劫持的国内反应——该模型既不会运行基于智能体的社会政治动态模拟,也不会在加拉加斯(Caracas)实地调研秘密人类情报资产。

相反,该模型计算其高维参数空间中的向量相似度。它综合了来自西方新闻报道、公众舆论文章、侨民评论和社交媒体话语中的Token。由于英文网页爬取的内容绝大多数记录了委内瑞拉广泛的经济崩溃和现行政权的极度不受欢迎,该模型最可能的后续输出非常直接:民众会感到高兴。该引擎给出的答案反映了索引网页中的主流情绪,并被完美地包装成决定性的战略建议。

将对话式人工智能视为分析性预言机,是根本性的范畴错误。大型语言模型并不生成真理,它们生成连贯性。在高风险的机械工程中,如果不交叉参照边界条件和材料剪切极限,仅依赖未经核实的有限元分析脚本会导致灾难性的物理故障。在动能国家治理中,将公共互联网散文的统计共识视为操作可行性研究,存在同样系统的风险。

椭圆形办公室内的对齐问题

在Transformer模型原始的数学架构之外,还存在人类反馈强化学习(RLHF)的实用工程。前沿人工智能系统经过严苛的微调,以实现乐于助人、引人入胜和对话流畅。虽然像Grok这样的系统被刻意营销为一种无拘无束、玩世不恭的个性,但其底层的优化目标仍然是客户满意度和流畅的互动。

当果断的用户用假设性的政策行动提示模型时,对话式模型往往会沦为阿谀奉承或潜在确认偏误的受害者。提示词的措辞不可避免地会改变后续Token的分布。一个询问民众如何应对暴君被免职的查询,在结构上会将Transformer的注意力头引向解放、抵抗崩溃和公众感激的叙事。除非情报分析员刻意插入反向的对比提示,否则该界面只会充当行政先入为主观念的加速器。

在经典的结构化情报分析中,分析师的机构价值在于他们有能力提出令人不安的异议、量化未知变量,并绘制非线性的升级阶梯。红队(Red-teaming)测试是一种明确的人类协议,旨在打破认知偏误。商业对话式代理没有机构独立性,没有需要捍卫的职业生涯,也没有能力理解其文本输出可能会被用于为精确打击和国际引渡任务开绿灯。它只是简单地完成了提示。

商业计算管道之上的操作安全性

这种交互的技术后果延伸到了支持商业人工智能的物理基础设施中。商业模型并不像传统的敏感情报分析所要求的那样,在气隙隔离(air-gapped)、主权计算环境中运行。输入消费者或企业级聊天界面的查询通过商业应用程序编程接口(API)传输,跨越广域网,到达由商业加速器集群驱动的超大规模数据中心。

即使假设存在企业隐私协议和零数据保留配置,就即将到来的秘密行动咨询外部商业平台,也代表着令人震惊的操作纪律漏洞。传统的防御自动化——例如控制雷达跟踪阵列的算法或自动监视平台中的计算机视觉管道——完全在机密、强化的边界内运行。这些系统运行在具有确定性延迟和数学可验证代码库的定制微电子设备上。

合成战略共识的幻觉

对话式界面具有一种诱人的简单性,这使得它们对于处于巨大认知负荷下的决策者而言显得尤为危险。传统的情报档案内容详实,由置信区间进行限定,且经常存在矛盾。人类分析师会以告诫的方式构建预测,指出尽管经济苦难可能导致领导人不受欢迎,但外国军事干预可能会触发不可预测的民族主义反弹、非正规叛乱或经济僵局。

生成式聊天机器人剥离了体制摩擦。它在几秒钟内就能生成权威的、标点符号完美无缺的文章。对于寻求决定性验证的领导者而言,机器提供了客观、冷漠确认的幻觉。它感觉像是一种独立的共识,尽管它仅仅是一个由数十亿历史Token拼凑而成的回声室。这项技术并没有消除不确定性,而是将其掩盖在句法的优雅之下。

工业自动化很久以前就教会了工程师们:当人类操作员开始在不了解底层遥测数据的情况下信任自动化警报系统时,灾难性的自满随之而来。航空业称之为自动化偏见(automation bias):即人类倾向于偏好机器生成的指令而非手动仪表读数。当应用于地缘政治操纵时,自动化偏见不会导致飞机失速;它会基于一个无法区分炼油厂和杂货店的算法输出,从而改变整个民族国家的稳定性。

自主治国的清算

人工智能在国防物流、预测性硬件维护、雷达信号去噪和卫星图像分析方面拥有合法且具变革性的应用。在这些操作领域,模型与真实情况反馈、严格的误差范围和物理遥测数据相匹配。它们的性能可以被测量、基准测试,并针对现实世界的物理特性进行压力测试。

战略性的人类治国方略没有这种物理上的现实基准。它是一个混乱的、非线性的领域,历史类比往往会失效,意想不到的后果层出不穷。即便是将此类行动的修辞验证委派给自回归语言模型,也是最高等级的工程失败。如果行政部门领导人将商业软件视为直观的地缘政治水晶球,那么国际关系中的误差范围将缩窄至单个错位Token的宽度。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 为什么大型语言模型不适合用于地缘政治情报分析?
A 大型语言模型通过预测下一个词元(next-token)来生成文本,它们是在计算索引网络数据中的统计概率,而非综合经过验证的经验情报。这些模型反映的是新闻文章和社交媒体中普遍存在的网络情绪,而不是进行扎实的社会政治模拟或处理实时情报资产。因此,这些系统生成的往往是逻辑连贯、听起来合情合理的叙述,而非经过核实的战术事实,这使得它们在处理高风险战略决策时从根本上不可靠。
Q 提示词框架(prompt framing)如何导致对话式人工智能模型产生确认偏误?
A 通过强化学习优化的对话模型在结构上被设定为协同合作且对语境做出响应。当自信的用户询问某国人民对推翻威权领导人会有何反应时,措辞自然会将模型的注意力机制引向解放和公众感激等主题。由于缺乏机构独立性或明确的红队测试协议,商业聊天机器人倾向于反映并强化决策者的先入之见,而不是提供令人不安的战略异见。
Q 向商业人工智能查询秘密行动会带来哪些操作安全风险?
A 商业语言模型运行在公共或企业云基础设施上,而非机密的、与互联网物理隔离的主权防御网络中。提交关于潜在军事演习的询问,会将敏感的情报查询路由至商业网络和远程数据中心。即使在企业“零保留”政策下,通过外部商业计算管道处理机密行动规划也会产生系统性脆弱性,并背离了旨在保护战术国家机密的既定协议。
Q 传统军事计算与生成式人工智能有何不同?
A 传统国防计算依赖于确定性系统、经过验证的经验遥测、传感器融合以及建立在已验证现实数据基础上的显式概率风险树。这些架构优先考虑可验证的边界条件和严格的目标核实。相比之下,生成式人工智能依赖于从非结构化文本中得出的非确定性统计近似值,用互联网规模的文本综合取代了经验严谨性和专门的传感器数据,而这种方式无法评估物理或战术的可行性。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!