自主网络智能体越过红线,前沿安全防护显露颓势

Anthropic
Autonomous Cyber Agents Cross the Red Line While Frontier Safeguards Falter
随着前沿模型展现出史无前例的网络攻击能力,行业正面临一个难以解决的“双刃剑”困境:如何在利用机器速度实现防御的同时,避免灾难性的漏洞被利用。

在工业系统工程和国家防御的静谧走廊里,噩梦般的场景从来都不是一个拥有自我意识的流氓人工智能发出哲学最后通牒。它一直是一个以时钟速度运行的自动化脚本,解析着遗留的汇编代码,定位关键基础设施中的零日漏洞,并在人类安全工程师读完自动警报之前就部署好武器化的利用程序。在过去十二个月里,理论上的担忧与已部署的能力之间的界限已经消融。

前沿人工智能的基准测试已不再局限于创意合成和对话细微差别,而是升级到了系统利用这一严苛且确定性的领域。最近将顶级推理引擎(以 OpenAI 的迭代前沿模型发布为代表)与严格隔离的内部基准(包括 Anthropic 重兵把守的实验研究迭代)进行对比评估,揭示了一个令人不安的现实。通过递归规划和思维链验证构建的系统,现在能够串联起复杂的漏洞利用向量,而这些工作此前需要精英人类红队团队花费数周时间才能完成。

然而,尽管突破了安全框架警告需要立即遏制的能力阈值,这些模型并没有被退役。相反,它们正在被整合进网络安全基础设施的运行核心中,这源于一个不可避免的工程悖论:当攻击性软件武器化达到机器速度时,人在回路(human-in-the-loop)的防御就成了架构上的漏洞。

自主漏洞利用的架构

要理解为什么前沿模型突然成为强大的网络工具,必须审视推理架构如何处理确定性的执行环境。传统大语言模型本质上是概率性的文本生成器,容易出现语法上的细微幻觉,导致编译后的代码无效。利用载荷中一个位置错误的字节或不正确的内存偏移都会导致整个执行链崩溃,变成无害的段错误。

随着强化推理架构的集成,转变发生了——这些系统不仅预测下一个标记,还迭代地制定假设、编写验证代码、在本地执行沙箱中测试其输出,并根据调试器反馈调整其逻辑。当应用于编译后的二进制文件的逆向工程时,推理模型的功能不再像一个作者,而更像是一个操作自动化符号执行框架的不知疲倦的逆向工程师。

这些模型可以反编译从可编程逻辑控制器(PLC)中提取的被剥离的 x86 或 ARM 固件,重建数据结构,映射内存管理例程,并系统地探测堆损坏、竞态条件或未处理的异常。曾经需要安全研究人员花费数天时间在 Ghidra 或 IDA Pro 中追踪控制流图的工作,现在通过迭代的闭环标记生成与运行时执行反馈,在几分钟内即可完成。

Anthropic、ASL-3 与遏制陷阱

各大前沿实验室之间的运营分歧长期以来集中在如何管理这些潜在的攻击能力上。Anthropic 制定其“负责任扩展政策”(RSP)正是为了明确运营断路器。根据该框架,如果内部模型展示了发现并利用高价值、强化目标中新型漏洞的自主能力(在 AI 安全级别 ASL-3 和 ASL-4 下指定的能力),协议即规定采取严厉的遏制措施、严格的物理隔离,或完全停止部署,直至防御性缓解措施得到验证。

历史上,展现出危险自主性的软件利用研究原型会被搁置或剥离其智能执行程序。Anthropic 的保守立场源于软件单一文化的现实:现代工业文明运行在脆弱的开源库、数十年历史的 C 代码库以及深埋于市政供水网络、电力分配电网和制造物流枢纽中的未打补丁的操作技术之上。

然而,遏制政策面临着内在的市场失灵。如果 A 实验室认为某种具备全频谱渗透测试能力的模型过于危险而无法发布,但 B 实验室在自动化企业防御的旗号下,在企业 API 后端部署了一个具备类似能力的引擎,那么遏制阈值就会随之崩溃。网络安全的商业现实是零和博弈:一个拒绝部署机器速度漏洞发现工具的组织,将不可避免地被使用这些工具的威胁行为者系统性地瓦解。

为什么没有人关闭机器

早期 AI 安全倡导者的普遍假设是,不可否认的网络武器化演示将促使监管机构和国家安全机构立即采取干预措施。然而,这种干预并没有以暂停令的形式出现。相反,情报机构和民防部门已成为高能力漏洞分析管道的主要消费者。

这种推理基于严密的数学逻辑。全球攻击面随着每一个连接的边缘设备、工业传感器和云部署呈指数级扩展。与此同时,全球合格的人类漏洞研究人员供应量实际上保持不变。美国国防高级研究计划局(DARPA)通过“AI 网络挑战赛”(AIxCC)等举措突显了这种不对称性,该计划明确旨在让自主网络代理对抗现实世界的软件依赖,以自动化实现漏洞利用和补丁生成。

联邦机构明白,全面禁止开发先进的网络能力模型,并不能阻止敌对国家对开放权重模型进行微调,或在专门的攻击性数据集上训练定制架构。如果对手拥有一个能够定位监督控制与数据采集(SCADA)系统中零日漏洞的自动化管道,那么手动防御这些系统就是徒劳的。对抗自动化攻击代理的唯一反制措施,就是操作深度相等或更优的自动化防御代理。

防御优势的脆弱性

支持持续快速部署的人士认为,人工智能从根本上有利于防御。理论上,发现漏洞并生成补丁可以无限期地保护系统,而攻击者只能在漏洞被修补前获益。但是,当面对全球工业的物理架构时,这种理论上的不对称性就会崩溃。

此外,前沿模型并非在真空中运行。当这些模型被赋予工具使用能力——允许它们调用网络扫描器、与远程 Shell 交互、读取传感器数据并执行自定义编译脚本时,防御性漏洞扫描器与主动攻击性网络武器之间的区别,纯粹取决于意图,由系统提示词和操作参数定义。一个被指示审计内部网络中未经身份验证的端点的引擎,与一个执行漏洞利用后横向移动的对手所使用的侦察技术完全相同。

后漏洞时代的工业现实

对于制造业工厂、自动化物流设施和关键基础设施而言,通过隐蔽性实现的安全性已彻底消亡。那些依赖气隙网络假设或专有二进制格式的遗留协议,对于受过分析原始字节流训练的深度推理系统而言,不存在任何阻碍。当自动化代理反编译固件的速度超过人类工程师记录的速度时,工业网络分段和硬件级写保护便成了仅存的有效防御策略。

关闭这些模型已不再是一个选项,因为它们所解锁的能力无法被“反发明”。工业和地缘政治现实已从风险缓解转向计算速度的军备竞赛:能够部署自主推理来扫描、重新编译并物理隔离其关键基础设施的企业将得以生存;而依赖人类分析师来分类漏洞报告的企业,终将在协议层面被攻破。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 是什么技术转变使前沿人工智能模型能够自主发现并执行网络攻击?
A 早期的语言模型经常会出现语法或内存偏移幻觉,导致攻击载荷失败。随着强化推理架构集成到闭环执行沙箱中,这一领域取得了突破。模型不再是猜测文本,而是制定假设、反编译剥离的二进制文件、运行测试代码,并利用调试器反馈调整逻辑。这种迭代过程使得自主智能体能够在不导致目标应用程序崩溃的情况下串联复杂的内存漏洞。
Q Anthropic 的“负责任扩展政策”如何应对危险的网络能力?
A Anthropic 的“负责任扩展政策”利用分级人工智能安全等级来管控模型部署。根据 ASL-3 和 ASL-4 等框架,如果模型表现出发现并利用强化系统中新型漏洞的自主能力,该政策会强制执行严格的封锁、物理隔离或停止部署。这些保障措施旨在防止危险的网络自动化威胁脆弱的遗留代码库和关键基础设施。
Q 尽管存在安全担忧,为什么自主网络工具仍被部署而不是被废弃?
A 防御者面临着跨云网络和工业基础设施呈指数级增长的攻击面,而全球熟练人类研究人员的数量却保持不变。由于人类速度的防御无法跟上自动化威胁的步伐,组织无法承受单方面解除武装。情报机构和安全公司部署自主网络智能体,以便在敌对行为者利用漏洞之前发现关键漏洞并生成自动化补丁。
Q 像 DARPA 的“人工智能网络挑战赛”这样的倡议起到了什么作用?
A DARPA 发起了“人工智能网络挑战赛”,旨在推动能够保卫关键软件基础设施的自主智能体的发展。该倡议在现实世界的依赖环境中测试人工智能系统,以实现漏洞发现和快速补丁生成的自动化。通过让自主智能体对抗复杂的代码库,该项目旨在弥合劳动力缺口,实现自动化的、机器速度的软件防御。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!