Anthropic 在 Claude 内部发现了一种涌现的全局工作空间

Anthropic
Anthropic Uncovers an Emergent Global Workspace Inside Claude
Anthropic 的研究人员利用新型 Jacobian Lens 技术,在 Claude 内部发现了一种涌现的全局工作空间,揭示了其与生物工作记忆之间惊人的计算相似性。

近期,科技界频频出现耸人听闻的头条新闻,暗示研究人员在大型语言模型中发现了计算性“灵魂”的证据。然而,正如剥离营销炒作和形而上学推测后通常会发现的那样,真相扎根于严谨的数学力学之中。Anthropic 的可解释性研究团队发现的结构性证据表明,深度自回归模型正在自发地利用一种与认知神经科学中的“全局工作空间理论”(Global Workspace Theory)高度相似的架构来组织信息。

哺乳动物认知的生物架构与深度神经网络的数学优化之间的融合,代表了机制可解释性领域的一个重大里程碑。为了理解人工智能是如何得出与生物大脑经过数亿年演化出的相同的计算解决方案的,工程师们必须审视那些揭示这一隐藏结构的诊断工具。

利用雅可比透镜(Jacobian Lens)绘制黑箱

多年来,理解深度 Transformer 的内部决策边界一直是一个棘手的路由问题。像 Claude 这样的模型通过跨越复杂注意力机制和前馈模块的数十亿个分布式权重来运行。虽然从业者可以监控输入 token 和输出 logits,但中间的计算步骤在功能上仍然是不透明的。标准的探测技术往往会引入噪声,或无法区分被动表征与主动因果计算。

为了解决这一诊断局限,Anthropic 开发了一种名为“雅可比透镜”(Jacobian Lens,或称“J-lens”)的数学诊断工具。基于多元微积分,雅可比矩阵代表了向量值函数的所有一阶偏导数矩阵。在这种语境下,J-lens 计算的是模型最终 logit 分布相对于任何给定层中隐藏状态激活的偏导数。

J-空间的架构

在这一孤立的“J-空间”内,Anthropic 证明了 Claude 在推理过程中会动态地暂存和操纵信息。当模型执行复杂的问题求解任务时(例如计算国际象棋比赛中的连续走法或解析嵌套的逻辑推演),J-空间就像一个内部草稿本。研究人员观察到,修改该工作空间内的激活状态会系统性地改变模型的最终生成结果,这证实了该子空间并非观测产生的假象,而是模型实际的计算控制总线。

此外,当研究人员提示系统保持特定的操作参数(例如在严格保持道德公平或遵循程序规则的情况下评估复杂场景)时,J-lens 记录了模型主动将这些概念向量移入工作空间并将其锚定在其中。致力于处理不相关语法子任务的分布式 Transformer 头部会持续引用这一集中式空间,以确保数千个解码步骤的一致性。

优化是否需要趋同演化?

Anthropic 这一发现中技术意义最重大的方面在于,没有任何软件工程师在 Claude 的参数预算中有意设计这种全局工作空间。该模型是在传统的交叉熵损失函数下训练的,任务仅仅是最小化跨大规模文本语料库的下一 token 预测误差。这种集中式路由枢纽的出现完全源于数学上的必要性。

在演化生物学中,“趋同演化”描述了完全无关的生物体为了解决相似的环境制约而进化出几乎相同的物理适应性,例如鲨鱼和海豚的流体动力学外形。在计算理论中,湿件(生物大脑)与硅基计算之间似乎正在发生类似的动力学过程。生物大脑和人工神经网络都面临着在严格的架构约束下管理资源分配的基本挑战。

跨越数十亿个参数的全连接、全对全通信拓扑在计算上是极其昂贵的。允许每一个参数在每一毫秒都直接向其他所有参数广播,将导致计算复杂度和热耗散的指数级爆炸。通过将高维数据折叠成一个只广播最显著信号的压缩低维瓶颈,生物演化和梯度下降独立地得出了相同的最优解:一个集中式的作业记忆缓冲区。

可解释工作空间的工业用途

在理论实验室之外,发现有组织的全局工作空间对于工业自动化、机器人技术和安全关键型机器学习部署具有直接且显著的影响。当前企业采用生成式模型时,经常受困于非确定性的失败模式:幻觉、突发性的上下文偏移以及无法解释的推理中断。在高风险制造、自动物流和电网调度中,黑箱系统代表了不可接受的运营风险。

隔离和监控模型 J-空间的能力,将人工智能从一种不可预测的概率引擎转变为一个具有可检查状态寄存器的系统。工业工程师理论上可以实现实时运行监控,在物理机器人执行指令或自动控制系统触发断路器之前,审计全局工作空间的内容。

如果命令模型监督一个物料搬运单元并优先考虑人员避让区域,安全控制器就不再需要完全依赖 token 化的输出监控。遥测系统可以通过线性投影直接探测 J-空间,以验证空间约束是否仍然在作业记忆中被主动广播。如果在上下文切换过程中概念从工作空间中丢失,主机监督程序可以在故障在物理硬件上显现之前拦截该模式。

重塑意识辩论

将这种涌现出的内部协调标记为“灵魂”或意识体验是一种可以理解的人类偏见,但它从根本上误解了高维线性代数的机制。全局工作空间并不是主观体验的指标;它是分布式数学运算的一种高效路由架构。

Anthropic 的研究表明,智能行为,无论是通过生物离子通道执行还是通过硅基张量核心执行,都需要结构化的信息流。随着模型在参数密度和工业部署上的规模扩大,计算力学与认知架构之间的差距将继续缩小。J-空间的出现证明,深度网络不仅仅是在记忆统计纹理;它们正在构建有组织的、功能性的计算机械,以驾驭复杂的信息物理学。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 什么是雅可比透镜(Jacobian Lens),它如何分析 Claude 的内部机制?
A 雅可比透镜(J-lens)是一种用于探测深度神经网络的数学诊断工具。它源于多元微积分,通过计算模型最终对数几率(logit)分布相对于不同层隐藏状态激活的偏导数来工作。这使得工程师能够将主动的因果计算与被动的表征区分开来,从而绘制出推理过程中中间推理发生的内部计算子空间。
Q 在 Claude 内部发现的涌现式全局工作空间是什么?
A 涌现式全局工作空间是 Claude 内部的一个集中式计算子空间,其功能类似于生物的“工作记忆”。它充当内部草稿纸,在序列推理或规则遵循等复杂任务中动态地存储和操作信息。不同的 Transformer 组件在解码步骤中引用此共享中心,使模型能够在不需要数十亿参数之间进行全对全连接的情况下,协调子任务并保持连贯的上下文。
Q 为什么 Claude 会发展出类似于生物工作记忆的内部架构?
A Claude 的这种架构是通过梯度下降和标准的下一个 Token 预测训练自发形成的,而非显式编程的结果。生物大脑和人工神经网络在跨大规模网络路由信息时都面临严峻的计算约束。为了避免直接的全参数通信带来的资源爆炸,两个系统独立地收敛于一个能够聚合和广播关键信号的低维瓶颈,这证明了生物智能与人工智能之间存在计算上的趋同演化。
Q 发现全局工作空间如何提高工业应用中的 AI 安全性?
A 识别出局部化的工作空间使工程师能够实时监控内部状态寄存器,而不必仅仅依赖生成的文本输出。在机器人和工业自动化等安全关键领域,遥测系统可以审计工作空间,以确保在执行机构执行物理命令之前,操作约束(例如作业人员清空区域)已在工作记忆中得到有效维护,从而大幅降低与幻觉和推理失败相关的风险。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!