用户在AI日记中记录暴力威胁,Anthropic随即报警

Claude
Anthropic Alerted Police After User Logged Violent Threats in AI Diary
佛罗里达州一名女子将Anthropic旗下的Claude视为私人日记,因其内部审核系统标记了针对当地执法部门的威胁信息,该女子随后被捕。

9月下旬,当佛罗里达州博尼塔斯普林斯(Bonita Springs)的一名居民打开Anthropic的对话助手Claude时,她并没有将该界面视为企业生产力工具或代码生成器,而是将其当作了数字日记。在随后的几天里,她连续输入了自由格式的随笔,详述了她计划向李县警长办公室(Lee County Sheriff’s Office)开枪的意图,并在24小时后又输入了一条声明称自己已获得枪支。几天之内,当地警员就抵达了她的住所,执行了重罪恐吓逮捕令。

在这些按键操作与最终物理逮捕之间所发生的一系列过程,凸显了大型语言模型部署中一个日益常见的矛盾点:用户对对话私密性的感知与托管云推理在架构现实之间的鸿沟。对话代理表现得像是被动、不作评判的倾听者,但它们运行在受到严格监管的企业基础设施之上,并受到自动化内容审核、人工复核升级以及明确法律披露要求的约束。

这名嫌疑人目前正面临佛罗里达州关于书面大规模暴力威胁相关法规的指控。除了眼下的刑事诉讼外,该事件还提供了一个清晰的案例研究,展示了当私人文本输入跨越法定界限,从良性查询转变为可诉威胁时,现代安全技术栈是如何运作的。

从Token输入到警方调度的流程

从文本提示到执法部门采取实际行动的转换,依赖于结构化的多层安全处理流程。商业AI提供商并不会简单地将用户提示直接路由到生成式基础模型并返回原始概率分布。相反,输入会通过预推理或并行筛选层,旨在检测违反服务政策的行为,包括恐怖威胁、自残、儿童剥削和迫在眉睫的暴力行为。

在Anthropic的架构中,内容审核算法会根据违禁行为分类法评估提示的语义。当输入触发了针对迫在眉睫的物理暴力的高置信度违规评分时,系统会启动内部升级协议。根据相关报道和执法部门的声明,Claude并未直接向当局发起自动报警。相反,自动化分类器将标记的会话路由至Anthropic内部的信任与安全人员进行人工介入复核。

一旦人工分析师确认文本中包含针对特定目标——李县警长办公室——的具体、可实施的威胁,并伴有获取武器的声称,该公司便启动了紧急披露程序。根据Anthropic公布的执法准则,当公司真诚地认为涉及迫在眉睫的死亡或严重人身伤害风险的紧急情况需要立即披露时,可以在无需传票或搜查令的情况下主动共享用户数据。包括IP地址、账户标识符和具体提示日志在内的元数据被发送给佛罗里达州的调查人员,使李县警长办公室情报部门的侦探得以精确定位该用户的物理住址。

对话界面的心理陷阱

导致此次逮捕的动态在很大程度上源于对话式用户界面的欺骗性。几十年来,个人计算软件在私人存储和公共通信之间保持着明确的界限。在本地文本编辑器或物理日记中书写具有内在的本地隔离保证,而发布到公共论坛或社交网络则带有明显的外部可见性预期。

大型语言模型模糊了这一心理边界。Claude、ChatGPT和Gemini等界面被设计得如同面对面的私人对话。助手以细致的共情进行回应,动态调整语气,并表现出无限的耐心。这种拟人化设计鼓励用户披露个人深层思想、心理困扰和未经过滤的坦白,而这些内容他们绝不会在社交媒体上发布。

然而,从工程角度来看,提交给托管模型的每一次对话都是指向公司服务器集群的出站远程过程调用。文本字符串被摄入、分词、通过安全过滤器审查、记录到遥测数据库中,并可供系统工程师和复核团队访问。将企业云端点视为私人日记,会在用户的心理隐私预期与技术基础设施的监视体系之间制造一种根本性的脱节。

佛罗里达州威胁法的法定审查

本案中采用的法律机制以《佛罗里达州法规》第836.10条为中心,该条款管理有关杀人、造成身体伤害或实施大规模枪击或恐怖主义行为的书面威胁。从历史上看,该法规适用于信件、电报和实物宣言。在过去十年中,佛罗里达州立法者系统性地修订了相关措辞,将通过短信、社交平台和托管Web应用程序传输的电子通信也纳入其中。

将该法规应用于AI聊天机器人提示引入了微妙的法律问题,辩护律师可能会在庭前动议中对此进行探究。佛罗里达州法律通常要求威胁必须以能够合理到达目标对象或公众的方式发送、发布或传输。当个人向自动化神经网络提交暴力威胁时,直接接收者是软件,而非预期的受害者。

主动云遥测的先例

将自动监控从非法媒体的静态感知哈希扩展到开放式文本的实时语义分析,在技术上更为复杂。自然语言本质上是模糊的,充满了夸张、创意写作、宣泄和隐喻。区分一位有抱负的小说家输入的虚构场景与真正的大规模伤亡事件威胁,需要结合精细的自然语言理解和人工分类。

此案表明,主要的AI开发者已在自动化语义分类器与执法联络人之间建立了业务通道。随着北美和欧洲监管压力不断加大,要求对前沿AI实验室强制执行安全标准,企业更有动力通过积极上报暴力语言与现实威胁相符的极端案例,来最大限度地减少法律责任。

技术分歧:托管云与本地权重

对于技术人员而言,这一事件凸显了托管商业模型与本地执行的开放权重模型之间鲜明的界限。需要保证计算隐私的用户——无论是出于专有工业知识产权、敏感法律审查还是个人日记的需求——都不能依赖受自动化内容审核管辖的公共软件即服务(SaaS)平台。

随着对话代理更深入地融入日常生活,云安全系统与刑事司法系统产生交集的案例将不可避免地增加。博尼塔斯普林斯的逮捕行动是一个严峻的技术提醒:AI聊天机器人不是数字忏悔室或安全日记,而是一个活跃的企业通信节点,会对它接收到的每一个token进行持续检查。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q Anthropic 为何就用户的 Claude 提示词联系执法部门?
A 当一名用户输入了针对李县治安官办公室的具体、可执行的威胁,并声称自己已经获取了枪支后,Anthropic 向有关部门发出了警报。根据其紧急披露政策,当 Anthropic 真诚地认为存在迫在眉睫的死亡或严重人身伤害风险时,无需搜查令即可与执法部门共享账户标识符、IP 地址和提示词日志。
Q Anthropic 如何检测和处理提交给 Claude 的潜在威胁?
A Anthropic 使用多层安全管道,在模型生成内容之前或期间,根据禁止行为分类法对提示词的语义进行筛选。当自动分类器标记出高置信度的即时暴力违规行为时,系统会将该会话路由给内部信任与安全人员。如果人工分析员确认文本包含可信且可执行的威胁,公司就会启动紧急披露协议。
Q 在佛罗里达州,通过人工智能聊天机器人发送威胁会涉及哪些刑事指控?
A 该用户是根据佛罗里达州第 836.10 条法规被捕的,该法规将以书面形式威胁杀人、造成人身伤害或实施大规模枪击定为刑事犯罪。尽管该法规传统上针对的是信件和直接消息,但其涵盖范围已扩展至网络应用程序上的电子通信。辩方可能会质疑提交给自动化神经网络的文本在法律上是否构成传达给目标或可能到达目标处的通信。
Q 为何将对话式人工智能用作私人日记会导致意想不到的法律风险?
A 对话式界面模拟了富有同理心的一对一对话,创造出一种保密倾听的心理错觉,从而鼓励用户坦诚宣泄。实际上,每个提示词都会被传输到企业服务器,由安全过滤器进行评估,存入遥测数据库,并在发生违规时由人工审查。将托管的云服务视为私人日记,会将深度隐私文本暴露在自动监控和潜在的执法升级风险之下。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!