大规模抓取:OpenAI 数据采集策略背后的技术摩擦

OpenAI
Scraping at Scale: The Technical Friction Behind OpenAI’s Data Harvesting Tactics
随着 OpenAI 在法律诉讼中为其数据收集行为辩护,工业级人工智能训练与存储全球知识的数字图书馆之间,正面临日益扩大的技术分歧。

在人工智能发展这场高风险的博弈中,战争术语正逐渐取代软件工程领域的语言。当有关 OpenAI 自动化系统及其与数字存储库交互的报道出现时,头条新闻往往带有戏剧色彩:“流氓”模型和对数字图书馆的“攻击”。然而,对于我们这些通过机械精度和工业吞吐量视角看待世界的人来说,现实要冷静得多,尽管其破坏力丝毫不减。被定性为“流氓”行为的,从技术角度来看,实际上是速率限制的失败,也是大型语言模型(LLM)激进抓取需求与公益数字档案馆脆弱基础设施之间的一种根本冲突。

当前争议的核心源于 OpenAI 与《纽约时报》(New York Times)和互联网档案库(Internet Archive)等实体之间的法律和技术摩擦。在最近的法律文件中,出现了一种说法,即 OpenAI 的系统被指控绕过传统的保护措施,以获取受版权保护或受限的材料。相反,OpenAI 则反驳称,他们的模型本质上是被“诱骗”或操纵,通过其所描述的黑客攻击手段输出了侵权内容——这一说法暗示“攻击”来自用户,而非机器。要理解这一局势的严重性,必须抛开修辞,审视数据抓取的工业化机制。

网页爬虫的工业化

从机械工程的角度来看,我们可以将 GPTBot 想象成一台高速工业收割机。当它瞄准某个数字图书馆时,它并不是人类意义上的“阅读”。它正在以极高的频率执行递归 GET 请求,其数据量足以轻易模仿分布式拒绝服务(DDoS)攻击。如果机器人的内部逻辑优先考虑吞吐量而非礼仪,它可能会压垮服务器的 I/O 能力。当 OpenAI 暗示其模型“变流氓”时,他们很可能指的是一种自动化故障,即爬虫忽略了限速设置或误解了导航路径,导致相关图书馆的局部系统崩溃。

作为发现工具的对抗性提示词

紧张局势的很大一部分涉及《纽约时报》对 OpenAI 的诉讼。《纽约时报》提供的证据显示,ChatGPT 可以逐字复述其调查报道的片段。OpenAI 的辩护令人震惊:他们声称《纽约时报》雇人通过使用“公然违反 OpenAI 使用条款的欺骗性提示词”来“黑入”他们的产品。在这里,“黑客攻击”的定义被过度引申了。在软件世界中,如果一个系统仅通过某种特定的提问方式就被迫输出受限数据,这通常被归类为漏洞或 Bug,而不是黑客攻击。

这引发了一个关键问题:如果一个模型只是在遵循其训练时所习得的概率路径,它是否在表现出“流氓”行为?如果用户要求 LLM“背诵《纽约时报》1 月 5 日版的前三段”,而模型照做了,那么该模型正完全按照其设计运行。失败之处在于训练阶段,即在摄取版权数据时,没有建立防止逐字检索的机制。对于像互联网档案库这样托管数百万本扫描书籍的数字图书馆而言,风险在于这些模型将把其整个数据库视为可免费使用的数据集,本质上是将图书馆精心策展的内容“机器洗稿”为商业产品。

数据抓取是否构成技术攻击?

此外,还存在“影子抓取”的问题。许多 AI 公司使用 Common Crawl 或 LAION 等第三方数据集来训练模型。如果正是这些第三方“攻击”了图书馆以收集数据,AI 公司便可以声称自己有一定的脱离度。然而,随着 OpenAI 转向通过 GPTBot 进行更直接、更专有的数据收集,那层推诿的余地正在消失。他们现在是这些重型机械的主要操作者,必须为其产生的烟尘和噪音负责。

开放存储库的经济生存能力

我们还必须考虑这些图书馆的经济效用。像互联网档案库和开放图书馆(Open Library)这样的网站提供了公共服务,保护了数字遗产,并提供了本可能消失的信息访问渠道。如果它们被迫部署激进的 Web 应用防火墙(WAF)并设置付费墙,仅仅为了防止 AI 机器人压垮服务器,那么“开放获取”这一使命本身就受到了威胁。我们正在目睹一场公地悲剧,公共资源正被私人利益过度蚕食。

OpenAI 辩称,他们对这些数据的使用属于“合理使用”,断言 AI 的变革性证明了这种摄取的正当性。但从技术角度来看,这个过程对基础设施而言绝非“公平”。每一次请求都要消耗图书馆的电力、带宽和 CPU 周期。当这些成本乘以 AI 学习所需的数百万参数时,图书馆的财政负担就会变得不可持续。这就是为什么该领域的许多工程师呼吁制定一项新标准——即数字版的“被遗忘权”,其中应包含被 AI 爬虫“无视的权利”。

完善机器与图书馆的握手机制

我们如何解决工业数据需求与保护数字图书馆之间的摩擦?解决方案可能在于更复杂的基于 API 的数据交付,而不是我们今天所看到的“暴力”抓取。如果 OpenAI 想要获取全球图书馆的资源,逻辑上的机械方法是建立一个尊重主机容量的专用流水线。与其派遣机器人去“攻击”面向公众的网站,不如通过结构化的数据协议进行受控传输,从而不干扰公共服务。

然而,此类协议需要成本和透明度——而这正是当前 AI “军备竞赛”所倾向于回避的两件事。只要目标是在最短时间内构建出最大的模型,其激励机制永远会是先抓取,事后再在法庭上解决。这些机器人的“流氓”行为不是系统中的故障;它是将速度置于可持续性之上的发展周期的必然特征。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 什么是 GPTBot?它的行为对数字档案有何影响?
A GPTBot 是 OpenAI 用于收集数据以训练其人工智能模型的专用网络爬虫。从技术角度来看,它的运作方式类似于一种工业级收割机。如果未对其进行适当的速率限制,GPTBot 可能会执行海量的递归请求,其表现类似于分布式拒绝服务攻击(DDoS)。这种激进的行为可能会导致公共数字图书馆的服务器基础设施过载,引发系统崩溃,并增加带宽、CPU 周期和电力方面的运营成本。
Q OpenAI 如何为其模型复制受版权保护内容这一指控进行辩护?
A OpenAI 辩称,其模型是通过所谓的黑客攻击或欺骗性提示词(prompts)被操纵从而生成侵权输出的。在法律文件中,该公司暗示原告利用特定查询绕过保护机制,旨在针对模型的漏洞进行攻击。然而,许多专家认为,如果一个模型在被要求时能逐字输出摘录,这反映出的是模型在训练阶段未能有效防止逐字检索,而非用户所谓的恶意黑客攻击。
Q 为什么人工智能数据采集被称为数字图书馆的“公地悲剧”?
A 这一术语指的是私人利益对共享公共资源的过度使用。像互联网档案(Internet Archive)这样的组织为公众利益提供信息的开放获取。当人工智能公司通过激进的抓取方式获取这些数据以谋取商业利益时,它们给这些非营利组织造成了沉重的技术和财务负担。图书馆往往被迫将有限的资源花费在部署防御性防火墙和扩充服务器容量上,仅仅是为了应对大规模自动化请求带来的压力。
Q 有哪些技术替代方案可以取代传统的“暴力”网页抓取?
A 为了减少人工智能开发人员与数据托管方之间的冲突,专家建议转向基于 API 的数据传输和结构化数据协议。这种方法包括建立专门的受控数据传输管道,从而不干扰面向公众的服务。此外,工程师们呼吁建立新的数字标准,允许信息存储库选择退出人工智能训练,从而赋予内容创作者“被忽略权”,以保护其基础设施和知识产权免受自动化爬虫的干扰。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!