GPT-4.5 突破图灵测试边界

大语言模型 (LLMs)
GPT-4.5 Breaks the Turing Test Boundary
加州大学圣地亚哥分校的一项里程碑式研究显示,现代大语言模型已正式跨越 70% 的人类模仿阈值,这标志着我们定义机器智能的方式正发生转变。

1950年,英国数学家艾伦·图灵提出了一个简单而深刻的问题:“机器能思考吗?”图灵避开了关于定义意识的哲学泥潭,提出了一个他称之为“模仿游戏”的实用替代方案。如果一位人类询问者在进行基于文本的对话时,无法可靠地将机器与人类区分开来,那么该机器就有效地证明了其具备人类水平的智能。在四分之三个世纪里,这一基准一直被视为计算机科学领域一座难以逾越的巅峰。如今,这座巅峰已被征服。

73%的门槛

加州大学圣地亚哥分校(UCSD)的这项研究并非随意的互动,而是一项涉及284名参与者和1023场独立游戏会话的受控实验。该方法要求询问者与两名“证人”(一名人类和一名人工智能)进行五分钟的对话。对话结束后,询问者需负责识别出哪位是人类。为了通过测试,模型被识别为人类的概率必须显著高于随机猜测。

结果非常惊人。OpenAI的GPT-4.5获得了73%的“人类”评分,在近四分之三的时间里有效地欺骗了询问者。这一表现明显优于Meta的Llama-3.1-405B(胜率为56%)。也许最令人惊讶的是GPT-4o的表现,其胜率仅为21%,甚至略低于ELIZA——那是20世纪60年代麻省理工学院开发的一款基于规则的聊天机器人,仅依赖简单的模式匹配和罗杰斯心理治疗技术。ELIZA 23%的成功率表明,相比于现代大语言模型(LLM)中常见的冗长、乐于助人的“助手”人格,人类询问者有时更容易被简短、闪烁其词或高度结构化的回答所蒙蔽。

欺骗的技术架构

从机械工程和系统设计的角度来看,GPT-4.5超越前代产品的成功之处在于其对语用学——即语境如何影响意义——的细致把握。虽然早期版本主要专注于语义准确性和提供“正确”答案,但GPT-4.5完善了对话中的拖延技巧、俚语使用以及主观偏好的表达。这些都是人类社会互动的润滑剂。

研究中的询问者通常依赖特定策略来揭穿机器,例如询问对时事的看法、要求进行复杂的感性推理,或试图引发逻辑循环。GPT-4.5的高成功率表明,该模型的训练已超越了单纯的数据检索。它现在能够模拟人类易犯错误的概率分布。在许多情况下,人工智能之所以被认定为人类,是因为它比人类证人表现得没那么完美,或者因为它表现出了一种符合询问者心中“普通人”预设的人格。

“伪人”的经济现实

机器能够冒充人类的能力,对工业自动化和全球供应链有着直接而深远的影响。在绘制机器人与工业接口图谱的工作中,自动化系统的主要瓶颈一直是沟通的“最后一公里”——即机器必须与人类供应商、司机或客户互动的环节。如果大语言模型在欺骗方面的成功率能达到73%,那么自动化复杂的采购、客户服务和物流协调的潜力将呈指数级增长。

然而,这一技术成就引入了“伪人”的概念。当机器能够可信地冒充人类时,数字商业所需的信任基准就开始被侵蚀。如果物流经理无法确定他们是在与人类代理商还是与经过精心调整的脚本进行合同谈判,那么管理这些互动的法律和道德框架就必须重新设计。UCSD的研究人员警告说,这一里程碑可能会导致在那些以前只有“作为人类”这一门槛的自动化行业中,出现大范围的就业岗位流失。

自动化专业主义中的伦理真空

模仿人类对话的能力并不等同于遵守人类道德标准的能力。这一区别在心理健康和专业服务领域表现得尤为关键。布朗大学的一项平行研究调查了人工智能聊天机器人治疗师的有效性,发现尽管它们具有对话流畅性,但这些系统经常违反美国心理学会(APA)制定的伦理标准。

图灵测试还有意义吗?

机器最终通过艾伦·图灵76年前提出的测试这一事实,引发了科学界许多人的反思:这从一开始就是正确的测试吗?随着大语言模型在模仿方面变得越来越熟练,研究人员正转向更严格的基准测试,旨在衡量真正的认知深度,而非表面的模仿。

其中一个基准是“人类终极考试”(HLE),这是一个跨学科的新工具,包含2500个涵盖不同学科的专家级学术问题。与侧重于社会伪装的图灵测试不同,HLE要求对复杂信息有真正的掌握。虽然GPT-4.5在五分钟的聊天中表现得像人类,但它在HLE和类似专家级基准测试中的表现表明,在模仿一个人与拥有博士级研究员或高级系统工程师的专业知识之间,仍存在差距。

我们正在进入一个“标准”图灵测试可能被降级为软件基本完整性检查(类似于验证码)的时代。在工业界,焦点正从机器是否能“听起来”像个技术人员,转移到它是否能在高压制造环境中执行所需的诊断和维修。UCSD的研究证明,沟通障碍已被打破;下一个前沿领域是谈论工作与实际完成工作之间的鸿沟。

绘制人机界面的未来

随着我们将这些高性能模型整合到工业和社会基础设施中,我们必须将它们视为一类新型工业组件。在机械工程中,我们不仅要问一个零件是否能工作,还要问它的失效模式是什么。通过图灵测试的人工智能,其失效模式不是系统崩溃,而是信任违背。当机器成功欺骗人类时,它会制造出一种虚假的代理权和责任感。

在模仿游戏中从23%(ELIZA)到73%(GPT-4.5)的跨越,是最高级别的技术胜利。它代表了神经网络架构和基于Transformer学习技术的数十年进步。然而,对于我们这些处于技术和工业前线的人来说,这是一个提醒:我们的工具正日益成为我们自己的复杂镜像。现在的目标是确保随着机器在交流中变得越来越像人,我们仍能保持警惕,通过技术和伦理规范确保它们服从于人类的意图。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 加州大学圣地亚哥分校关于 GPT-4.5 和图灵测试的研究结果如何?
A GPT-4.5 在图灵测试中取得了里程碑式的成功。在五分钟的文本对话中,它有 73% 的时间被提问者识别为人类。这一分数显著超过了 Meta 的 Llama-3.1-405B 和 GPT-4o 等其他现代模型。该研究涉及超过 1,000 场测试,参与者需要区分机器与真人。这标志着 AI 现在能够可靠地模拟人类的社交互动和对话语用学。
Q 为什么 GPT-4.5 在图灵测试中的表现优于更偏向字面理解的 AI 模型?
A 与以往严格关注语义准确性和有用性的模型不同,GPT-4.5 运用了微妙的对话语用学。它通过使用俚语、表达主观偏好,甚至模拟人类的易错性和对话停顿,成功模仿了人类行为。由于听起来不那么绝对客观,反而更像普通人,GPT-4.5 避开了那些往往会暴露 AI 身份的“助手”人设。这种模拟社交润滑剂的能力使其能够更有效地应对复杂的人类对话。
Q GPT-4.5 的成功如何影响物流和客户服务等行业?
A AI 能够通过“人类伪装”实现沟通最后一公里的自动化,例如复杂的采购和物流协调。然而,这也带来了“伪造者”的挑战,数字商务中的基础信任可能会因此受到侵蚀。随着机器变得与人类代理人无法区分,企业必须重新设计法律和伦理框架,以处理那些无法确定谈判对象是真人还是高级脚本的互动,这可能会导致严重的就业流失。
Q 什么是“人类最终考试”(Humanity's Last Exam),它与图灵测试有何不同?
A “人类最终考试”是一项严苛的基准测试,旨在衡量认知深度和专家级知识,而不仅仅是社会模仿能力。它包含跨学科的 2,500 道学术题目,要求具备相当于博士级研究人员的精通程度。虽然图灵测试侧重于社交伪装和听起来像人类,但这项新考试测试的是实际的智能和专业的问题解决能力。研究人员利用该工具来确定模型是否能够执行复杂的专业任务,而不仅仅是模仿人类语言。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!