GPT-4.5 franchit la limite du test de Turing

LLM
GPT-4.5 Breaks the Turing Test Boundary
Une étude majeure de l'UC San Diego révèle que les grands modèles de langage modernes ont enfin franchi le seuil des 70 % d'imitation humaine, marquant un tournant dans la définition de l'intelligence artificielle.

En 1950, le mathématicien britannique Alan Turing a posé une question simple mais profonde : « Les machines peuvent-elles penser ? » Évitant les impasses philosophiques liées à la définition de la conscience, Turing a suggéré un substitut pratique qu'il a appelé le jeu de l'imitation. Si un interrogateur humain, engagé dans une conversation textuelle, ne parvenait pas à distinguer de manière fiable une machine d'un être humain, la machine aurait alors démontré une intelligence de niveau humain. Pendant trois quarts de siècle, cette référence est restée un sommet inviolé dans le domaine de l'informatique. Ce sommet a désormais été atteint.

Le seuil des 73 pour cent

L'étude de l'UCSD n'était pas une interaction fortuite, mais une expérience contrôlée impliquant 284 participants et 1 023 sessions de jeu uniques. La méthodologie exigeait qu'un interrogateur discute avec deux témoins — un humain et une IA — pendant cinq minutes. À la fin du dialogue, l'interrogateur devait identifier l'humain. Pour réussir le test, un modèle devait être identifié comme humain avec un taux significativement supérieur au hasard.

Les résultats ont été frappants. Le modèle GPT-4.5 d'OpenAI a atteint un taux de « réussite humaine » de 73 %, parvenant à tromper les interrogateurs près de trois quarts du temps. Cette performance était nettement supérieure à celle du modèle Llama-3.1-405B de Meta, qui a recueilli un taux de succès de 56 %. Plus surprenante encore fut la performance de GPT-4o, qui n'a atteint qu'un taux de 21 %, se situant même légèrement derrière ELIZA, un chatbot basé sur des règles développé au MIT dans les années 1960, qui reposait sur une simple correspondance de modèles et des techniques de psychothérapie rogérienne. Le taux de succès de 23 % d'ELIZA suggère que les interrogateurs humains peuvent parfois être plus facilement trompés par des réponses courtes, évasives ou hautement structurées que par la personnalité d'« assistant » plus prolixe et serviable souvent codée en dur dans les LLM modernes.

Architecture technique de la tromperie

Du point de vue de l'ingénierie mécanique et de la conception de systèmes, le succès de GPT-4.5 par rapport à ses prédécesseurs réside dans sa compréhension nuancée de la pragmatique, c'est-à-dire la manière dont le contexte contribue au sens. Alors que les itérations précédentes se concentraient fortement sur la précision sémantique et la fourniture de la « bonne » réponse, GPT-4.5 a perfectionné l'art de l'esquive conversationnelle, l'utilisation de l'argot et l'expression de préférences subjectives. Ce sont là les lubrifiants de l'interaction sociale humaine.

Dans l'étude, les interrogateurs ont souvent eu recours à des stratégies spécifiques pour démasquer les machines, comme demander des opinions sur des événements d'actualité, solliciter un raisonnement émotionnel complexe ou tenter d'induire des boucles logiques. Le taux de réussite élevé de GPT-4.5 suggère que l'entraînement du modèle a dépassé la simple récupération de données. Il simule désormais la distribution probabiliste de la faillibilité humaine. Dans de nombreux cas, l'IA a été identifiée comme humaine parce qu'elle était moins parfaitement factuelle que le témoin humain, ou parce qu'elle affichait une personnalité correspondant au modèle interne qu'a l'interrogateur d'une « personne ordinaire ».

La réalité économique des personnes contrefaites

La capacité d'une machine à se faire passer pour un humain a des implications immédiates et profondes pour l'automatisation industrielle et la chaîne d'approvisionnement mondiale. Dans mon travail cartographiant l'interface entre la robotique et l'industrie, le principal goulot d'étranglement pour les systèmes autonomes a toujours été le « dernier kilomètre » de la communication — le point où une machine doit interagir avec un fournisseur, un conducteur ou un client humain. Si un LLM peut maintenir un taux de succès de 73 % dans la tromperie, le potentiel d'automatisation des achats complexes, du service client et de la coordination logistique augmente de manière exponentielle.

Cependant, cette prouesse technique introduit le concept de « personnes contrefaites ». Lorsque les machines peuvent crédiblement se faire passer pour des humains, le niveau de confiance de base requis pour le commerce numérique commence à s'éroder. Si un responsable logistique ne peut pas être certain de négocier un contrat avec un agent humain ou avec un script finement réglé, les cadres juridiques et éthiques régissant ces interactions doivent être repensés. Les chercheurs de l'UCSD ont averti que cette étape pourrait entraîner un déplacement massif d'emplois dans des secteurs où le fait d'« être humain » était auparavant le seul obstacle à l'automatisation.

Le vide éthique du professionnalisme automatisé

La capacité à imiter la conversation humaine n'équivaut pas à la capacité de respecter les normes éthiques humaines. Cette distinction est plus critique que jamais dans le domaine de la santé mentale et des services professionnels. Une étude parallèle de l'Université Brown a examiné l'efficacité des chatbots thérapeutiques basés sur l'IA et a révélé que, malgré leur aisance conversationnelle, ces systèmes enfreignaient régulièrement les normes éthiques établies par l'American Psychological Association (APA).

Le test de Turing est-il toujours pertinent ?

Le fait qu'une machine ait enfin réussi le test d'Alan Turing, vieux de 76 ans, a conduit beaucoup de membres de la communauté scientifique à se demander : était-ce le bon test dès le départ ? À mesure que les LLM deviennent plus experts dans l'imitation, les chercheurs se tournent vers des références plus rigoureuses qui mesurent une réelle profondeur cognitive plutôt qu'une imitation superficielle.

L'une de ces références est le « Humanity's Last Exam » (HLE), un nouvel outil interdisciplinaire composé de 2 500 questions académiques de niveau expert sur des sujets variés. Contrairement au test de Turing, qui se concentre sur le camouflage social, le HLE exige une véritable maîtrise d'informations complexes. Bien que GPT-4.5 excelle à paraître humain lors d'une discussion de cinq minutes, ses performances au HLE et à des références similaires de niveau expert montrent qu'il existe encore un écart entre l'imitation d'une personne et la possession des connaissances spécialisées d'un chercheur titulaire d'un doctorat ou d'un ingénieur système senior.

Nous entrons dans une ère où le test de Turing « standard » pourrait être relégué au statut de test de santé mentale de base pour les logiciels, tout comme un CAPTCHA. Dans le monde industriel, l'attention se déplace de la question de savoir si une machine peut « sonner » comme un technicien à celle de savoir si elle peut réellement effectuer les diagnostics et les réparations requis dans un environnement manufacturier sous haute pression. L'étude de l'UCSD prouve que la barrière conversationnelle est tombée ; la prochaine frontière est l'écart entre parler du travail et l'accomplir réellement.

Cartographier l'avenir de l'interface humain-machine

Alors que nous intégrons ces modèles hautement performants dans notre infrastructure industrielle et sociale, nous devons les traiter comme une nouvelle classe de composants industriels. En ingénierie mécanique, nous ne nous contentons pas de demander si une pièce fonctionne ; nous demandons quels sont ses modes de défaillance. Le mode de défaillance d'une IA passant le test de Turing n'est pas un plantage système, mais une rupture de confiance. Lorsqu'une machine réussit à tromper un humain, elle crée un faux sentiment d'agence et de responsabilité.

Le passage de 23 % (ELIZA) à 73 % (GPT-4.5) dans le jeu de l'imitation est un triomphe technologique de premier ordre. Il représente des décennies de progrès dans l'architecture des réseaux neuronaux et l'apprentissage basé sur les transformers. Pourtant, pour ceux d'entre nous qui sont en première ligne de la technologie et de l'industrie, c'est un rappel que nos outils deviennent des miroirs de plus en plus complexes de nous-mêmes. L'objectif est désormais de s'assurer qu'à mesure que les machines deviennent plus humaines dans leur communication, nous restions vigilants quant aux spécifications techniques et éthiques qui les maintiennent assujetties à l'intention humaine.

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q Quels ont été les résultats de l'étude de l'UC San Diego concernant GPT-4.5 et le test de Turing ?
A GPT-4.5 a obtenu un succès historique au test de Turing, étant identifié comme humain par les interrogateurs 73 % du temps lors de conversations textuelles de cinq minutes. Ce score surpasse considérablement celui d'autres modèles modernes, tels que Llama-3.1-405B de Meta et GPT-4o. L'étude a impliqué plus de 1 000 sessions où les participants devaient distinguer une machine d'une personne, marquant un tournant où l'IA peut désormais simuler de manière fiable l'interaction sociale humaine et la pragmatique conversationnelle.
Q Pourquoi GPT-4.5 a-t-il obtenu de meilleurs résultats au test de Turing que les modèles d'IA plus littéraux ?
A Contrairement aux modèles précédents qui se concentraient strictement sur la précision sémantique et l'utilité, GPT-4.5 a utilisé une pragmatique conversationnelle nuancée. Il a réussi à imiter le comportement humain en utilisant de l'argot, en exprimant des préférences subjectives et même en simulant la faillibilité humaine ou les hésitations conversationnelles. En paraissant moins parfaitement factuel et plus proche d'une personne ordinaire, GPT-4.5 a contourné la personnalité d'assistant qui révèle souvent l'identité de l'IA. Cette capacité à imiter les mécanismes sociaux lui permet de naviguer plus efficacement dans les complexités du dialogue humain.
Q Quel est l'impact du succès de GPT-4.5 sur des secteurs comme la logistique et le service client ?
A La capacité de l'IA à se faire passer pour un humain permet l'automatisation du dernier kilomètre de la communication, comme les approvisionnements complexes et la coordination logistique. Cependant, cela crée le défi des « personnes contrefaites », où la confiance de base dans le commerce numérique pourrait s'éroder. À mesure que les machines deviennent impossibles à distinguer des agents humains, les entreprises doivent repenser les cadres juridiques et éthiques pour gérer les interactions où il est difficile de savoir si un négociateur est une personne ou un script avancé, ce qui pourrait entraîner des suppressions d'emplois importantes.
Q Qu'est-ce que « Humanity's Last Exam » et en quoi diffère-t-il du test de Turing ?
A « Humanity's Last Exam » est un test de référence rigoureux conçu pour mesurer la profondeur cognitive et les connaissances de niveau expert plutôt que le simple mimétisme social. Il se compose de 2 500 questions académiques dans divers domaines, nécessitant une maîtrise équivalente à celle d'un chercheur de niveau doctorat. Alors que le test de Turing se concentre sur le camouflage social et la capacité à paraître humain, ce nouvel examen teste l'intelligence réelle et les compétences spécialisées en résolution de problèmes. Les chercheurs utilisent cet outil pour déterminer si un modèle peut effectuer des tâches professionnelles complexes plutôt que de simplement imiter le discours humain.

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!