En 2019, le chercheur en intelligence artificielle François Chollet a conçu un jeu de puzzle appelé ARC, destiné à être facile pour les humains mais difficile pour les machines. Ce test est devenu un outil essentiel pour mesurer les progrès de l’IA parce qu’il remet en question la croyance que des machines intelligentes capable de surpasser l’humanité ne sont pas encore réellement atteintes. Récemment, OpenAI a annoncé que son dernier système IA, O3, avait dépassé des performances humaines dans ce test.
OpenAI O3 dépasse les capacités humaines dans le test d’ARC
O3, le nouveau système d’intelligence artificielle développé par OpenAI, a réussi à atteindre une précision de 87,5% sur le test d’ARC. Contrairement aux versions précédentes comme ChatGPT qui préféraient générer des phrases basées sur des exemples antérieurs sans véritable raisonnement logique, O3 a démontré une capacité à examiner plusieurs possibilités avant de répondre.

Les limites révélées par l’évolution des tests d’IA
Cependant, cette performance spectaculaire suscite aussi des interrogations quant à la méthode utilisée pour évaluer l’intelligence artificielle. Arvind Narayanan, professeur à Princeton et co-auteur du livre «AI Snake Oil», déclare que toute affirmation reliant ce test au chemin vers une intelligence générale artificielle (AGI) est «très inquiétante». Au fil du temps, de nombreux jalons fixés par les chercheurs ont été jugés insuffisants pour évaluer la véritable intelligence.
L’épreuve ultime : Le prix ARC et ses défis futurs
En juin dernier, François Chollet et Mike Knoop ont lancé le prix ARC, promettant un million de dollars à quiconque réussirait à créer un système IA dépassant les performances humaines dans le cadre rénové nommé «Arc-Agi». Bien que plus de 1 400 systèmes d’IA aient été soumis au concours, aucun n’a remporté le prix car tous avaient obtenu moins de 85%.
Lancement d’une nouvelle référence : ARC-AGI-2 avec plus de défis
Ce lundi, une nouvelle référence appelée ARC-AGI-2 contenant plusieurs tâches complexes supplémentaires a été introduite. Ces nouveaux puzzles seront plus difficiles tant pour les humains que pour l’IA. M. Chollet explique : «Ça va être beaucoup plus difficile pour l’IA – O3 ne résoudra pas Arc-Agi-2.» Cette mise à jour démontre clairement que malgré les avancées significatives réalisées par OpenAI et d’autres entreprises dans leurs technologies IA actuelles, il existe encore un fossé important entre leurs capacités et l’intelligence humaine réelle.
L’avenir des équipes travaillant sur AGI demeure incertain mais passionnant
Le prix ARC évolue vers une entité sans but lucratif ayant pour ambition de devenir la «North Star for AGI». L’équipe envisage déjà Arc-AGI-3 dont la sortie est prévue en 2026. La maquette préliminaire suggère davantage d’interaction avec des scénarios dynamiques basés sur une grille motrice qui pourrait simuler davantage la réalité humaine. Même si ces développeurs se rapprochent progressivement d’une machine capable d’intelligence similaire ou supérieure aux humains dans certains domaines spécifiques tels que résoudre des problèmes logiques simples ou coder efficacement dans divers langages informatiques, elles demeurent souvent limitées lorsque confrontées aux diverses complexités émotionnelles ou morales inhérentes aux interactions humaines quotidiennes.