« L’IA fait mieux que l’humain » : la formule revient dans les annonces, les rapports et les débats sur l’emploi. Mieux à quoi, mesuré comment, et à quelle date ? Tour d’horizon des sources qui permettent de comparer sérieusement les capacités humaines et celles des systèmes d’intelligence artificielle, avec ce que chacune mesure, et ce qu’elle ne mesure pas.
Pourquoi la comparaison est plus difficile qu’il n’y paraît
Comparer un humain et une machine suppose trois conditions rarement réunies : une tâche définie de la même façon pour les deux, une mesure publique et reproductible, et une date. Sans date, un score ne vaut presque rien, car les systèmes d’IA changent en quelques mois. Sans tâche commune, on compare des choses différentes. Sans méthode publiée, personne ne peut vérifier.
Le rapport annuel de l’université Stanford sur l’intelligence artificielle le reconnaît lui-même. Dans son édition 2026, le chapitre consacré aux performances techniques constate que les évaluations sont dépassées par les progrès qu’elles devaient mesurer, et que les benchmarks font face à des questions croissantes sur leur fiabilité. Une revue citée par le rapport relève des taux de questions invalides allant de 2 % (MMLU, partie mathématiques) à 42 % (GSM8K). Autrement dit, une partie des tests contient elle-même des erreurs.
Stanford AI Index : la référence annuelle, à lire avec ses nuances
Publié par l’institut HAI de Stanford, l’AI Index compile chaque année des données sur la recherche, les performances techniques, l’économie, l’éducation, les politiques publiques et l’opinion. Son intérêt pour la question humain-IA tient à ce qu’il place régulièrement les scores des modèles à côté de références humaines.
Quelques résultats de l’édition 2026 montrent à quel point le tableau est contrasté. Sur Humanity’s Last Exam, un test conçu pour être difficile pour l’IA et favorable aux experts humains, les meilleurs modèles ont gagné 30 points de pourcentage en un an. Sur OSWorld, qui soumet des agents à de vraies tâches informatiques, la précision est passée d’environ 12 % à 66,3 %, soit à moins de 6 points de la performance humaine. Mais sur ClockBench, le meilleur modèle ne lit correctement une horloge à aiguilles que dans 50,6 % des cas, contre 90,1 % pour les humains. Et les robots ne réussissent que 12 % des tâches domestiques réelles testées.
Les chercheurs parlent d’intelligence « en dents de scie » (jagged intelligence) : un modèle peut obtenir une médaille d’or aux Olympiades internationales de mathématiques et peiner à lire l’heure sur une horloge à aiguilles. La leçon pour le lecteur est simple : un résultat spectaculaire sur un test ne se généralise pas à « l’intelligence » en général. L’AI Index est utile précisément parce qu’il met les réussites et les échecs côte à côte.
OCDE : une échelle construite à partir des capacités humaines
En juin 2025, l’OCDE a publié la version bêta de ses indicateurs de capacités de l’IA (AI Capability Indicators). La démarche est différente : plutôt que d’additionner des benchmarks, l’organisation part de neuf grandes capacités humaines, du langage à la manipulation d’objets, en passant par l’interaction sociale, la résolution de problèmes, la créativité, la métacognition et la pensée critique, la connaissance, l’apprentissage et la mémoire, la vision et l’intelligence robotique. Pour chacune, elle décrit une échelle à cinq niveaux, qui va des problèmes déjà résolus pour l’IA jusqu’à un niveau qualifié, avec un point d’interrogation, de « surhumain ».
L’OCDE situe ensuite les systèmes existants sur ces échelles. En langage, les grands modèles les plus avancés « approchent le niveau 3 ». En métacognition et pensée critique, des modèles comme GPT-3.5 et GPT-4 se situent généralement aux niveaux 2 à 3, et les systèmes agentiques plutôt en dessous du niveau 3, ce qui signale, selon l’OCDE, des limites importantes dans leur capacité à surveiller et réguler leur propre raisonnement.
L’intérêt de ce travail est qu’il parle le langage des compétences, celui des politiques d’éducation et de formation. Sa limite est assumée : il s’agit d’une version bêta, appelée à être révisée, et les positionnements datent de la publication alors que les modèles évoluent vite.
OIT : passer des capacités aux métiers
La question qui intéresse le plus les actifs n’est pas « que sait faire l’IA ? » mais « que devient mon métier ? ». L’Organisation internationale du travail y répond avec un indice d’exposition des professions à l’IA générative, dont la mise à jour a été publiée le 20 mai 2025. La méthode combine avis humains et évaluations produites par IA, au niveau le plus fin de la classification des professions, sur près de 30 000 tâches.
Résultat principal : un travailleur sur quatre dans le monde occupe un emploi présentant un certain degré d’exposition à l’IA générative. L’OIT souligne que la plupart des emplois devraient être transformés plutôt que supprimés, parce que l’intervention humaine reste nécessaire. Elle note aussi que les nouvelles capacités des modèles ont relevé les scores d’automatisation de plusieurs tâches dans les métiers des médias et du web.
Point de vigilance : l’exposition n’est pas une prédiction de disparition. Elle mesure la part des tâches qu’un système pourrait effectuer ou assister. Confondre « exposé » et « menacé » est l’une des erreurs les plus fréquentes dans les articles consacrés au sujet.
Cinq questions pour lire un chiffre « IA contre humain »
- Quelle tâche, exactement ? Un score sur un test de mathématiques ne dit rien de la rédaction d’un contrat ou de l’accueil d’un patient.
- Quelle référence humaine ? Un expert du domaine, un échantillon de volontaires, une moyenne de population : la comparaison change du tout au tout.
- Quelle date ? Un résultat de l’an dernier peut être dépassé, ou le test lui-même saturé.
- Qui mesure ? L’éditeur du modèle, un laboratoire indépendant, une organisation internationale : ce n’est pas le même niveau de recul.
- Quel degré de certitude ? Un fait mesuré, un consensus, une opinion d’experts et une projection ne se présentent pas de la même manière.
Un référentiel qui rassemble et date les comparaisons
Les sources ci-dessus sont solides mais dispersées, publiées à des rythmes différents et dans des formats qui ne se croisent pas. L’observatoire Atlas Humain × IA propose de les réunir dans un référentiel comparatif : d’un côté les capacités humaines (sociales, psychologiques, philosophiques, liées à l’évolution), de l’autre les capacités de l’IA (génératives, agentiques, scientifiques, sectorielles, prédictives), et entre les deux des analyses d’écart.
Sa méthode reprend les exigences décrites plus haut. Chaque fiche est sourcée, datée et porte un statut de fraîcheur. Le degré de certitude est écrit (fait vérifié, consensus scientifique, opinion majoritaire ou hypothèse prospective) et, sur les sujets contestés, plusieurs écoles de pensée sont présentées côte à côte plutôt qu’un verdict unique. Les données brutes sont publiques : chaque fiche expose son JSON et le corpus est versionné. Selon sa page d’accueil, consultée le 24 septembre 2026, le référentiel compte 580 fiches de capacités humaines, 71 fiches de capacités de l’IA, 201 analyses d’écart et 2 394 sources citées et datées, avec une dernière vérification enregistrée le 12 septembre 2026. Le site précise n’être « ni un classement, ni une prédiction ».
Transparence : Atlas Humain × IA est édité par DYONYSOS, qui édite aussi Le Fil Indépendant.
Ce qu’il faut retenir
Aucune source ne répond seule à la question « l’IA fait-elle mieux que l’humain ? ». L’AI Index mesure des performances sur des tests, l’OCDE positionne l’IA sur des échelles de capacités humaines, l’OIT traduit ces capacités en exposition des métiers. Les croiser, en gardant la date et le degré de certitude de chaque résultat, reste la seule manière d’éviter les deux écueils du débat : l’emballement et le déni.
Sources
- Stanford HAI, AI Index Report 2026, chapitre 2 « Technical Performance » (consulté le 24 septembre 2026).
- OCDE, Introducing the OECD AI Capability Indicators, 3 juin 2025, et brochure de présentation de la version bêta (consultés le 24 septembre 2026).
- OIT, Generative AI and jobs: A 2025 update, 20 mai 2025 (consulté le 24 septembre 2026).