Artificial Analysis Intelligence Index v4.2 lancé

Original : Artificial Analysis Intelligence Index v4.2

Pourquoi c'est important

Ce classement influence le choix des modèles IA par les entreprises à l'échelle mondiale.

Artificial Analysis a publié le 4 septembre 2026 la version 4.2 de son Intelligence Index, intégrant deux nouvelles évaluations (AA-Briefcase et GDP.pdf), la suppression de GPQA Diamond jugé saturé, et un doublement des tests privés à 40 % pour limiter le gaming.

Artificial Analysis a mis à jour son Intelligence Index en version 4.2, une release intermédiaire avant la future v5, afin de suivre le rythme rapide des avancées frontier. Deux nouvelles évaluations sont introduites : AA-Briefcase, un benchmark interne à jeu de test privé testant les modèles sur des projets de knowledge work agentique multi-semaines avec des milliers de fichiers sources, combinant notation par rubrique et comparaison par paires ; et GDP.pdf de Surge AI, qui évalue le raisonnement documentaire professionnel en contexte long sur 100 PDFs (4 592 pages), 10 domaines et 1 275 critères atomiques rédigés par des experts. GPQA Diamond est retiré, car considéré comme saturé. La part des tests privés passe à 40 % du score global (contre 20 % en v4.1), incluant AA-Briefcase, AA-Omniscience et les solutions CritPt. L'infrastructure de notation est également améliorée (AA-LCR v1.1, GDPval-AA v2, robustesse des sandboxes SciCode). Au classement, Claude Fable 5.1 d'Anthropic arrive en tête, suivi de GPT-6 Astra d'OpenAI (+4 pts vs GPT-5.6 Sol), puis Meta, SpaceXAI, Moonshot/Kimi, Z.AI et Google. La frontière coût/tâche est partagée par Anthropic, OpenAI, Meta et Z.AI.

Source

artificialanalysis.ai — Lire l'original →