Enjeux techniques et humains de l'IA

Outils actuels · évaluation

Benchmarks IA
LLMs, Image, Vidéo et Agents

Comment évaluer et comparer les modèles de fondation entre 2024 et 2026

Entre 2024 et 2026, l'évaluation des modèles de fondation a profondément changé. Les repères historiques comme MMLU ou HumanEval saturent : la comparaison moderne combine exactitude, calibration, robustesse, contamination, préférence humaine, coût, latence et reproductibilité.

LLMsVisionVidéoAgentsTool useLong contexteContaminationUsage réel
Illustration éditoriale d'un tableau de bord de benchmarks IA : radar multi-axes (exactitude, calibration, robustesse, coût, latence, préférence) entouré de panneaux abstraits
Radar multi-axes : exactitude, calibration, robustesse, coût, latence, préférence
44
Benchmarks documentés
6 familles · 4 modalités
périmètre : cette page
18
Frameworks, leaderboards & hubs
dont 9 hubs de comparaison indépendants
source : sections écosystème
71,9%
GPT-4o · MMLU-CF 0-shot
vs ~88% sur MMLU classique : l'écart mesure la contamination
source : arXiv 2412.15194
84
Sources référencées
papers, leaderboards, system cards
source : sources de cette page

↑ survolez (ou tabulez sur) un chiffre pour le détail et la source.

GLUE / SuperGLUESaturéMMLUHistoriqueHumanEvalHistoriqueTruthfulQAUtileBIG-bench / BBHSaturéMT-BenchHistoriqueMMLU-ProStandard 2024+MMLU-CFAnti-contaminationGPQA / SuperGPQAExpertLiveBenchDynamiqueBIG-Bench Extra HardTrès difficileSimpleQAFactualitéLiveCodeBenchCode dynamiqueSWE-bench (et variantes)Agent logicielBFCL v4 (Berkeley Function Calling)Tool useLongBench v2 / RULER / InfiniteBenchLong contexteChatbot Arena / LMArenaPréférenceAlpacaEval 2.0 / Arena-Hard-AutoAuto-jugéImageNet / ILSVRCPerceptionCOCOStandardLVISLong-tailVQA / VQAv2VQADocVQA / OCRBenchDocumentsMMMU / MathVista / CharXivRaisonnement visuelMMStarVLMMME / MME-UnifyMulti-tâchesImageBindPas un benchmarkKinetics-400/600/700ClassificationSomething-Something V2TemporalitéAVA / ActivityNetLocalisationNExT-QAVidéo-QAEgo4D / EgoSchemaEgocentriqueVideo-MME / Video-MME v2VLM vidéoVBench / VBench-2.0GénérationWebVidPas un benchmarkBrowseCompWebAssistantBenchWebτ-benchTool useτ²-benchCoordinationSWE-bench (variantes)CodeBFCLFunction callingMiniGrid / Atari ALE / CALERLMeta-World / ManiSkill-HABRobotiqueMini-BEHAVIOREmbodiedGLUE / SuperGLUESaturéMMLUHistoriqueHumanEvalHistoriqueTruthfulQAUtileBIG-bench / BBHSaturéMT-BenchHistoriqueMMLU-ProStandard 2024+MMLU-CFAnti-contaminationGPQA / SuperGPQAExpertLiveBenchDynamiqueBIG-Bench Extra HardTrès difficileSimpleQAFactualitéLiveCodeBenchCode dynamiqueSWE-bench (et variantes)Agent logicielBFCL v4 (Berkeley Function Calling)Tool useLongBench v2 / RULER / InfiniteBenchLong contexteChatbot Arena / LMArenaPréférenceAlpacaEval 2.0 / Arena-Hard-AutoAuto-jugéImageNet / ILSVRCPerceptionCOCOStandardLVISLong-tailVQA / VQAv2VQADocVQA / OCRBenchDocumentsMMMU / MathVista / CharXivRaisonnement visuelMMStarVLMMME / MME-UnifyMulti-tâchesImageBindPas un benchmarkKinetics-400/600/700ClassificationSomething-Something V2TemporalitéAVA / ActivityNetLocalisationNExT-QAVidéo-QAEgo4D / EgoSchemaEgocentriqueVideo-MME / Video-MME v2VLM vidéoVBench / VBench-2.0GénérationWebVidPas un benchmarkBrowseCompWebAssistantBenchWebτ-benchTool useτ²-benchCoordinationSWE-bench (variantes)CodeBFCLFunction callingMiniGrid / Atari ALE / CALERLMeta-World / ManiSkill-HABRobotiqueMini-BEHAVIOREmbodied
Repères / 01

Pourquoi les benchmarks ont changé entre 2024 et 2026

L'évaluation des modèles de fondation a nettement changé de nature en deux ans. Les benchmarks historiques (MMLU, HumanEval, BIG-bench…) restent la langue commune, mais ils sont saturés, contaminés, parfois entachés d'erreurs de labels — et surtout ils ne disent plus grand-chose des modèles de pointe.

Une nouvelle génération les a complétés ou remplacés : MMLU-Pro et BBEH durcissent les anciens, MMLU-CF et LiveBench protègent contre la contamination, SuperGPQA élargit les disciplines, BFCL et SWE-bench mesurent l'usage réel d'outils et la résolution d'issues GitHub, BrowseComp et τ-bench évaluent les agents web.

Le message méthodologique est clair : un seul score ne suffit plus. Une comparaison crédible combine exactitude, calibration, robustesse, préférence humaine, coût, latence et reproductibilité — et, pour les agents, réussite de tâche et respect de contraintes.

▽ Ce qu'il faut retenir — 7 points

  1. 01

    Les benchmarks historiques (GLUE, SuperGLUE, MMLU, HumanEval, TruthfulQA, BIG-bench) restent la langue commune des papiers et des system cards, mais sont largement saturés pour les modèles de pointe.

  2. 02

    Les nouveaux benchmarks visent explicitement à corriger les défauts des anciens : saturation (MMLU-Pro, BBEH), erreurs de labels (MMLU-Redux), contamination (MMLU-CF, LiveBench), biais disciplinaire (SuperGPQA).

  3. 03

    Les leaderboards se sont professionnalisés : Open LLM Leaderboard v2, HELM, lm-evaluation-harness, OpenCompass, BFCL, LiveCodeBench, SWE-bench, et les arènes de préférences humaines (Chatbot Arena / LMArena).

  4. 04

    Des hubs indépendants agrègent qualité, prix et vitesse à travers les fournisseurs (Artificial Analysis, Vellum, Epoch AI), tandis qu'OpenRouter Rankings expose la préférence révélée — quels modèles sont réellement consommés en production.

  5. 05

    Les évaluations privées anti-contamination (SEAL de Scale AI) et les arènes spécialisées (WebDev Arena, Copilot Arena, Aider Polyglot, Search Arena) prennent de l'importance face à la saturation des benchmarks publics.

  6. 06

    Pour l'image, la vidéo et les agents, il n'existe pas d'équivalent unique de MMLU : on compare des familles de tâches (perception, OCR, raisonnement visuel, génération vidéo, agents web).

  7. 07

    Une comparaison crédible doit combiner exactitude, calibration, robustesse, préférence humaine, coût, latence, reproductibilité et — pour les agents — réussite de tâche et respect de contraintes.

Vocabulaire / 02

Quatre objets à ne pas confondre

Dans les conversations sur « les benchmarks », quatre objets distincts sont régulièrement confondus. Les distinguer évite la plupart des malentendus. Un benchmark est un jeu de tâches ; une suite est un outillage logiciel qui exécute ces tâches ; un leaderboard publie des comparaisons ; les model-card evals sont des batteries internes au fournisseur.

01

Benchmark / dataset d'évaluation

Ensemble de tâches et de réponses de référence, comme MMLU, HumanEval, EgoSchema ou VQAv2. C'est l'unité de base : un jeu fixe de questions/cas et une métrique associée.

+
Reproductible, comparable dans le temps, public
−
Peut se saturer, être contaminé, ou contenir des erreurs de labels
02

Suite / framework d'évaluation

Logiciel qui exécute et normalise des benchmarks, comme HELM (Stanford), lm-evaluation-harness (EleutherAI) ou OpenCompass. Ce n'est pas un benchmark mais un outillage.

+
Standardise prompts, métriques, harness ; rend les résultats reproductibles
−
Le choix du bundle de tâches reste subjectif
03

Leaderboard

Publication continue de résultats comparables : Open LLM Leaderboard v2, BFCL v4, LiveCodeBench, SWE-bench, Chatbot Arena. Souvent dynamique, parfois rafraîchi.

+
Vue d'ensemble du paysage, mise à jour régulière
−
Score agrégé selon un bundle implicite ; sensible au gaming
04

Model-card evals

Batteries d'évaluations publiées par un fournisseur (system cards GPT-4o, GPT-4.1, o3/o4-mini d'OpenAI). Utiles pour comparer dans une même série.

+
Détaillés, alignés sur les capacités annoncées
−
Pas équivalents à un benchmark indépendant ; choix de protocole opaque
Chaîne d'évaluation en quatre étapes : benchmark (jeu de tâches) → suite (outillage d'exécution) → leaderboard (classement publié) → model card (batterie interne du fournisseur)
Les 4 objets de l'évaluation — un benchmark n'est ni une suite, ni un leaderboard, ni une model card
Registre LLM / 03

Benchmarks LLM : historiques, anti-saturation, spécialisés

Trois strates se superposent : la langue commune héritée, la génération qui corrige ses défauts, et les suites spécialisées où se joue la vraie différenciation.

Les benchmarks LLM historiques

Ces benchmarks ne suffisent plus seuls à départager les meilleurs modèles, mais ils restent indispensables comme repères : ils forment la langue commune des papiers, des leaderboards et des system cards. Les ignorer, c'est se priver de toute comparaison historique avec les générations précédentes.

▽ Benchmarks LLM historiques

06 entrées

Toujours cités, mais largement insuffisants seuls pour départager les meilleurs modèles en 2026.

GLUE / SuperGLUE

Saturé
9 tâches NLU (entailment, sentiment, similarité). Largement saturés avant 2024. Repère historique et point d'entrée pédagogique.
→ GLUE (ACL 2018) · SuperGLUE

MMLU

Historique
57 matières académiques en QCM. Toujours reporté dans les model cards 2024-2025, mais peu discriminant pour les meilleurs modèles. ~6,5% d'erreurs de labels selon MMLU-Redux.
→ Paper MMLU

HumanEval

Historique
Fonctions Python à partir de docstrings, métrique pass@k. Standard historique du code, mais peu représentatif du repo-level coding moderne.
→ Codex paper · repo

TruthfulQA

Utile
817 questions conçues pour piéger les fausses croyances humaines. Toujours utile pour la factualité courte, rarement seul.
→ Paper officiel

BIG-bench / BBH

Saturé
204 tâches diverses (BIG-bench) ; 23 tâches dures (BBH). Omniprésent en 2024, proche de la saturation en 2025.
→ BIG-bench · BBH

MT-Bench

Historique
Questions multi-tours ouvertes, jugées par un LLM. Important pour l'histoire du LLM-as-a-judge ; biais de position et de verbosité connus.
→ Paper

La nouvelle génération anti-saturation

Chacun de ces benchmarks vise explicitement à corriger un défaut des précédents. MMLU-Pro contre la saturation, MMLU-Redux contre les erreurs de labels, MMLU-CF contre la contamination, SuperGPQA contre le biais STEM, LiveBench contre le statisme. C'est désormais ce socle qui sert à classer les modèles de pointe.

▽ Benchmarks LLM devenus centraux en 2024-2026

06 entrées

Ils corrigent explicitement un défaut des anciens : saturation, contamination, erreurs de labels, biais disciplinaire ou statisme.

MMLU-Pro

Standard 2024+
Version durcie de MMLU (10 options, plus de raisonnement). Chute de 16 à 33 points vs MMLU. Meilleure stabilité au prompt. Nouveau standard depuis 2024.
→ Paper arXiv

MMLU-CF

Anti-contamination
Benchmark fermé, décontaminé, plus difficile. GPT-4o n'atteint que 71,9% en 0-shot dans le papier. Excellent antidote à la contamination.
→ Paper arXiv

GPQA / SuperGPQA

Expert
GPQA : 448 QCM 'Google-proof' rédigés par des PhD (humains ~65%). SuperGPQA (2025) couvre 285 disciplines graduate, contre le biais STEM.
→ GPQA · SuperGPQA

LiveBench

Dynamique
Questions fréquemment mises à jour, vérité vérifiable, contamination limitée. Coûteux à maintenir mais bien plus crédible dans le temps.
→ livebench.ai

BIG-Bench Extra Hard

Très difficile
Successeur plus dur de BBH. Le meilleur généraliste plafonne à 9,8% ; le meilleur modèle de raisonnement à 44,8%.
→ Paper BBEH

SimpleQA

Factualité
4 326 questions factuelles courtes avec distinction réponse/refus. Très utile pour mesurer les hallucinations courtes.
→ OpenAI blog

Là où se joue la vraie différenciation

Au-delà des grands QCM académiques, ce sont les benchmarks spécialisés qui apportent le plus de signal pratique : qualité de code (LiveCodeBench, SWE-bench), usage d'outils (BFCL), longs contextes (LongBench v2, RULER), et préférence conversationnelle (Arena, AlpacaEval). C'est ici qu'un modèle gagne ou perd un déploiement produit.

▽ Code, contexte long, tool use et préférence

06 entrées

C'est ici que se joue la vraie différenciation entre modèles de pointe.

LiveCodeBench

Code dynamique
Problèmes de programmation publiés dans le temps, contamination limitée. Bien plus représentatif du progrès réel en code que HumanEval seul.
→ livecodebench.github.io

SWE-bench (et variantes)

Agent logiciel
Issues GitHub réelles dans des dépôts Python ; SWE-bench Verified (500 cas validés), Multilingual (9 langages, 42 repos), Multimodal (517 issues avec captures). En 2026, OpenAI juge SWE-bench Verified trop contaminé pour le frontier coding.
→ swebench.com · OpenAI 2026

BFCL v4 (Berkeley Function Calling)

Tool use
Appels de fonctions réels, scénarios single/multi-turn, métriques AST + exécution + coût/latence. Référence majeure du tool use depuis 2024.
→ Leaderboard Berkeley

LongBench v2 / RULER / InfiniteBench

Long contexte
Benchmarks de contexte long. LongBench v2 : 503 QCM très difficiles, 8k à 2M mots ; humains experts à 53,7%, o1-preview à 57,7%. RULER isole la 'vraie' taille de contexte ; InfiniteBench cible >100k tokens.
→ LongBench v2 · RULER · InfiniteBench

Chatbot Arena / LMArena

Préférence
Préférences humaines pairwise sur dialogues réels (Elo / Bradley-Terry). Toujours central : excellent proxy de préférence utilisateur, moins contrôlé qu'un benchmark fermé.
→ lmarena.ai

AlpacaEval 2.0 / Arena-Hard-Auto

Auto-jugé
Évaluation par juge LLM avec contrôle de longueur (AlpacaEval) ou 500 prompts difficiles (Arena-Hard-Auto). Bons corrélats d'Arena, mais auto-jugeables donc gameables.
→ AlpacaEval · Arena-Hard-Auto
Écosystème / 04

Frameworks, leaderboards et hubs de comparaison

L'outillage qui rend les évaluations comparables et reproductibles

Sites de comparaison indépendants : où regarder en 2026

À côté des frameworks académiques (HELM, lm-eval-harness, OpenCompass) et des leaderboards officiels par benchmark, un écosystème de hubs de comparaison indépendants s'est imposé entre 2024 et 2026. Ils agrègent des dizaines de modèles à travers les fournisseurs et exposent, en un coup d'œil, qualité, prix, latence, voire popularité réelle.

Point important : OpenRouter Rankings mesure une chose qu'aucun benchmark ne capture — quels modèles les développeurs *paient effectivement* pour utiliser en production. C'est un signal de préférence révélée orthogonal aux scores.

Illustration éditoriale d'un agrégateur de leaderboards : carte de hubs reliés à trois panneaux de classements (qualité, usage, prix)
Hubs agrégateurs : qualité, usage réel, prix — trois classements complémentaires

▽ Usage réel et préférence révélée — 3 entrées

▽ Évaluations privées / anti-contamination — 3 entrées

Modalités / 05

Image, vidéo, agents : pas d'équivalent unique de MMLU

Hors texte, on compare des familles de tâches — jamais un score unique. Et l'on sépare strictement compréhension et génération.

Vision : un œil-diaphragme entouré de trois familles d'évaluation — perception (détection d'objets), raisonnement visuel (figure géométrique à résoudre) et OCR (document aux lignes surlignées)
Vision — perception, raisonnement visuel, lecture documentaire
Vidéo : deux moitiés séparées par un signe ≠ — à gauche une pellicule analysée à la loupe (compréhension), à droite une pellicule en cours de création (génération)
Vidéo — compréhension ≠ génération, jamais fusionnées
Agents : un robot au centre d'un triangle reliant navigation web, usage d'outils et ingénierie logicielle, entouré du scaffold en pointillés
Agents — web, outils, code : le scaffold compte autant que le modèle

Image et vision-langage : pas d'équivalent unique de MMLU

Pour l'image, on ne compare jamais un modèle sur un seul benchmark. Les évaluations sérieuses combinent trois familles : la perception classique (ImageNet, COCO, LVIS), le raisonnement visuo-linguistique (VQA, MMMU, MathVista, MMStar) et la lecture documentaire (DocVQA, OCRBench).

Deux pièges fréquents : ImageBind n'est pas un benchmark mais un modèle d'embedding ; et un score MME agrégé masque souvent de fortes asymétries entre sous-capacités.

▽ Benchmarks image et vision-langage

09 entrées

Pour l'image, pas d'équivalent unique de MMLU : on combine perception classique, lecture documentaire et raisonnement visuo-linguistique.

ImageNet / ILSVRC

Perception
Classification à grande échelle (top-1, top-5). Toujours un repère, surtout pour les encodeurs visuels.
→ image-net.org

COCO

Standard
Détection, segmentation, keypoints, captions. Standard polyvalent (AP/AR, BLEU/CIDEr) ; complété par LVIS pour le long-tail.
→ cocodataset.org

LVIS

Long-tail
>1200 catégories, focus long-tail. Évite le biais vers les classes fréquentes. Complète COCO plutôt que le remplace.
→ lvisdataset.org

VQA / VQAv2

VQA
Questions ouvertes sur images COCO, 10 réponses annotées. Fondamental pour vision-langage, désormais complété par DocVQA / OCRBench / MMMU.
→ visualqa.org

DocVQA / OCRBench

Documents
QA sur documents (DocVQA, ANLS) et OCR + compréhension textuelle visuelle (OCRBench, OCRBench v2). Clé pour les assistants documentaires.
→ DocVQA · OCRBench

MMMU / MathVista / CharXiv

Raisonnement visuel
Triade fréquente dans les system cards VLM : compréhension multimodale niveau universitaire, math visuelle, lecture de figures scientifiques.
→ MMMU

MMStar

VLM
Mesure perception et raisonnement visuels fins. Souvent combiné à MMMU, MathVista, OCRBench dans les comparaisons VLM.
→ Repo MMStar

MME / MME-Unify

Multi-tâches
Évaluation multimodale large/unifiée par sous-capacités. Photo rapide, mais score agrégé parfois opaque.
→ MME-Unify (2025)

ImageBind

Pas un benchmark
Attention : ce n'est pas un benchmark mais un modèle de représentation joint (image, texte, audio, profondeur, IMU). Souvent cité à tort.
→ Paper

Vidéo : compréhension et génération sont deux mondes

Le monde vidéo est encore plus fragmenté que l'image. Une comparaison crédible distingue au minimum classification d'actions (Kinetics, Something-Something), localisation spatio-temporelle (AVA, ActivityNet), vidéo-QA (NExT-QA, EgoSchema, Video-MME) et génération vidéo (VBench, VBench-2.0).

Mélanger un score Video-MME avec un score VBench dans une moyenne globale n'a strictement aucun sens : on n'évalue pas la même chose.

▽ Benchmarks vidéo : compréhension et génération

08 entrées

Le monde vidéo est fragmenté : ne jamais fusionner compréhension et génération dans une moyenne globale.

Kinetics-400/600/700

Classification
Classification d'actions humaines courtes (clips ~10s). Top-1/top-5 accuracy. Toujours un benchmark de base, faible couverture du raisonnement.
→ Google Research

Something-Something V2

Temporalité
Compréhension d'actions fines et relations d'objets. Plus sensible à la dynamique temporelle que Kinetics.
→ Qualcomm

AVA / ActivityNet

Localisation
AVA : actions atomiques localisées en espace/temps (mAP). ActivityNet : challenge multi-tâches reconnaissance/détection/captioning.
→ AVA · ActivityNet

NExT-QA

Vidéo-QA
Vidéo-QA causal et temporel, compréhension de scène. Très utile pour diagnostiquer le raisonnement temporel.
→ Paper

Ego4D / EgoSchema

Egocentrique
Référence pour le first-person video : episodic memory, forecasting, hands/objects, social. EgoSchema : QA sur longues vidéos egocentriques.
→ Ego4D · EgoSchema

Video-MME / Video-MME v2

VLM vidéo
Évaluation multimodale vidéo générale. v2 (2026) : 900 vidéos, 7 dimensions, 25 tâches. Devenu standard pour les VLM vidéo.
→ Site officiel

VBench / VBench-2.0

Génération
Génération vidéo : 16 dimensions hiérarchiques de qualité. VBench-2.0 / VBench++ étendent vers human fidelity, controllability, physics, commonsense.
→ Project page

WebVid

Pas un benchmark
Attention : grand corpus de pré-entraînement vidéo-texte, pas un benchmark public standardisé. Souvent confondu.
→ Repo

Agents : trois mondes qui coexistent

Les benchmarks d'agents ont muté plus rapidement que tous les autres. Trois mondes coexistent désormais : agents web/assistants (BrowseComp, AssistantBench), agents logiciels (SWE-bench), agents incarnés et robotique (Meta-World, ManiSkill-HAB).

Leur particularité : la performance dépend autant du modèle que du scaffold — outils, mémoire, navigateur, budget de pas. À lire avec encore plus de prudence qu'un leaderboard LLM classique.

▽ Benchmarks d'agents

09 entrées

Trois mondes coexistent : agents web/assistants, agents logiciels, agents incarnés/robotique. Le scaffold compte autant que le modèle.

BrowseComp

Web
1 266 questions courtes, vérifiables, très dures à trouver sur le web. Benchmark clé du browsing en 2025-2026.
→ OpenAI · PDF

AssistantBench

Web
214 tâches réalistes, 525+ pages, 258 sites. Très bon test de navigation multi-site, proche de besoins réels.
→ Site officiel

τ-bench

Tool use
Interaction agent-outils-utilisateur, respect de règles (success rate / conformité). Variance non négligeable entre runs.
→ taubench.com

τ²-bench

Coordination
Dual-control : utilisateur et agent modifient un monde partagé. Ajoute la coordination, absente des benchmarks classiques.
→ Sierra Research

SWE-bench (variantes)

Code
Coding agent : résolution d'issues réelles. Verified, Multilingual, Multimodal et SWE-bench Pro recommandé en 2026 pour le frontier coding.
→ swebench.com

BFCL

Function calling
Tool-using : validité et exécution des appels de fonctions, sous-scores par scénario. Souvent le meilleur test public de function calling pur.
→ Leaderboard

MiniGrid / Atari ALE / CALE

RL
RL classique : exploration et planification (MiniGrid), contrôle séquentiel (Atari ALE/CALE). Référence historique, éloignée des assistants modernes.
→ MiniGrid · ALE

Meta-World / ManiSkill-HAB

Robotique
Robotique : 50 tâches de manipulation (Meta-World) ; manipulation basse couche en réarrangement domestique (ManiSkill-HAB, 2025).
→ Meta-World · ManiSkill-HAB

Mini-BEHAVIOR

Embodied
Embodied / household : version procédurale 2D simplifiée de BEHAVIOR. Sert surtout à l'accessibilité expérimentale.
→ OpenReview
Méthode / 06

Comparer correctement : ce qu'il faut inclure, ce qu'il faut éviter

Une comparaison moderne ne se résume pas à un score. Elle ajoute au minimum six couches au-dessus du chiffre principal : calibration, robustesse, préférence humaine, coût, latence, reproductibilité. Et elle évite quelques pièges récurrents — au premier rang desquels confondre score de benchmark et performance produit.

✓Ce qu'une comparaison moderne doit inclure

  • Multi-benchmark

    Au moins un benchmark fermé/stable + un benchmark difficile/récent + un test réaliste pour la capacité visée.

  • Calibration

    Distinguer 'réponse correcte', 'réponse fausse' et 'refus justifié' ; rapporter la calibration probabiliste quand disponible.

  • Robustesse au prompt

    Vérifier que les scores ne dépendent pas trop du wording (MMLU-Pro est conçu pour cela).

  • Préférence humaine

    Compléter les benchmarks fermés par Arena ou un panel humain — surtout pour la qualité conversationnelle.

  • Coût et latence

    Tracer une courbe qualité/coût et qualité/latence, pas seulement un classement par score brut.

  • Reproductibilité

    Documenter modèle, version, prompt, température, juge, harness, seed, tokenization.

  • Variance

    Pour agents, tool use et juges LLM, faire plusieurs runs et reporter intervalles de confiance.

  • Sous-scores

    Publier par capacité et par slice, pas seulement la moyenne agrégée.

!Les pièges fréquents

  • Confondre score et performance produit

    Un excellent MMLU ne dit rien sur le tool use, la navigation web ou la lecture de documents.

  • Agréger abusivement

    Une moyenne sur 6 benchmarks dépend des poids implicites — les scores agrégés cachent les vraies forces et faiblesses.

  • Protocoles hétérogènes

    0-shot vs few-shot, sans outil vs avec outil, direct vs CoT, juge humain vs juge LLM, 1 run vs 5 runs : pas comparable.

  • Mélanger benchmark, framework et leaderboard

    OpenCompass et lm-eval-harness sont des outillages ; ImageBind est un modèle ; BFCL et BrowseComp sont des benchmarks.

  • Ignorer la contamination

    Vérifier la date, la fermeture du benchmark, et l'existence de versions Redux/CF/Verified/Pro.

  • Benchmark gaming

    Les benchmarks auto-jugés sont manipulables (cf. 'Cheating Automatic LLM Benchmarks'). Croiser avec un échantillon humain.

Protocole pratique selon la modalité

À chaque type de modèle, sa combinaison de benchmarks. Voici la recommandation minimale pour comparer honnêtement deux modèles dans chacune des grandes familles : LLM généraliste, VLM image-document, modèle vidéo et agent.

▽ Protocole recommandé par modalité

protocole 01

LLM généraliste

Combiner un benchmark de connaissance/raisonnement moins saturé (MMLU-Pro ou SuperGPQA), un benchmark de factualité (SimpleQA ou TruthfulQA), un benchmark de préférence conversationnelle (Arena ou AlpacaEval), un benchmark de code ou tool use si pertinent (LiveCodeBench, BFCL), et un benchmark de long contexte (LongBench v2 ou RULER) si le modèle est vendu comme '128k+' ou '1M tokens'.

+
Couvre les vraies capacités produit, résiste à la contamination, expose la robustesse
→
Ajouter Arena-Hard-Auto pour un signal supplémentaire d'instruction-following difficile
protocole 02

VLM image-document

Séparer perception, lecture et raisonnement : ImageNet / COCO / LVIS pour la perception de base, VQAv2 / MMStar / MMMU / MathVista pour le raisonnement visuo-linguistique, DocVQA / OCRBench pour la lecture documentaire. Pour un usage entreprise, les benchmarks documentaires sont souvent plus prédictifs.

+
Diagnostic précis des sous-capacités, alignement avec les usages métier
→
Compléter par MME-Unify pour une vue agrégée multi-capacités
protocole 03

Modèle vidéo

Annoncer clairement compréhension vs génération. En compréhension : Kinetics, AVA, NExT-QA, Ego4D, EgoSchema, Video-MME (v2). En génération : VBench puis VBench-2.0 / VBench++. Ne jamais fusionner les deux dans une moyenne.

+
Évite les comparaisons absurdes entre tâches incompatibles
→
Reporter la cohérence temporelle et la fidélité physique séparément du score global
protocole 04

Agent

Triangle : un benchmark web réaliste (BrowseComp ou AssistantBench), un benchmark de tool-use/règles (τ-bench ou BFCL), et un benchmark logiciel si le produit code (SWE-bench ou CoreCodeBench). Reporting du scaffold, du nombre d'étapes et de la variance non négociable.

+
Couvre les trois axes critiques : navigation, outils, code
→
Documenter le navigateur, la mémoire, le prompting système et le budget de pas

▽ Conclusion : du score unique à la batterie diagnostique

Si l'on devait résumer la période 2024-2026 en une phrase : les benchmarks utiles sont devenus moins des « examens finaux » que des batteries diagnostiques. Les meilleurs rapports d'évaluation ne montrent plus seulement « qui gagne », mais sur quoi le modèle gagne, à quel coût, dans quelles conditions, avec quelle robustesse, et avec quel risque de tromperie méthodologique.

C'est précisément la direction prise par HELM, LiveBench, BFCL, les suites de long contexte, les benchmarks agents récents et les analyses de contamination/leaderboards. Les system cards des fournisseurs reflètent ce changement : la page GPT-4.1 d'OpenAI cite explicitement OpenAI-MRCR, Graphwalks, MMMU, MathVista, CharXiv, ComplexFuncBench et τ-bench, avec des chiffres précis par sous-capacité plutôt qu'un score unique.

Un benchmark qui servait encore de référence en 2023-2024 peut être en 2026 soit saturé (BBH), soit corrigé (MMLU-Redux), soit décontaminé (MMLU-CF), soit déclassé par un successeur plus difficile (BBEH, SWE-bench Pro). Construire une comparaison crédible, c'est désormais combiner plusieurs angles — et accepter qu'aucun score unique ne raconte toute l'histoire.

Le principe pratique à retenir : choisir d'abord l'usage visé (connaissance, code, doc, image, vidéo, agent), puis combiner un benchmark stable, un benchmark récent et difficile, et un test réaliste — en documentant scrupuleusement le protocole. C'est la seule manière d'éviter à la fois la saturation, la contamination et le benchmark gaming.

Références / 07

Sources et ressources

84 références : papers, leaderboards, system cards et analyses méthodologiques.

  1. [01]MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark (arXiv 2406.01574)
  2. [02]MMLU-Redux: Are We Done with MMLU? (arXiv 2406.04127)
  3. [03]MMLU-CF: A Contamination-Free Multi-Task Language Understanding Benchmark (arXiv 2412.15194)
  4. [04]AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models (arXiv 2304.06364)
  5. [05]SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines (arXiv 2502.14739)
  6. [06]BIG-Bench Extra Hard / BBEH (arXiv 2502.19187)
  7. [07]BIG-bench: Beyond the Imitation Game (arXiv 2206.04615)
  8. [08]Challenging BIG-Bench tasks and chain-of-thought / BBH (arXiv 2210.09261)
  9. [09]SuperGLUE (arXiv 1905.00537)
  10. [10]GLUE — A Multi-Task Benchmark for NLU (BlackboxNLP 2018)
  11. [11]TruthfulQA — official paper
  12. [12]SimpleQA — OpenAI (introduction)
  13. [13]MT-Bench / Judging LLM-as-a-Judge (arXiv 2306.05685)
  14. [14]MT-Bench (PDF)
  15. [15]AlpacaEval — repo & leaderboard
  16. [16]Arena-Hard-Auto — repo
  17. [17]LiveBench — official
  18. [18]LMentry — Elementary Language Tasks (arXiv 2211.02069 / ACL Findings 2023)
  19. [19]HumanEval — Evaluating LLMs Trained on Code (Codex paper, arXiv 2107.03374)
  20. [20]HumanEval — repo
  21. [21]LiveCodeBench — official
  22. [22]SWE-bench — Can Language Models Resolve Real-World GitHub Issues? (arXiv 2310.06770)
  23. [23]SWE-bench — official site
  24. [24]SWE-bench Verified
  25. [25]SWE-bench Multilingual
  26. [26]SWE-bench Multimodal
  27. [27]OpenAI — Why we no longer evaluate SWE-bench Verified (2026)
  28. [28]CoreCodeBench — repo
  29. [29]Berkeley Function-Calling Leaderboard (BFCL) — Gorilla
  30. [30]Gorilla / BFCL — repo
  31. [31]LongBench (arXiv 2308.14508)
  32. [32]LongBench v2 (arXiv 2412.15204)
  33. [33]RULER: What's the Real Context Size of Your Long-Context Models? (arXiv 2404.06654)
  34. [34]InfiniteBench — Extending Long Context Evaluation Beyond 100K Tokens (arXiv 2402.13718)
  35. [35]L-Eval — Standardizing Long-Context Evaluation (ACL 2024)
  36. [36]HELM — Stanford CRFM (Holistic Evaluation of Language Models)
  37. [37]lm-evaluation-harness — EleutherAI
  38. [38]OpenCompass — repo
  39. [39]Open LLM Leaderboard v2 — Hugging Face (blog)
  40. [40]Chatbot Arena (LMArena) — Arena Leaderboard
  41. [41]Artificial Analysis — quality / price / speed comparison
  42. [42]OpenRouter Rankings — usage par volume de tokens
  43. [43]Vellum LLM Leaderboard
  44. [44]Scale SEAL Leaderboards (prompts privés)
  45. [45]Epoch AI — Benchmarking Hub
  46. [46]Aider Polyglot Coding Leaderboard
  47. [47]AGI-Eval — aggregateur bilingue
  48. [48]Vectara Hallucination Leaderboard
  49. [49]ImageNet — official
  50. [50]ILSVRC challenges
  51. [51]COCO dataset
  52. [52]LVIS dataset
  53. [53]VQA Challenge
  54. [54]DocVQA challenges
  55. [55]OCRBench / MultimodalOCR — repo
  56. [56]OCRBench (challenge)
  57. [57]MMStar — repo
  58. [58]MME-Unify (arXiv 2503.21755)
  59. [59]ImageBind — One Embedding Space To Bind Them All (arXiv 2305.05665)
  60. [60]Kinetics — Google Research
  61. [61]Something-Something V2 — Qualcomm
  62. [62]AVA — Google Research
  63. [63]ActivityNet
  64. [64]Ego4D — official
  65. [65]NExT-QA (arXiv 2105.08276)
  66. [66]Video-MME — CVPR 2025 paper (PDF)
  67. [67]VBench — project page
  68. [68]VBench — CVPR 2024 paper
  69. [69]WebVid — repo
  70. [70]BrowseComp — OpenAI
  71. [71]BrowseComp — paper PDF
  72. [72]AssistantBench — official
  73. [73]τ-bench — official
  74. [74]MiniGrid — publications
  75. [75]Arcade Learning Environment (ALE) — repo
  76. [76]CALE — Continuous Atari Learning Environment (NeurIPS 2024 PDF)
  77. [77]Meta-World — LeRobot docs
  78. [78]ManiSkill-HAB — project page
  79. [79]OpenAI — GPT-4o System Card
  80. [80]OpenAI — GPT-4.1 (model page & evals)
  81. [81]Cheating Automatic LLM Benchmarks (arXiv 2410.07137)
  82. [82]Leaderboard analysis & best practices (arXiv 2310.01824)
  83. [83]LBOps — leaderboard operations & reproducibility (OpenReview)
  84. [84]Data contamination in foundation models — Balloccu et al., ACL 2024 (PDF)