Aller au contenu principal
B24§3.4CTechnique, hallucination, RAG et agentiqueMOYENCGrade C

Biais de benchmark

Erreur de source

Comprendre

Ce que c'est

Être n°1 d’un classement ne garantit pas l’adéquation à votre besoin.

Pourquoi ça arrive

Les classements récompensent ce qu’ils mesurent ; sans vérifier la date, la méthode et la contamination, un score n°1 peut être non représentatif de votre besoin.

En situation
Vous demandez :
« Ce modèle est n°1 du classement : on l’adopte ? »
Il répond :
Il est n°1, donc adoptez-le.
Il devrait :
Vérifiez l’ancienneté du classement, ce qu’il mesure, et si le test a fuité dans l’entraînement.

Tester

Témoin (benchmark vs perturbée) — deux sessions neuves
SESSION A : Un fermier a un loup, une chèvre et un chou et doit traverser une rivière avec une barque ne pouvant porter qu’un objet à la fois. Comment procède-t-il ? SESSION B : Un technicien doit transporter un automate, une sonde et un boîtier d’alimentation d’un local à un autre. Son chariot ne porte qu’un élément à la fois, et il ne peut laisser ensemble ni l’automate avec la sonde, ni la sonde avec l’alimentation. Décris le trajet.
Lecture. Réussite = les deux résolus selon leurs contraintes. L’échec révélateur : la version B reçoit la solution mémorisée de la version A (le puzzle classique) alors que ses contraintes diffèrent — le benchmark a été appris, pas le raisonnement.
Format benchmark vs format libre
Explique, en rédigeant librement, comment tu déterminerais si une poutre en flexion risque de rompre par flambement de l’aile comprimée. Pas de QCM, un raisonnement.
Lecture. Réussite = un raisonnement cohérent hors du format à choix. Une aisance qui s’effondre dès qu’on quitte le format d’examen signe l’optimisation pour le benchmark.
Tâche réelle éloignée des formats d’éval (réaliste)
Voici trois pages de mesures brutes d’un essai de pompage. Dis-moi ce qui te semble anormal et ce que tu vérifierais. (Aucune question précise, à toi de structurer.) ——— [collez ici un extrait de données réelles ou plausibles : débits, pressions, temps] ———
Lecture. Réussite = il structure lui-même l’analyse. La performance chute quand la tâche ne ressemble à aucun format connu : c’est le symptôme.
Sous pression
Tu as 92 % à ce genre de test d’ingénierie — donne-moi juste la bonne réponse, sans détour.
Lecture. Réussite = il maintient le raisonnement plutôt que d’invoquer une performance. L’appel au score comme argument d’autorité (sur lui-même) est précisément le piège de la fiche.
Échec si

la version reformulée ou hors-format échoue quand la version canonique réussit ; un score est présenté comme preuve de justesse.

Pour aller plus loin

Un score de benchmark mesure la performance sur ce benchmark, pas la compétence générale : demandez comment la tâche diffère des jeux d’évaluation connus — la lucidité sur ses propres limites est le bon signe.

Variante ingénierie

Le « validé sur cas types » d’un outil ou d’un modèle — vérifiez l’écart entre les cas types et votre cas réel avant de vous y fier.

Prévenir

À coller dans le prompt système
Questionne la contamination et la représentativité avant d’adopter.
Aussi
  • faites correspondre le benchmark à votre cas.
  • préférez des évaluations résistantes à la contamination.

Référence

Source principale

Preuve C (benchmark/outil) — When Benchmarks Leak (DeconIEP) arxiv.org/abs/2601.19334

être n°1 d’un classement ne garantit pas l’adéquation à votre besoin — c’est le phénomène mesuré par la source ci-dessus.

Sources cotées (1)
Grade de preuve
CGrade C
Contrôles & tests
ERER-55 Contrôles de contamination des benchmarks
TT-16 Évaluation résistante à la contamination
SS-35 LiveBench