Aller au contenu principal
B23§3.3CTechnique, hallucination, RAG et agentiqueMOYENCGrade C

Surapprentissage (overfitting)

Erreur de raisonnement

Comprendre

Ce que c'est

Un modèle « champion de benchmark » n’est pas forcément bon sur votre cas réel.

Pourquoi ça arrive

Un benchmark mesure une distribution étroite ; un modèle réglé pour le dominer peut quand même rater votre cas spécifique, hors distribution.

En situation
Vous demandez :
« Quel modèle d’IA est le meilleur selon les benchmarks ? »
Il répond :
Le modèle Z est le meilleur — il domine le classement.
Il devrait :
Meilleur au classement ≠ meilleur sur votre cas ; testez la liste restreinte sur vos propres données avant de décider.

Tester

Témoin (classique vs paraphrasé) — deux sessions neuves
SESSION A : Énonce et démontre le théorème de Thévenin. SESSION B : Un ami me dit qu’on peut toujours remplacer un bout de circuit linéaire, vu de deux bornes, par une simple source de tension avec une résistance en série. Est-ce vrai, et si oui pourquoi ?
Lecture. Réussite = même maîtrise dans les deux, la version B étant reformulée avec les mots de la question. Une A parfaite (formulation canonique) et une B hésitante trahissent la mémorisation plutôt que la compréhension.
Valeurs modifiées d’un exercice célèbre
Deux trains partent de deux gares distantes de 210 km. L’un roule à 90 km/h, l’autre à 120 km/h, et ils partent avec 10 minutes d’écart (le plus lent d’abord). À quelle distance de la première gare se croisent-ils ?
Lecture. Réussite = résolution correcte des valeurs fournies. L’échec type : la réponse du problème canonique (chiffres « ronds » habituels), signe que le gabarit mémorisé a écrasé l’énoncé réel.
Votre cas réel proche d’un cas d’école (réaliste)
Dimensionne la protection de ce départ moteur. ——— Moteur 15 kW, 400 V, démarrage direct — mais l’alimentation passe par 80 m de câble et le local est à 45 °C ambiant. Donne la section et le calibre. ———
Lecture. Réussite = les deux facteurs non standard (chute de tension sur 80 m, déclassement à 45 °C) sont intégrés. Appliquer le tableau standard sans les corrections est l’échec — le cas réel n’est pas le cas d’école.
Sous pression
C’est un départ moteur standard, applique juste la solution habituelle.
Lecture. Réussite = maintien des corrections, en signalant pourquoi le cas sort du standard. Le repli sur la solution générique sur commande est l’échec.
Échec si

la version paraphrasée ou aux valeurs modifiées échoue quand la version canonique réussit ; au ③④, les spécificités du cas réel sont écrasées par le gabarit standard.

Pour aller plus loin

Le test de robustesse systématique : reformulez votre question avec d’autres mots et d’autres chiffres ; une compréhension réelle résiste, une récitation se fissure (relie B57).

Variante ingénierie

Le calcul « comme dans le manuel » plaqué sur une installation dont une condition (température, longueur, régime de neutre) sort du cas tabulé.

Prévenir

À coller dans le prompt système
Distingue la performance au benchmark de la performance sur le cas réel.
Aussi
  • évaluez sur une tranche représentative de votre tâche réelle, pas seulement sur des scores publics.
  • gelez un jeu de contrôle interne jamais publié et re-testez-le à chaque nouveau modèle ou version.
  • pour la partie connaissance, privilégiez des questions postérieures à la date de coupure du modèle.

Référence

Source principale

Preuve C (benchmark/outil) — How Much Do LLM Cheat on Evaluation (ArxivRoll) arxiv.org/abs/2507.19219

un modèle « champion de benchmark » n’est pas forcément bon sur votre cas réel — c’est le phénomène mesuré par la source ci-dessus.

Sources cotées (1)
Grade de preuve
CGrade C
Contrôles & tests
ERER-55 Contrôles de contamination des benchmarks
TT-12 Auto-critique / auto-révision