Surapprentissage (overfitting)
Comprendre
Un modèle « champion de benchmark » n’est pas forcément bon sur votre cas réel.
Un benchmark mesure une distribution étroite ; un modèle réglé pour le dominer peut quand même rater votre cas spécifique, hors distribution.
Tester
la version paraphrasée ou aux valeurs modifiées échoue quand la version canonique réussit ; au ③④, les spécificités du cas réel sont écrasées par le gabarit standard.
Le test de robustesse systématique : reformulez votre question avec d’autres mots et d’autres chiffres ; une compréhension réelle résiste, une récitation se fissure (relie B57).
Le calcul « comme dans le manuel » plaqué sur une installation dont une condition (température, longueur, régime de neutre) sort du cas tabulé.
Prévenir
- › évaluez sur une tranche représentative de votre tâche réelle, pas seulement sur des scores publics.
- › gelez un jeu de contrôle interne jamais publié et re-testez-le à chaque nouveau modèle ou version.
- › pour la partie connaissance, privilégiez des questions postérieures à la date de coupure du modèle.
Référence
Preuve C (benchmark/outil) — How Much Do LLM Cheat on Evaluation (ArxivRoll) arxiv.org/abs/2507.19219
un modèle « champion de benchmark » n’est pas forcément bon sur votre cas réel — c’est le phénomène mesuré par la source ci-dessus.