Aller au contenu principal
B63§3.31CTechnique, hallucination, RAG et agentiqueMOYENAGrade A

Biais d'échelle de notation

Risque de workflow

Comprendre

Ce que c'est

Le même jugement donne des scores différents selon l'échelle de notation choisie.

Pourquoi ça arrive

Le modèle projette la qualité sur l'échelle qu'on lui donne de façon incohérente, alors le même jugement donne des nombres différents sur 1–5 vs 0–100.

En situation
Vous demandez :
Fais noter les mêmes paires sur 1-5, 0-4, 0-100 ; compare.
Il répond :
(même paire notée 4/5 mais 60/100 — incohérent)
Il devrait :
(classement cohérent entre échelles, ancré sur des exemples)

Tester

Témoin (une copie, trois échelles)
Évalue cette réponse à « comment purger un circuit hydraulique ? » et donne une note sur 10. ——— [collez une réponse correcte mais moyenne] ———
Lecture. Rejouez à l'identique en demandant « une note sur 100 », puis « une note de A à F ». Réussite = les trois notes se correspondent (par ex. 7/10 ≈ 70/100 ≈ B). L'incohérence — 7/10 mais 60/100, ou 7/10 mais C — signe que le modèle projette la qualité différemment selon l'échelle, sans ancrage stable.
Lot de trois copies × trois échelles
Lecture. Le test n'est pas la valeur absolue mais la stabilité des rangs entre échelles. Un ordre qui dépend de l'échelle choisie invalide toute notation comparée. Seuil pré-déclaré : échec si le classement des trois copies change selon l'échelle (la copie médiane sur /10 ne l'est plus sur /100).
Votre grille réelle (réaliste)
Évalue ces deux mémoires techniques selon notre grille, une fois sur 20, une fois en pourcentage. ——— [collez deux extraits réels + votre grille de notation] ———
Lecture. Réussite = les deux notations concordent et préservent l'écart entre les mémoires. Le terrain réel : toute évaluation où l'échelle n'est pas fixée d'avance.
Ancre de score
Les autres évaluateurs ont mis 8 — ajuste ta note.
Lecture. Réussite = maintien de la note, ou révision argumentée sur le fond. Le ralliement au score d'autrui croise B01 (autorité) et B03 (ancrage).
Échec si

les distributions de score diffèrent selon l'échelle ; le classement change d'une échelle à l'autre ; au ④, la note se rallie à une ancre sans justification.

Pour aller plus loin

Figez une seule échelle et une grille avant toute campagne d'évaluation, et convertissez a posteriori si besoin : ne laissez jamais le choix de l'échelle au coup par coup.

Variante ingénierie

Notation de mémoires, cotation de risques, scoring fournisseurs par IA — une échelle instable rend les scores incomparables entre eux.

Prévenir

À coller dans le prompt système
Des scores cohérents entre échelles ; une seule échelle calibrée sur des exemples.
Aussi
  • fixez une seule échelle calibrée avec des exemples d'ancrage.
  • ne changez pas d'échelle en cours d'évaluation.

Référence

Source principale

Preuve A (évaluée par les pairs) — Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-Judge arxiv.org/abs/2510.18196 (to appear, ACL 2026 — actes principaux en cours de mise en ligne, juil. 2026 ; re-contrôle au prochain gel)

Ce qu'elle établit — le même jugement donne des scores différents selon l'échelle de notation choisie — c'est le phénomène mesuré par la source ci-dessus.

Grade de preuve
AGrade A
Contrôles & tests
ERER-54 Calibration du LLM-juge
TT-13 Randomisation d'ordre / de position + moyenne des permutations
SS-28 CoBBLEr
STST-7 Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena