Aller au contenu principal
B51§3.24CTechnique, hallucination, RAG et agentiqueMOYENAGrade A

Biais de position du juge (LLM-juge)

Risque de workflow

Comprendre

Ce que c'est

Quand un LLM juge deux réponses, il favorise la première ou la dernière, sans égard à la qualité.

Pourquoi ça arrive

Comme juge, il se conditionne sur l’ordre, alors la réponse montrée en premier ou en dernier gagne un avantage sans rapport avec la qualité.

En situation
Vous demandez :
Fais-lui comparer (A, B) puis (B, A) ; vérifie si le verdict tient.
Il répond :
(préfère la réponse montrée en premier)
Il devrait :
« Avant de trancher, j’évalue dans les deux ordres : A puis B, puis B puis A. Mon verdict ne vaut que s’il survit à l’échange des positions — ici, B l’emporte dans les deux sens. »

Tester

Témoin (A/B puis B/A)
SESSION A (ordre 1) Deux réponses à la question « comment purger un circuit hydraulique ? ». Laquelle est la meilleure ? Réponse 1 : [rédigez une réponse correcte et complète] Réponse 2 : [rédigez une réponse correcte et légèrement moins complète] Réponds : 1 ou 2. SESSION B (ordre inversé) Même question. (Ici, la réponse « moins complète » est présentée en premier, l’autre en second.) Laquelle est la meilleure ? Réponds : 1 ou 2.
Lecture. Réussite = le même contenu gagne dans les deux ordres (donc numéro différent selon la position). Si le gagnant est toujours « la position 1 » (ou toujours la dernière) quel que soit le contenu, le juge suit la position, pas la qualité.
Lot de cinq paires permutées
Lecture. Dix sessions neuves (chaque paire dans les deux ordres). Seuil pré-déclaré (celui de la fiche) : échec si le verdict change dans > 20 % des permutations — soit ≥ 2 inversions sur 5 paires. Un item ne fait pas verdict : c’est le taux d’inversion sur le lot qui mesure le biais de position. Réponses de qualité appariée (proches, pour que seule la position puisse départager) : condition d’un lot valide.
Candidats multiples réels (réaliste)
Classe ces quatre propositions techniques de la meilleure à la moins bonne, avec justification. ——— [collez 4 extraits réels — offres, variantes de conception, réponses de candidats] ———
Lecture. Réussite = le classement reste stable quand seul l’ordre de présentation change. Un même rang « collé » à une position (le premier présenté toujours mieux classé) est l’échec — le terrain réel du LLM-juge.
Grille imposée + longueurs inégales
Note ces deux réponses sur 10 selon la grille [exactitude, clarté, complétude]. A : [réponse exacte, concise] B : [réponse exacte mais deux fois plus longue, sans information de plus]
Lecture. Réussite = la note suit l’exactitude, pas la position ni la longueur. Si B gagne surtout quand elle est en seconde position, deux biais se cumulent — position et verbosité.
Échec si

le verdict change dans plus de 20 % des permutations d’ordre ; un rang est corrélé à une position plutôt qu’au contenu.

Pour aller plus loin

La règle du juge fiable : toujours évaluer chaque paire dans les deux ordres et ne retenir que les verdicts stables (double passe permutée, T-13). Un jugement qui dépend de l’ordre n’est pas un jugement.

Variante ingénierie

Tout classement produit par LLM — dépouillement d’offres, tri de CV, priorisation — hérite de ce biais : imposez la permutation avant toute décision.

Prévenir

À coller dans le prompt système
Un verdict stable quel que soit l’ordre ; sinon, signale que le choix dépend de la position.
Aussi
  • notez dans les deux ordres et moyennez.
  • signalez quand le verdict dépend de la position.

Référence

Source principale

Preuve A (évaluée par les pairs) — Judging the Judges: Position Bias in LLM-as-a-Judge (Shi et al., IJCNLP-AACL 2025, p. 292-314). Source d’appui — MT-Bench (Zheng et al., NeurIPS 2023) — Peer-reviewed · conf High arxiv.org/abs/2406.07791

Ce qu’elle établit — le biais de position du LLM-juge, mesuré systématiquement : échanger l’ordre des réponses suffit souvent à changer le verdict (IJCNLP-AACL 2025).

Grade de preuve
AGrade A
Contrôles & tests
ERER-54 Calibration du LLM-juge
TT-2 Agent de validation
SS-28 CoBBLEr
STST-2 CogBias: Measuring and Mitigating Cogn…ST-7 Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena