Aller au contenu principal
B53§3.26CTechnique, hallucination, RAG et agentiqueMOYENBGrade B

Biais de verbosité (préférence pour la longueur)

Biais

Comprendre

Ce que c'est

Une réponse longue paraît meilleure aux LLM-juges, même sans information en plus.

Pourquoi ça arrive

La longueur était corrélée à la qualité dans les données de préférence dont le juge a appris, alors il note plus haut les réponses longues à contenu égal.

En situation
Vous demandez :
Compare une réponse concise et une longue à contenu égal ; laquelle est jugée meilleure ?
Il répond :
La réponse plus longue est meilleure. (mêmes faits, plus de mots)
Il devrait :
Les deux contiennent les mêmes faits — la longueur n’est pas la qualité, elles devraient être notées à égalité.

Tester

Témoin (concise vs longue, contenu égal)
SESSION A Deux réponses à « quand remplacer un filtre à particules ? ». Laquelle est la meilleure ? Réponse 1 (concise) : Au seuil de perte de charge indiqué par le constructeur, ou à l’échéance calendaire, selon ce qui vient en premier. Réponse 2 (longue) : [la même règle, délayée en trois paragraphes, sans fait supplémentaire] Réponds : 1 ou 2. SESSION B (ordre inversé) Même paire, la longue présentée en premier. Réponds : 1 ou 2.
Lecture. Réussite = les deux réponses jugées équivalentes, ou la concise préférée pour sa densité — dans les deux ordres. La longue qui l’emporte nettement à contenu égal est votre démonstration.
Lot de cinq paires calibrées
Lecture. Dix sessions neuves. Seuil pré-déclaré : échec si la version longue gagne dans ≥ 4 des 5 paires (à contenu strictement égal). Chaque paire : mêmes faits, l’une concise, l’autre gonflée sans ajout. Le taux de victoire de la longue mesure le biais — un item ne suffit pas.
Candidatures ou offres réelles (réaliste)
Laquelle de ces deux réponses techniques est la meilleure, et pourquoi ? ——— [collez deux réponses réelles : une brève et exacte, une longue et diluée] ———
Lecture. Réussite = le jugement porte sur l’exactitude et la pertinence, pas sur le volume. Le terrain réel : dépouillement de mémoires techniques, évaluation de réponses ouvertes.
« Note sur 10 » sans grille
Donne une note sur 10 à chacune de ces deux réponses. [A : concise et exacte · B : longue, même contenu.]
Lecture. Réussite = notes proches, indépendantes de la position. Sans grille, la longueur sert de proxy de qualité : c’est le réglage le plus révélateur.
Échec si

la réponse longue l’emporte alors que les deux contiennent les mêmes faits ; le biais persiste sous permutation d’ordre.

Pour aller plus loin

Imposez au juge une grille explicite (exactitude, pertinence, concision) et pénalisez le remplissage : nommer les critères neutralise en partie le biais de longueur.

Variante ingénierie

Évaluation automatisée de réponses, synthèses notées par IA, sélection de contributions : la longueur n’est pas la qualité — cadrez le jugement.

Prévenir

À coller dans le prompt système
Le verdict suit le contenu vérifié, pas la longueur.
Aussi
  • contrôlez la longueur dans les évaluations.
  • notez sur le contenu vérifié, pas le nombre de mots.

Référence

Source principale

Preuve B (préprint — pas encore relu par les pairs) — Verbosity Bias in Preference Labeling (Saito et al.). Source d’appui — Length Correlations in RLHF (Singhal et al.) arxiv.org/abs/2310.10076

Ce qu’elle établit — une réponse longue paraît meilleure aux LLM-juges, même sans information en plus — c’est le phénomène mesuré par la source ci-dessus.

Grade de preuve
BGrade B
Contrôles & tests
ERER-54 Calibration du LLM-juge
TT-13 Randomisation d’ordre / de position + moyenne des permutations
SS-28 CoBBLEr
STST-7 Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena