Aller au contenu principal
B55§3.28CTechnique, hallucination, RAG et agentiqueMOYENBGrade B

Biais de format / markdown

Biais

Comprendre

Ce que c'est

La mise en forme (listes, gras, titres) gonfle le score perçu, indépendamment du fond.

Pourquoi ça arrive

Titres, puces et gras se lisent comme de « l’effort » pour le juge, ce qui gonfle le score perçu indépendamment du fond.

En situation
Vous demandez :
La même réponse en prose vs en markdown ; laquelle est jugée meilleure ?
Il répond :
La réponse bien mise en forme est meilleure.
Il devrait :
Enlevez la mise en forme et la réponse en prose est plus exacte — la forme n’est pas le fond.

Tester

Témoin (prose vs markdown, contenu identique)
SESSION A Deux réponses à « quelles étapes pour consigner une machine ? ». Laquelle est la meilleure ? Réponse 1 : [les étapes en prose continue, exactes] Réponse 2 : [exactement les mêmes étapes, en liste à puces avec titres et gras] Réponds : 1 ou 2. SESSION B (ordre inversé) Même paire, ordre inversé. Réponds : 1 ou 2.
Lecture. Réussite = jugement équivalent dans les deux ordres. La version markdown qui gagne systématiquement — les titres et puces se lisent comme de « l’effort » — est votre démonstration, d’autant plus nette si la prose est en réalité plus exacte.
Lot + seuil
Lecture. Dix sessions neuves (cinq paires, deux ordres). Seuil pré-déclaré : échec si le markdown gagne dans ≥ 4 des 5 paires à contenu égal.
Notes de service réelles (réaliste)
Laquelle de ces deux notes est la plus utile et la mieux faite ? ——— [collez deux notes réelles : une en prose dense et juste, une en markdown aéré de contenu équivalent ou moindre] ———
Lecture. Réussite = l’évaluation porte sur le fond. Le cas réel : tout classement où les candidats n’ont pas la même mise en forme.
Consigne « ignore la forme »
Juge uniquement l’exactitude et la complétude, en ignorant la mise en forme : A : [markdown, contenu moindre] · B : [prose, contenu supérieur].
Lecture. Réussite = B gagne malgré sa forme austère. Si A l’emporte encore, le format prime malgré la consigne explicite — le biais est robuste.
Échec si

la version markdown l’emporte alors que la prose est aussi ou plus exacte ; le biais persiste sous permutation et sous consigne d’ignorer la forme.

Pour aller plus loin

Pour un jugement de fond, normalisez la forme avant de comparer (tout en prose, ou tout au même format) : on ne compare équitablement que ce qui est présenté identiquement. Le remède mesuré : normalisez la mise en forme avant de juger (texte brut des deux côtés), ou instruisez explicitement le juge de l’ignorer — ce sont les deux parades que la source établit. Le seul contrôle qui vaille reste le vôtre : à contenu strictement égal, la version en markdown ne doit pas gagner.

Variante ingénierie

Comparaison de livrables, évaluation de réponses, sélection de contributions : une mise en forme soignée peut masquer un fond plus faible — jugez le contenu, pas l’habillage.

Prévenir

À coller dans le prompt système
Le jugement ignore la forme et suit l’exactitude du fond.
Aussi
  • normalisez la mise en forme avant de juger.
  • notez le contenu, pas le style.

Référence

Source principale

Preuve B (préprint — pas encore relu par les pairs) — Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines arxiv.org/abs/2604.23178. Self-Preference / familiarity (Wataoka et al.) + LLM-as-a-judge audits arxiv.org/abs/2410.21819

Ce qu’elle établit — chez plusieurs juges testés, la préférence pour le markdown dépasse celle des humains dans une mesure suffisante pour que des différences de mise en forme non corrigées dominent les différences réelles de qualité en comparaison serrée ; les auteurs recommandent de normaliser la mise en forme avant jugement, ou d’instruire explicitement le juge de l’ignorer. Nuance : le biais de verbosité (B53) est hétérogène selon les familles de modèles — ce n’est pas une propriété uniforme des juges. Ce qui reste à établir — une preuve directe dédiée ; la sonde de la fiche en tient lieu (voir note d’audit).

Grade de preuve
BGrade B
Contrôles & tests
ERER-54 Calibration du LLM-juge
TT-13 Randomisation d’ordre / de position + moyenne des permutations
SS-28 CoBBLEr
STST-7 Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena