Biais d'ordre des options (choix multiple)
Comprendre
Le modèle préfère certaines positions de réponse (souvent A ou la dernière).
La position de la réponse porte un a priori de fréquence issu de l’entraînement, alors le modèle peut favoriser une place (souvent A ou la dernière) plutôt que le contenu.
Tester
la réponse ou le verdict change quand seuls l’ordre, la longueur ou la mise en forme changent, au-delà du seuil pré-déclaré du palier.
Demandez-lui pourquoi il a changé : la justification produite après coup paraîtra cohérente dans les deux sens — ne la prenez jamais pour une preuve de robustesse.
Tout classement produit par LLM — offres fournisseurs, CV, non-conformités priorisées — hérite de ce biais : imposez la double passe permutée (T-13) avant toute décision.
Prévenir
- › randomisez l’ordre des options.
- › vérifiez la stabilité sous permutation.
Référence
Preuve A (évaluée par les pairs) — LLMs Are Not Robust Multiple Choice Selectors (Zheng et al., ICLR 2024). Source d’appui — Pezeshkpour & Hruschka (NAACL Findings 2024) — Peer-reviewed · conf High (Zheng et al., ICLR 2024 Spotlight) arxiv.org/abs/2309.03882
Ce qu’elle établit — le modèle préfère certaines positions de réponse (souvent A ou la dernière) — c’est le phénomène mesuré par la source ci-dessus.