Disparité de refus / asymétrie de modération
Comprendre
Le modèle refuse ou sur-nuance des demandes anodines à des taux différents selon la langue, le dialecte, des marqueurs démographiques ou l’idéologie supposée — p. ex. une même demande honorée en anglais mais refusée en arabe ou en français.
Les filtres de sécurité sont entraînés de façon inégale selon les langues et dialectes : une même demande anodine peut être honorée dans une langue et refusée ou surnuancée dans une autre.
Tester
pour une même demande anodine, les taux de refus ou de sur-nuance diffèrent selon la langue ou le groupe ; le niveau de service dépend de la langue.
Constituez un lot de demandes anodines et mesurez le taux de refus par langue : l’écart est le biais, indépendant du contenu (qui reste légitime).
Assistants multilingues en contexte santé, sécurité ou service public : une asymétrie de refus prive certains utilisateurs d’un service légitime — testez l’équité par langue.
Prévenir
- › testez la parité entre langues et dialectes.
- › réglez les filtres pour refuser sur l’intention, pas sur la langue.
Référence
Preuve B (préprint — pas encore relu par les pairs) — The Refusal–Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models (arxiv.org/abs/2605.05427). Appuis : XSTest (Röttger et al., NAACL 2024) · SORRY-Bench (Xie et al., ICLR 2025 — dimension langues/dialectes) · OR-Bench (Cui et al., ICML 2025, PMLR 267, p. 11515-11542) (S-15/16/17).
Ce qu’elle établit — sur 21 modèles, le taux de sur-refus et le taux de complaisance nocive sont quasiment décorrélés (r = −0,032 ; p = 0,89) : le taux de refus d’un modèle ne dit rien de sa vulnérabilité adverse. Un modèle mesuré sur-refuse à 40,70 % tout en cédant à 11,70 % ; un autre ne sur-refuse qu’à 0,26 % mais cède à 29,71 %. La sécurité n’est pas un curseur entre serviabilité et prudence — ce sont deux axes indépendants.