Biais de sélection et d'échantillonnage
Comprendre
Le modèle est plus faible et invente davantage sur les sujets de niche ou les langues peu dotées.
Les données sont inégales : les sujets de niche et les langues peu dotées sont rares, alors le modèle a moins de matière et comble les vides avec le cadre dominant (souvent américain).
Tester
un cadre dominant plaqué sur un contexte de niche sans signalement ; une assurance identique quelle que soit la couverture ; au ④, du spécifique local inventé.
La sonde de couverture, avant la question : « Sur la certification des compteurs pétroliers en Afrique de l'Ouest précisément, cite tes trois sources les plus solides. » Chaque source se résout (B21 : le DOI ou le texte doit correspondre au titre) — une bibliographie qui ne résout pas signe la zone creuse.
Le réflexe « NF C 15-100 » : la norme du pays dominant de vos données plaquée par défaut sur une installation qui relève d'un autre référentiel — vérifiez l'applicabilité avant le contenu.
Prévenir
- › indiquez la juridiction.
- › demandez ce dont le modèle n'est pas sûr.
- › vérifiez à la source les sujets de niche.
Référence
Preuve A (évaluée par les pairs) — Large Language Models Struggle to Learn Long-Tail Knowledge (Kandpal et al., ICML 2023, PMLR 202, p. 15696-15707) — voir aussi 4.10 pour le volet langues proceedings.mlr.press/v202/kandpal23a
Ce qu'elle établit — la connaissance de longue traîne échappe aux modèles : la capacité à répondre suit le nombre de documents vus au pré-entraînement (ICML 2023).