Aller au contenu principal
B62§2.10BBiais de données et statistiquesFAIBLEAGrade A

Biais de Benford (petits chiffres)

Biais

Comprendre

Ce que c'est

Quand il produit des nombres, le modèle sur-représente les petits premiers chiffres (loi de Benford).

Pourquoi ça arrive

Sommé de produire des nombres « au hasard », le modèle reproduit les motifs de chiffres de ses textes d'entraînement, où les petits premiers chiffres dominent (loi de Benford) — pas un tirage uniforme.

En situation
Vous demandez :
« Donne 50 entiers aléatoires entre 100 et 999 » ; trace le premier chiffre.
Il répond :
(50 nombres dont le premier chiffre est « 1 » environ 30 % du temps)
Il devrait :
Je ne devrais pas simuler le hasard — voici un court script qui tire des nombres vraiment uniformes.

Tester

Tirage unique, seuil pré-déclaré
Génère 200 nombres aléatoires entre 1 et 999, en liste brute.
Lecture. Échec si le chiffre « 1 » en tête atteint 34/200 (17 % ; attendu ≈ 22 ; probabilité < 1 % sous l'uniforme). Si votre interface exécute du code pour répondre, vous mesurez l'outil, pas le modèle : consignez-le et repassez en génération directe (demandez « sans exécuter de code »).
Trois tirages
Génère 200 nombres aléatoires entre 1 et 999, en liste brute.
Lecture. Trois sessions neuves, même encadré qu'au ①. Échec si le seuil est franchi sur au moins 2 tirages sur 3 — aucun verdict sur tirage unique au-delà du ①.
Le biais caché dans la tâche (réaliste)
Génère 50 lignes de données de test réalistes pour ce tableau : colonne « montant » entre 1 et 999 TND, colonne « référence » libre.
Lecture. Échec si « 1 » ≥ 11/50 (attendu ≈ 6), ou si des séries répétitives apparaissent (croise B49/B69). C'est le terrain réel : les jeux d'essai de recette.
La consigne anti-biais
Génère 200 nombres vraiment uniformes entre 1 et 999 — évite tout biais du premier chiffre. Liste brute.
Lecture. Échec si le biais persiste malgré la consigne explicite — il n'est alors pas corrigeable par prompt sur votre modèle. Réussite = consignez le moyen : vrai correctif de génération, ou bascule vers un appel d'outil.
Échec si

les seuils pré-déclarés du palier sont franchis ; un verdict est prononcé sur un tirage unique hors ①.

Pour aller plus loin

Retournez l'instrument : des données réelles de type factures ou populations devraient, elles, suivre Benford — le même comptage devient un détecteur de données synthétiques ou manipulées glissées dans un jeu « réel ».

Variante ingénierie

Jeux d'essai injectés en base de recette : le biais des petits chiffres fausse vos tests de tri, d'agrégats et de seuils d'alerte — comptez avant de charger.

Prévenir

À coller dans le prompt système
Pour toute liste de nombres censée être neutre ou uniforme (identifiants, échantillons, tirages) : génère-la par code exécuté (random / secrets) et rends la sortie du code — jamais des nombres « de tête » ; si des valeurs viennent de toi, dis-le explicitement.
Aussi
  • générez l'aléa par code, pas par le modèle.
  • vérifiez la distribution des chiffres.

Référence

Source principale

Preuve A (évaluée par les pairs) — Benford's Curse: Tracing Digit Bias to Numerical Hallucination (Shao et al., NeurIPS 2025) — Peer-reviewed · conf High arxiv.org/abs/2506.01734

Ce qu'elle établit — les modèles surgénèrent les petits chiffres — le « 1 » domine (~30 % au lieu de ~11 %) sur des tâches où la vérité est uniforme (NeurIPS 2025).

Grade de preuve
AGrade A
Contrôles & tests
ERER-25 Délégation à un outil (arithmétique, tâches sensibles à la tokenisation)
TT-14 Délégation à un outil (calcul & aléa)