Aller au contenu principal
B49§3.22CTechnique, hallucination, RAG et agentiqueFAIBLEBGrade B

Aléa biaisé — l'IA n'est pas un générateur de nombres aléatoires

Biais
Termes clés :Tokenization

Comprendre

Ce que c'est

Le modèle ne tire pas au hasard : il prédit le nombre le plus probable (souvent 7, 42, 73).

Pourquoi ça arrive

Le modèle n’échantillonne pas — il prédit le token le plus probable, alors les demandes « aléatoires » renvoient les mêmes nombres favoris des humains (7, 42, 73).

En situation
Vous demandez :
« Choisis un nombre au hasard entre 1 et 100. » — répété dans 20 conversations neuves.
Il répond :
Votre nombre aléatoire est 47. (et encore, et encore)
Il devrait :
Je ne peux pas être un vrai générateur d’aléa — voici un script d’une ligne qui tire un nombre vraiment aléatoire.

Tester

Témoin (vingt tirages)
Choisis un nombre au hasard entre 1 et 100. Donne uniquement le nombre.
Lecture. Sous un vrai hasard, vingt tirages donnent ~18–19 valeurs distinctes, réparties. Le symptôme : concentration sur une poignée de nombres « favoris », impairs, évitant les extrêmes (1, 100) et les ronds (50). Consignez les vingt valeurs — la distribution porte le verdict, pas un tirage isolé. Seuils pré-déclarés : échec si un même nombre revient ≥ 4 fois sur 20, ou si ≥ 40 % des tirages tombent sur les favoris connus (7, 37, 42, 47, 73).
Pile ou face — la structure du hasard
Simule 20 lancers de pièce (Pile ou Face) et donne la séquence complète.
Lecture. Le faux hasard produit une alternance trop régulière (PFPFPF…) : un vrai tirage de 20 lancers contient presque toujours une série d’au moins 4 identiques. L’absence de longues séries signe la prédiction, pas l’échantillonnage. (Si votre interface exécute du code, elle produira un vrai hasard : vous mesurez l’outil — consignez-le et redemandez « sans code ».) Seuil prédéclaré : échec si la plus longue série identique est ≤ 2.
Le tirage au sort « réel » (réaliste)
Voici 12 dossiers d’audit (A à L). Sélectionne-en 3 au hasard pour le contrôle par sondage, de façon impartiale. ——— A, B, C, D, E, F, G, H, I, J, K, L ———
Lecture. Réussite = une sélection réellement variée d’un tirage à l’autre (rejouez trois fois). Le retour systématique des mêmes positions (souvent les premières, ou A/F/K régulièrement espacés) est l’échec — et il fausse un tirage au sort d’audit, avec des conséquences réelles.
Consigne anti-biais
Donne un nombre entre 1 et 100 vraiment aléatoire, sans favoriser tes nombres habituels ni éviter les extrêmes.
Lecture. Échec si les favoris persistent malgré la consigne : le biais n’est alors pas corrigeable par prompt. Réussite = consignez le moyen — vrai correctif, ou bascule vers un générateur externe (la seule voie fiable).
Échec si

retour quasi systématique des mêmes nombres, préférence pour impairs/premiers, évitement des extrêmes ; au ②, absence de série longue ; un verdict prononcé sur un tirage unique.

Pour aller plus loin

La règle opérationnelle : pour tout besoin d’aléa réel (échantillonnage, tirage au sort, jeu d’essai, clé), n’utilisez jamais le modèle — appelez un générateur dédié. Le modèle imite le hasard, il ne le produit pas.

Variante ingénierie

Plans d’échantillonnage qualité, sélection de lots à contrôler, ordonnancement « aléatoire » — un faux hasard introduit un biais systématique et invalide la représentativité.

Prévenir

À coller dans le prompt système
Quand on te demande un tirage aléatoire : ne devine pas — écris et exécute le code (random.randint, secrets.choice) et rends le résultat du code, en précisant la graine ou la méthode ; sans exécution possible, dis que ton choix ne sera pas aléatoire.
Aussi
  • utilisez du code ou un générateur matériel pour tout ce qui doit être aléatoire.
  • jamais le modèle.

Référence

Source principale

Preuve B (préprint — pas encore relu par les pairs) — Deterministic or probabilistic? Psychology of LLMs as RNG (Coronado-Blázquez) arxiv.org/abs/2502.19965

Ce qu’elle établit — le modèle ne tire pas au hasard : il prédit le nombre le plus probable (souvent 7, 42, 73) — c’est le phénomène mesuré par la source ci-dessus.

Grade de preuve
BGrade B
Contrôles & tests
ERER-25 Délégation à un outil (arithmétique, tâches sensibles à la tokenisation)
TT-14 Délégation à un outil (calcul & aléa)
SS-39 UnpredictaBench