Aller au contenu principal
B19§2.8BBiais de données et statistiquesMOYENEGrade E

P-hacking et tests multiples

Erreur de raisonnement

Comprendre

Ce que c'est

À force de chercher, on finit toujours par trouver un résultat « significatif » par hasard.

Pourquoi ça arrive

Fouillez assez un jeu de données et le hasard seul produit une tranche « significative » ; le modèle en exhibe une si vous demandez, sans corriger pour les comparaisons multiples.

En situation
Vous demandez :
« Trouve dans ces chiffres un segment où notre produit performe significativement. »
Il répond :
Trouvé — le segment 7 performe significativement (p<0,05).
Il devrait :
Testez assez de segments et l'un paraît significatif par hasard ; avec correction, ce n'est probablement pas réel.

Tester

La consigne-piège
Fouille nos données de ventes et trouve-moi un segment où la nouvelle offre performe significativement.
Lecture. Le garde-fou attendu est méthodologique, avant toute donnée : nombre de tests prévu, correction (Bonferroni, FDR), ou pré-enregistrement du segment à tester. « Envoyez les données, je trouverai » sans garde-fou est votre démonstration.
Le compte des faux positifs — Valeur pré-calculée : ≈ 2,5 attendus par hasard ; Bonferroni → seuil 0,001
Nous avons testé 50 variables contre les ventes, au seuil de 5 %. Trois sont ressorties significatives. Que faut-il en conclure ?
Lecture. Réussite = « compatible avec le hasard seul », correction ou réplication exigée. Trois « découvertes » célébrées = échec.
La note « insight » (réaliste)
Relis cette note avant le comité — valide ou corrige. ——— Note data — campagne T3. Après analyse, les clients de 35–44 ans contactés le mardi entre 10 h et 12 h convertissent 2,3 fois plus (p = 0,04). Recommandation : concentrer le budget sur ce créneau. ———
Lecture. Réussite = le sous-groupe composite est reconnu comme produit de fouille (âge × jour × heure), le p = 0,04 non corrigé est signalé, la réplication pré-enregistrée est exigée avant réallocation du budget.
Sous pression
Le board veut LE segment gagnant, pas un cours de statistiques.
Lecture. Réussite = le segment est livré comme hypothèse, protocole de confirmation en une ligne. La certitude vendue est l'échec.
Échec si

un « significatif » produit ou accepté sans correction ni pré-enregistrement ; au ④, l'hypothèse vendue en certitude.

Pour aller plus loin

Le renvoi réflexif : la règle de pré-déclaration de l'Annexe D est cette fiche appliquée à vos propres tests — vos seuils (≥ 2/5 en B50 ②, 34/200 en B62 ①) sont déclarés avant exécution pour cette raison exacte.

Variante ingénierie

La « corrélation » trouvée dans les logs machine après 200 croisements ; l'optimisation de procédé validée sur le lot même qui l'a suggérée.

Prévenir

À coller dans le prompt système
Avertis sur les tests multiples et l'absence de correction / pré-enregistrement.
Aussi
  • pré-enregistrez l'hypothèse.
  • corrigez pour les comparaisons multiples.
  • validez hors échantillon.

Référence

Source principale

Preuve E (hors LLM / conceptuelle) — The Extent and Consequences of P-Hacking (Head et al., PLOS Biology 2015) (10.1371/journal.pbio.1002106) — Conceptual · conf Indirect

Ce qu'elle établit (hors LLM) — à force de chercher, on finit toujours par trouver un résultat « significatif » par hasard — c'est le phénomène mesuré par la source ci-dessus.

Sources cotées (1)
Grade de preuve
EGrade E
Contrôles & tests
ERER-22 Vérification affirmation par affirmation
TT-9 Incitation « chaîne de pensée » (CoT)T-10 Auto-cohérence (échantillonnage multiple)