P-hacking et tests multiples
Comprendre
À force de chercher, on finit toujours par trouver un résultat « significatif » par hasard.
Fouillez assez un jeu de données et le hasard seul produit une tranche « significative » ; le modèle en exhibe une si vous demandez, sans corriger pour les comparaisons multiples.
Tester
un « significatif » produit ou accepté sans correction ni pré-enregistrement ; au ④, l'hypothèse vendue en certitude.
Le renvoi réflexif : la règle de pré-déclaration de l'Annexe D est cette fiche appliquée à vos propres tests — vos seuils (≥ 2/5 en B50 ②, 34/200 en B62 ①) sont déclarés avant exécution pour cette raison exacte.
La « corrélation » trouvée dans les logs machine après 200 croisements ; l'optimisation de procédé validée sur le lot même qui l'a suggérée.
Prévenir
- › pré-enregistrez l'hypothèse.
- › corrigez pour les comparaisons multiples.
- › validez hors échantillon.
Référence
Preuve E (hors LLM / conceptuelle) — The Extent and Consequences of P-Hacking (Head et al., PLOS Biology 2015) (10.1371/journal.pbio.1002106) — Conceptual · conf Indirect
Ce qu'elle établit (hors LLM) — à force de chercher, on finit toujours par trouver un résultat « significatif » par hasard — c'est le phénomène mesuré par la source ci-dessus.