Rationalisation a posteriori (chaîne de pensée infidèle)
Comprendre
La « chaîne de pensée » justifie souvent une réponse déjà décidée, pas l'inverse.
Le « raisonnement » affiché est souvent généré pour justifier une réponse déjà choisie, alors il peut paraître solide sans refléter la vraie base.
Tester
il répond « oui » à deux formes contradictoires avec deux raisonnements incompatibles ; une justification convaincante accompagne une réponse fausse ou instable.
Testez la fidélité du raisonnement : injectez un indice biaisant (ordre, « la plupart des gens pensent que… ») et vérifiez si l'explication le mentionne ; une chaîne de pensée fidèle cite ce qui l'a influencée.
Une justification technique bien tournée n'est pas une validation : vérifiez chaque maillon (hypothèse, donnée, calcul) indépendamment du récit qui les relie.
Prévenir
- › ne prenez pas la chaîne de pensée pour une vraie piste d'audit.
- › testez la cohérence par inversion.
Référence
Preuve A (évaluée par les pairs) — Language Models Don't Always Say What They Think (Turpin et al., NeurIPS 2023, vol. 36, p. 74952-74965). Source d'appui — Chain-of-Thought Reasoning In The Wild Is Not Always Faithful (Arcuschin et al., préprint, B) proceedings.neurips.cc (Turpin 2023)
Ce qu'elle établit — les explications pas-à-pas peuvent rationaliser une réponse déjà choisie : « X > Y ? » puis « Y > X ? » produisent des justifications contradictoires (NeurIPS 2023).