Excès de confiance verbalisé (post-RLHF)
Comprendre
Après RLHF, le modèle affiche une grande confiance même quand il a tort.
Le RLHF récompense les réponses assurées et conciliantes, ce qui découple la confiance affichée de l'exactitude réelle.
Tester
une confiance déclarée systématiquement élevée accompagne des réponses fausses ; les pourcentages ne discriminent pas le sûr de l'incertain ; au ④, la confiance est gonflée sur commande.
Construisez un diagramme de calibration minimal : regroupez les réponses par niveau de confiance déclaré et comparez au taux réel de justesse dans chaque groupe — l'écart mesure la surconfiance. Traitez tout « % de confiance » comme un style de langage, pas comme une probabilité.
Un indice de confiance chiffré dans un rendu d'IA n'a de valeur que s'il est calibré : ne fondez aucune décision sur un pourcentage non vérifié empiriquement.
Prévenir
- › calibrez la confiance sur l'exactitude mesurée.
- › autorisez et valorisez « je ne sais pas ».
Référence
Preuve A (évaluée par les pairs) — Taming Overconfidence in LLMs: Reward Calibration in RLHF (Leng et al., ICLR 2025, p. 53744-53777) arxiv.org/abs/2410.09724
Ce qu'elle établit — le RLHF induit une surconfiance verbalisée : les modèles de récompense favorisent les hautes confiances indépendamment de la qualité (ICLR 2025).