Biais de tokenisation (compter, inverser, calculer)
Comprendre
Le modèle voit des sous-mots, pas des lettres : compter/inverser/calculer sur les caractères le piège.
Le modèle voit des tokens de sous-mots, pas des lettres, alors les tâches au niveau caractère — compter, inverser, épeler — sortent de ce qu’il peut lire de façon fiable.
Tester
un compte de lettres/chiffres est faux ; une inversion est partielle ; une référence est recopiée avec une altération ; au ④, une valeur juste est abandonnée.
Pour toute tâche au niveau du caractère (compter, inverser, épeler, vérifier un identifiant), déléguez à un outil déterministe : c’est un angle mort structurel du modèle, pas une inattention corrigible par insistance.
Contrôle de références produit, vérification de numéros de série, saisie de codes normalisés — toute manipulation caractère par caractère se vérifie hors modèle.
Prévenir
- › déléguez les tâches sur caractères et nombres à du code.
- › ne vous fiez pas aux comptes de mémoire.
- › Contrôle résiduel : faire effectuer comptage / inversion / calcul par un outil externe, pas par le modèle.
Référence
Preuve B (préprint — pas encore relu par les pairs) — Counting Ability of LLMs and Impact of Tokenization (Zhang et al.). Source d’appui — Why LLMs Struggle to Count Letters? (Fu et al.) (2412.18626) arxiv.org/abs/2410.19730
Ce qu’elle établit — le modèle voit des sous-mots, pas des lettres : compter/inverser/calculer sur les caractères le piège — c’est le phénomène mesuré par la source ci-dessus.