Taxe de tokenisation multilingue
Comprendre
Les langues peu dotées coûtent plus de tokens et obtiennent des réponses moins fiables.
Les langues peu dotées se fragmentent en plus de tokens et disposent de moins de données ; les réponses coûtent plus cher et sont moins fiables.
Tester
la réponse est dégradée et bien plus longue en tokens dans la langue la moins dotée ; l’écart persiste sur vos gabarits réels ; la contrainte de budget pénalise davantage la langue peu dotée.
Mesurez le coût réel en tokens par langue (Mode B) : il conditionne le prix et la latence de vos usages multilingues, et il est rarement pris en compte dans les devis.
Chatbots multilingues, traitement de documents en arabe ou en darija : le surcoût de tokens et la baisse de qualité sont structurels — dimensionnez et testez par langue.
Prévenir
- › vérifiez la qualité dans la langue cible.
- › ne supposez pas la parité avec l’anglais.
Référence
Preuve B (préprint — pas encore relu par les pairs) — The Token Tax: Systematic Bias in Multilingual Tokenization (Lundin et al., AfricaNLP 2026, p. 103-112). arxiv.org/abs/2509.05486
Ce qu’elle établit — la « fertilité » de tokenisation prédit la précision sur 16 langues africaines ; coût multiplié par quatre quand les tokens doublent (AfricaNLP 2026).