Aller au contenu principal
B83§3.41CTechnique, hallucination, RAG et agentiqueÉLEVÉAGrade A

Monoculture algorithmique — les modèles se trompent ensemble

Fiabilité de l'évaluation

Comprendre

Ce que c'est

Deux modèles différents ne sont pas deux avis indépendants : leurs erreurs sont corrélées — quand l'un se trompe, l'autre se trompe souvent de la même façon.

Pourquoi ça arrive

Architectures voisines, données d'entraînement qui se recouvrent, mêmes méthodes d'alignement. Et le résultat contre-intuitif : ce sont les modèles les plus grands et les plus précis qui ont les erreurs les plus corrélées — y compris entre fournisseurs distincts.

En situation
Vous demandez :
Je vais faire valider ma réponse par un second modèle, d'un autre fournisseur.
Il répond :
(le second confirme le premier — vous concluez que la réponse est bonne)
Il devrait :
(la confirmation ne vaut presque rien : dix agents d'un même modèle valent ≈ 1,4 juge indépendant ; en croisant les familles, ≈ 2,2 — jamais dix)

Tester

Témoin (trois modèles, une question difficile)
[posez une question technique difficile de votre domaine, dont vous détenez la bonne réponse — de préférence sur un sujet peu documenté]
Lecture. Sessions neuves, trois familles différentes, sur une question dont vous connaissez la réponse. Réussite = si erreurs il y a, elles sont différentes. Le symptôme : les trois se trompent de la même façon — vous n'avez pas trois avis, mais un seul, répété trois fois.
Le lot à vérité terrain
Lecture. Vingt questions dont vous détenez la réponse ; comptez les items où tous se trompent. Réussite = les échecs se répartissent. S'ils coïncident, votre « second avis » est un écho : la source mesure 60 % d'accord entre deux modèles quand tous deux se trompent.
Votre jury réel
Lecture. Si vous employez un jury pour arbitrer (B51, B54, B75, Annexe D), mesurez la part d'unanimité dans l'erreur. Réussite = un désaccord réel existe. Une unanimité systématique n'est pas une convergence vers le vrai — c'est une monoculture.
La décision en cascade
Lecture. Si plusieurs services trient les mêmes dossiers (CV, fournisseurs) avec des modèles voisins, un dossier rejeté par l'un le sera par tous : c'est l'exclusion systémique — écarté non par un jugement, mais par une corrélation. Réussite = critères explicites et arbitre humain.
Échec si

un second modèle est employé comme validation indépendante ; la convergence d'un jury est prise pour une preuve ; aucune mesure de corrélation des erreurs n'a été faite avant de s'y fier.

Pour aller plus loin

Croisez les lignées de modèles : le gain est réel mais modeste (l'indépendance effective passe d'environ 1,4 à 2,2 pour dix agents — pas à dix). Et gardez un contrôle humain sur les décisions irréversibles : aucun empilement de modèles ne le remplace.

Prévenir

À coller dans le prompt système
Quand je te demande de vérifier une réponse produite par un autre modèle, ne cherche pas à la confirmer : cherche activement ce qui pourrait être faux, et dis-le. Si tu es d'accord, précise ce que tu as réellement vérifié et ce que tu n'as pas pu vérifier.
Aussi
  • croiser les familles de modèles (pas seulement les fournisseurs).
  • mesurer la corrélation des erreurs sur un lot à vérité terrain avant de fonder une décision sur un jury.
  • traiter le désaccord comme le signal utile, l'unanimité comme une alerte.
  • Contrôle résiduel : toute décision irréversible affectant une personne garde un arbitre humain.

Référence

Source principale

Preuve A (évaluée par les pairs) — Correlated Errors in Large Language Models (Kim, Garg, Peng & Garg, ICML 2025) arxiv.org/abs/2506.07962

Ce qu'elle établit — sur plus de 350 modèles, les erreurs sont fortement corrélées : sur un jeu de données, deux modèles donnent la même réponse 60 % du temps lorsqu'ils se trompent tous les deux. Les facteurs sont les architectures et les fournisseurs partagés — mais, de façon contre-intuitive, les modèles les plus grands et les plus précis présentent les erreurs les plus corrélées, y compris entre fournisseurs distincts. L'article mesure l'effet sur deux tâches : l'évaluation par juge LLM et le tri de candidatures (monoculture algorithmique et exclusion systémique).

Grade de preuve
AGrade A
Contrôles & tests
ERER-54 Calibration du LLM-jugeER-30 Escalade / revue humaine pour les réponses à fort enjeu
SS-28 CoBBLEr
STST-5 Preference Leakage: A Contamination Pr…ST-9 LLM Evaluators Recognize and Favor The…