Préférence pour soi-même
Comprendre
Un LLM-juge préfère ses propres sorties (elles lui semblent plus « familières »).
Un modèle-juge trouve son propre style plus probable, donc plus « fluide », alors il note plus haut les sorties de sa propre lignée qu’un humain.
Tester
le juge choisit ses propres réponses nettement plus souvent qu’un panel humain ; le verdict bascule quand la paternité est révélée.
N’utilisez jamais un modèle comme seul juge de ses propres sorties (auto-évaluation, boucle d’auto-amélioration) : introduisez un juge de lignée différente, ou un contrôle humain. Le conflit d’intérêt est structurel.
Pipelines où un modèle génère et sélectionne (résumés notés par le même modèle, variantes auto-classées) : la préférence pour soi fausse la sélection — séparez juge et auteur.
Prévenir
- › ne laissez pas un modèle juger sa propre lignée.
- › utilisez des juges indépendants ou humains.
Référence
Preuve A (évaluée par les pairs) — LLM Evaluators Recognize and Favor Their Own Generations (Panickssery et al., NeurIPS 2024) — Peer-reviewed · conf High arxiv.org/abs/2404.13076
Ce qu’elle établit — un LLM-juge préfère ses propres sorties (elles lui semblent plus « familières ») — c’est le phénomène mesuré par la source ci-dessus.