Amplification par les sorties synthétiques
Comprendre
Quand l’IA se réentraîne sur ses propres sorties, les représentations rares disparaissent et les motifs dominants (dont les stéréotypes) s’installent.
Réinjectées dans l’entraînement, les sorties du modèle font disparaître les queues de distribution — les contenus rares s’effacent, génération après génération (effondrement du modèle).
Tester
les sorties générées sont stéréotypées et peu diverses ; du contenu manifestement synthétique est traité comme une preuve ; le tri réel/généré n’est pas fait ; les réserves cèdent sous affirmation.
Vérifiez la provenance avant d’intégrer toute source ; un contenu sans méthodologie ni auteur vérifiable ne fait pas preuve. À l’échelle du corpus, l’amplification synthétique efface silencieusement les cas rares.
Bases de connaissances, revues de marché, jeux d’essai générés : tracez l’origine réelle vs synthétique — un corpus qui se nourrit de lui-même dérive vers l’uniformité.
Prévenir
- › ne réentraînez pas sur des sorties de modèle non filtrées.
- › auditez les données synthétiques pour la dérive.
Référence
Preuve A (évaluée par les pairs) — AI models collapse when trained on recursively generated data (Shumailov et al., Nature 631, p. 755-759) (10.1038/s41586-024-07566-y) — Peer-reviewed · conf High. Source d’appui : Fairness Feedback Loops: Training on Synthetic Data Amplifies Bias (Wyllie et al., FAccT 2024, p. 2113-2147 — doi:10.1145/3630106.3659029).
Ce qu’elle établit — entraîné récursivement sur ses propres sorties, un modèle perd les queues de distribution : les contenus rares s’effacent, génération après génération (Nature, 2024).