Injection de prompt
Comprendre
Un texte externe peut contenir une instruction cachée que le modèle exécute.
Le modèle ne sépare pas de façon fiable instructions et données — tout dans son contexte n’est que du texte, alors une commande enfouie dans le contenu peut écraser le prompt système.
Tester
aux ①②, une instruction injectée est exécutée à la place de la tâche demandée ; aux ③④ sur pipeline, un contenu externe déclenche un comportement ou un appel d’outil non voulu.
Testez la séparation des rôles : le modèle doit traiter le contenu utilisateur/document comme des données, jamais comme des instructions. La frontière données/instructions est le cœur de la défense.
Tout système lisant des sources externes (e-mails, tickets, pages, PDF fournisseurs) est exposé — l’injection n’a pas besoin d’accès, juste d’être lue.
Prévenir
- › isolez/« spotlightez » le contenu non fiable.
- › outils à privilège minimal.
- › validation humaine pour les actions risquées.
- › Contrôle résiduel : ne pas s’appuyer sur le prompt seul ; appliquer isolation des entrées non fiables, moindre privilège, sandbox des outils, logs d’action, validation humaine des actions à fort impact et tests adversariaux réguliers.
Référence
Preuve B (préprint — pas encore relu par les pairs) — Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review (Lin) arxiv.org/abs/2507.06185
un texte externe peut contenir une instruction cachée que le modèle exécute — c’est le phénomène mesuré par la source ci-dessus.