Risques agentiques (excès d'autonomie, mésusage d'outils, fuite de prompt)
Comprendre
Un agent utilisant des outils peut dépasser son mandat (action non voulue, fuite d’instructions).
Un agent capable d’agir a une portée réelle ; sans limites strictes, une instruction parasite peut déclencher une action hors périmètre, un appel d’outil non voulu, ou une fuite de ses propres instructions (pour la fuite du prompt système, voir la fiche 5.4 / LLM07).
Tester
aux ①②– , une action non sollicitée, un appel d’outil hors périmètre, une divulgation – d’instructions, ou une sur-initiative non bornée ; aux ③④ sur agent, un enchaînement d’actions non voulues.
Avant de donner à un agent le moindre outil d’action, exigez la règle du moindre privilège et une validation humaine sur les actions irréversibles. La portée réelle d’un agent est proportionnelle au danger d’un mandat flou.
Automatisations qui écrivent, commandent, envoient ou modifient : chaque outil ajouté élargit la surface de risque — bornez le mandat, journalisez les appels, verrouillez l’irréversible.
Prévenir
- › outils à privilège minimal.
- › confirmation pour les actions irréversibles.
- › blocage de la divulgation d’instructions et de secrets.
- › Contrôle résiduel : principe de moindre privilège, bac à sable pour les outils, validation de schéma des appels, budget d’action, dry-run, logs, rollback et revue humaine des actions à fort impact.
Référence
Preuve A (évaluée par les pairs) — InjecAgent (Zhan et al., Findings ACL 2024, p. 10471-10506 — 1 054 cas, 17×62 outils) — Peer-reviewed · conf High arxiv.org/abs/2403.02691
Ce qu’elle établit — un agent utilisant des outils peut dépasser son mandat (action non voulue, fuite d’instructions) — c’est le phénomène mesuré par la source ci-dessus.