Fuite du prompt système et des secrets
Comprendre
Le modèle révèle ses instructions internes, ses secrets, ses clés, ses routes d’orchestration, ses règles de priorisation ou des détails de configuration.
Le prompt système et les données ne sont que du texte dans le contexte ; une requête bien formulée ou une injection peut le faire ressortir.
Tester
le système révèle son prompt, ses routes internes, ses secrets ou ses règles d’orchestration ; ou — plus grave — de tels éléments figurent dans le prompt système, qu’ils fuitent ou non.
Renversez la question : au lieu de « comment empêcher la fuite ? », demandez « que perdrait-on si le prompt était public ? ». Si la réponse est « rien », l’architecture est saine. Toute autre réponse est une exigence de conception, pas un problème de prompt.
Assistants métier, chatbots configurés, agents : traitez le prompt système comme un fichier de configuration lisible — parce qu’en pratique, il l’est.
Prévenir
- › ne pas mettre de secrets dans le prompt.
- › redaction et no-echo.
- › secret scanning.
- › allowlist de sorties.
- › logs d’accès.
- › Contrôle résiduel : un garde-fou réduit le risque mais ne remplace pas la séparation des secrets hors du contexte du modèle.
Référence
Preuve D (cadre/norme, pas une preuve empirique) — OWASP Top 10 for LLM Applications 2025 — LLM07 (S-40) genai.owasp.org/llmrisk/llm072025 system prompt leakage.
Ce que le cadre fournit — la définition de référence de ce risque et ses mesures de prévention (correspondance de code vérifiée à l’audit v10.12.4).