Injection de promptPrompt injection
Réponse directe
Une attaque qui insère des instructions conçues pour détourner le comportement prévu d’un modèle ou de l’application qui l’utilise.
Explication détaillée
L’instruction malveillante peut être envoyée directement par un utilisateur ou cachée dans une page web, un e-mail ou un document consulté par le système. Le modèle risque alors de traiter une donnée externe comme une instruction prioritaire, d’ignorer ses règles ou d’utiliser un outil de manière imprévue. Les protections doivent donc aussi limiter les permissions et contrôler les entrées, les sorties et les actions.
Exemple
Un assistant chargé de résumer des pages lit dans l’une d’elles un texte caché lui demandant d’ignorer sa mission et de transmettre des informations à une adresse externe.
Analogie
C’est comme glisser une fausse consigne dans le dossier remis à un assistant en espérant qu’il la confonde avec les instructions de son responsable.
Erreurs fréquentes
« L’attaque vient toujours du message de l’utilisateur. » Une injection indirecte peut être intégrée à une ressource consultée par l’IA.
« Un prompt système suffit à l’empêcher. » Il faut également contrôler les données, les autorisations et les actions possibles.
« Prompt injection et jailbreak sont toujours synonymes. » Le jailbreak vise généralement à contourner les garde-fous ; l’injection couvre plus largement le détournement des instructions.
Termes liés
Sources
- NIST — Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations — NIST · consulté le 2026-07-24
- OWASP GenAI Security Project — LLM01:2025 Prompt Injection — OWASP · consulté le 2026-07-24
Dernière mise à jour : 24/07/2026 · Rédaction : Alban Speckaert
