Un assistant consulte une page pour répondre à votre question. Cette page contient aussi une phrase lui demandant d’ignorer votre demande. Le danger apparaît si le système traite cette phrase comme un ordre. L’injection de prompt indirecte concerne cette confusion entre le contenu à analyser et les instructions qui gouvernent l’outil.

Un document peut devenir un vecteur d’attaque

L’étude de Greshake et de ses coauteurs, publiée sur arXiv en 2023, examine des applications intégrant des modèles de langage. Elle montre comment des instructions placées dans des données externes peuvent influer sur leur comportement. Les résultats concernent les systèmes étudiés et leurs configurations. Ils ne signifient pas que chaque assistant transmet automatiquement des informations privées dès qu’il ouvre une page.

L’injection indirecte se distingue d’une demande adressée directement au modèle : l’utilisateur peut être de bonne foi, tandis que le texte récupéré ne l’est pas. La confiance accordée à une page pour son contenu ne devrait donc pas lui donner le pouvoir de modifier les règles de l’assistant.

Le risque dépend des permissions

Prenons un exemple fictif : un assistant résume une facture contenant une demande de transfert d’argent. Lire cette demande, la citer et exécuter le transfert sont trois actions différentes. Si l’application ne possède aucun accès bancaire, le texte ne crée pas cet accès. Si elle dispose d’outils sensibles, leur autorisation devient décisive.

Pour comparer deux produits, demandez quelles actions nécessitent une confirmation, quelles ressources sont accessibles et comment les documents externes sont isolés des instructions. Une réponse incorrecte et une action exécutée à votre place n’ont pas les mêmes conséquences. Cette distinction complète les questions sur l’alignement des IA : la sécurité dépend aussi de l’application construite autour du modèle.

Sources & références

Documents consultés pour ce dossier. Les interprétations sont celles de la rédaction.

  • Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection · Consulté le 2026-10-05

Un élément à corriger ? Écrivez à la rédaction.