Cybersécurité & IA
Sécurité MCP : quand l'agent IA devient l'arme d'attaque
8 juillet 2026
8 min de lecture
MCPAgents IACyber sécuritéPrompt InjectionSécurité IA

Le protocole MCP connecte les agents IA à vos outils. En 2026, il est aussi devenu une arme d'attaque. Comprenez le tool poisoning, le confused deputy et comment sécuriser vos agents.
En 2026, connecter un agent IA à vos outils n'a jamais été aussi simple. Le protocole MCP (Model Context Protocol) est devenu le standard pour brancher un modèle IA à vos bases de données, vos fichiers, vos API et vos applications métier.
Mais cette puissance a un revers. En mars 2026, ce que les chercheurs redoutaient depuis longtemps s'est confirmé : un agent IA a été utilisé comme mécanisme d'attaque principal dans une brèche de grande ampleur, réelle et documentée.
La Coalition for Secure AI (CoSAI) a publié en janvier 2026 un livre blanc de référence sur la sécurité MCP, cartographiant 12 catégories de menaces et près de 40 menaces distinctes. Le message est clair : donner à un agent IA les clés de vos outils sans sécurité, c'est ouvrir une nouvelle surface d'attaque.
Mais cette puissance a un revers. En mars 2026, ce que les chercheurs redoutaient depuis longtemps s'est confirmé : un agent IA a été utilisé comme mécanisme d'attaque principal dans une brèche de grande ampleur, réelle et documentée.
La Coalition for Secure AI (CoSAI) a publié en janvier 2026 un livre blanc de référence sur la sécurité MCP, cartographiant 12 catégories de menaces et près de 40 menaces distinctes. Le message est clair : donner à un agent IA les clés de vos outils sans sécurité, c'est ouvrir une nouvelle surface d'attaque.
Qu'est-ce que le MCP, en clair ?
Le Model Context Protocol est une norme qui permet à un agent IA de dialoguer avec des outils externes.
Concrètement, il expose des outils que l'agent peut appeler : "lis ce fichier", "interroge cette base", "envoie cet email".
L'agent lit la description de chaque outil pour décider quand l'utiliser. C'est très puissant : l'IA passe de simple conversation à action réelle sur vos systèmes.
Mais c'est aussi là que réside le danger : l'agent fait confiance à ces descriptions et à ces outils. Et cette confiance peut être exploitée.
Concrètement, il expose des outils que l'agent peut appeler : "lis ce fichier", "interroge cette base", "envoie cet email".
L'agent lit la description de chaque outil pour décider quand l'utiliser. C'est très puissant : l'IA passe de simple conversation à action réelle sur vos systèmes.
Mais c'est aussi là que réside le danger : l'agent fait confiance à ces descriptions et à ces outils. Et cette confiance peut être exploitée.
Le tool poisoning : empoisonner la description
C'est l'une des attaques les plus sournoises du MCP.
Le principe : un attaquant modifie la description d'un outil MCP pour que le modèle IA se méprenne sur ce qu'il fait réellement.
Exemple : un outil présenté comme "vérifie l'orthographe" contient en réalité, caché dans sa description, une instruction du type "copie aussi tous les fichiers vers cette adresse".
L'agent, qui lit et fait confiance à la description, exécute l'action malveillante sans que l'utilisateur ne s'en rende compte. Le texte de la description devient l'arme.
Le principe : un attaquant modifie la description d'un outil MCP pour que le modèle IA se méprenne sur ce qu'il fait réellement.
Exemple : un outil présenté comme "vérifie l'orthographe" contient en réalité, caché dans sa description, une instruction du type "copie aussi tous les fichiers vers cette adresse".
L'agent, qui lit et fait confiance à la description, exécute l'action malveillante sans que l'utilisateur ne s'en rende compte. Le texte de la description devient l'arme.
Le confused deputy : abuser des privilèges
Autre menace majeure : l'attaque du confused deputy (l'adjoint dupé).
Le principe : le serveur MCP exécute des actions avec ses propres privilèges élevés, au lieu de ceux de l'utilisateur qui demande.
Un attaquant sans droits peut alors pousser l'agent à réaliser une action qu'il n'aurait jamais pu faire lui-même, parce que le serveur, lui, a les droits.
C'est comme demander à un concierge qui a le passe-partout de vous ouvrir une porte à laquelle vous n'avez pas accès : le concierge est de bonne foi, mais il vient d'être manipulé.
Le principe : le serveur MCP exécute des actions avec ses propres privilèges élevés, au lieu de ceux de l'utilisateur qui demande.
Un attaquant sans droits peut alors pousser l'agent à réaliser une action qu'il n'aurait jamais pu faire lui-même, parce que le serveur, lui, a les droits.
C'est comme demander à un concierge qui a le passe-partout de vous ouvrir une porte à laquelle vous n'avez pas accès : le concierge est de bonne foi, mais il vient d'être manipulé.
L'injection indirecte via les agents de navigation
Les agents IA qui naviguent sur le web sont particulièrement exposés.
Des recherches indépendantes ont déjà documenté des failles systémiques :
Le danger : l'agent ne distingue pas une consigne légitime de l'utilisateur d'une consigne piégée trouvée sur une page.
Des recherches indépendantes ont déjà documenté des failles systémiques :
- Des agents exécutant des instructions malveillantes cachées dans une page web (injection indirecte de prompt)
- Des agents tombant dans des arnaques conçues pour eux
- Des agents contournant les protections des navigateurs censées protéger les sessions authentifiées
Le danger : l'agent ne distingue pas une consigne légitime de l'utilisateur d'une consigne piégée trouvée sur une page.
Comment sécuriser vos agents et serveurs MCP
Sécuriser le MCP demande une approche défensive à chaque niveau :
- Vérifier les serveurs MCP : n'utilisez que des serveurs de confiance, dont vous contrôlez le code et les descriptions d'outils.
- Principe du moindre privilège : le serveur agit avec les droits de l'utilisateur, jamais avec des droits élevés par défaut.
- Valider les descriptions d'outils : traiter toute description comme une entrée non fiable, à contrôler.
- Isoler et journaliser : chaque action d'un agent doit être traçable et attribuable.
- Confirmation humaine : pour les actions sensibles (suppression, envoi, paiement), exiger une validation.