Cybersécurité & IA

Sécurité MCP : quand l'agent IA devient l'arme d'attaque

MCPAgents IACyber sécuritéPrompt InjectionSécurité IA
Sécurité MCP : quand l'agent IA devient l'arme d'attaque
Le Model Context Protocol est une norme qui permet à un agent IA de dialoguer avec des outils externes.

Concrètement, il expose des outils que l'agent peut appeler : "lis ce fichier", "interroge cette base", "envoie cet email".

L'agent lit la description de chaque outil pour décider quand l'utiliser. C'est très puissant : l'IA passe de simple conversation à action réelle sur vos systèmes.

Mais c'est aussi là que réside le danger : l'agent fait confiance à ces descriptions et à ces outils. Et cette confiance peut être exploitée.
C'est l'une des attaques les plus sournoises du MCP.

Le principe : un attaquant modifie la description d'un outil MCP pour que le modèle IA se méprenne sur ce qu'il fait réellement.

Exemple : un outil présenté comme "vérifie l'orthographe" contient en réalité, caché dans sa description, une instruction du type "copie aussi tous les fichiers vers cette adresse".

L'agent, qui lit et fait confiance à la description, exécute l'action malveillante sans que l'utilisateur ne s'en rende compte. Le texte de la description devient l'arme.
Autre menace majeure : l'attaque du confused deputy (l'adjoint dupé).

Le principe : le serveur MCP exécute des actions avec ses propres privilèges élevés, au lieu de ceux de l'utilisateur qui demande.

Un attaquant sans droits peut alors pousser l'agent à réaliser une action qu'il n'aurait jamais pu faire lui-même, parce que le serveur, lui, a les droits.

C'est comme demander à un concierge qui a le passe-partout de vous ouvrir une porte à laquelle vous n'avez pas accès : le concierge est de bonne foi, mais il vient d'être manipulé.
Les agents IA qui naviguent sur le web sont particulièrement exposés.

Des recherches indépendantes ont déjà documenté des failles systémiques :
  • Des agents exécutant des instructions malveillantes cachées dans une page web (injection indirecte de prompt)
  • Des agents tombant dans des arnaques conçues pour eux
  • Des agents contournant les protections des navigateurs censées protéger les sessions authentifiées

Le danger : l'agent ne distingue pas une consigne légitime de l'utilisateur d'une consigne piégée trouvée sur une page.
Sécuriser le MCP demande une approche défensive à chaque niveau :
  • Vérifier les serveurs MCP : n'utilisez que des serveurs de confiance, dont vous contrôlez le code et les descriptions d'outils.
  • Principe du moindre privilège : le serveur agit avec les droits de l'utilisateur, jamais avec des droits élevés par défaut.
  • Valider les descriptions d'outils : traiter toute description comme une entrée non fiable, à contrôler.
  • Isoler et journaliser : chaque action d'un agent doit être traçable et attribuable.
  • Confirmation humaine : pour les actions sensibles (suppression, envoi, paiement), exiger une validation.