Sécurité des systèmes à base d'intelligence artificielle
Injection de prompt, agents outillés, chaîne d'approvisionnement des modèles : sécuriser la surface d'attaque que l'IA a réellement ajoutée à votre système d'information
Nouveaux risques, nouvelles protections
Dès qu'un modèle reçoit du texte que vous ne contrôlez pas et dispose d'outils pour agir — lire un fichier, appeler une interface, envoyer un courriel — vous avez ajouté à votre système d'information une surface d'attaque que les contrôles classiques ne couvrent pas. Cette formation de deux jours porte sur celle-là.
L'injection de prompt indirecte n'est pas une faille à corriger : c'est une propriété des systèmes qui mêlent instructions et données dans le même canal. On la contient par l'architecture, pas par un correctif.
Nous structurons le programme autour du référentiel OWASP Top 10 for LLM Applications, en le confrontant à des cas réels. Les participants attaquent puis défendent un système outillé, ce qui reste le moyen le plus rapide de comprendre pourquoi une politique de permissions trop large est le vrai problème.
- Injection de prompt directe et indirecte, et pourquoi le filtrage d'entrée ne suffit pas
- Sécurité des agents : périmètre des outils, permissions, confusion du délégué, exfiltration silencieuse
- Fuite de données par le contexte, la mémoire ou les journaux d'appels
- Empoisonnement des données et des sources documentaires interrogées par le système
- Chaîne d'approvisionnement : provenance des modèles, dépendances, serveurs d'outils tiers
- Attaques adversariales et extraction de modèles, là où elles restent pertinentes
Le tout est rattaché à des cadres exploitables — ISO/IEC 42001 et le cadre de gestion des risques IA du NIST — pour que la sécurité soit documentable et non seulement démontrée en atelier.
Ateliers pratiques
Attaquer un agent outillé
Injection indirecte via un document, détournement d'un outil, exfiltration de données : les participants compromettent un agent de démonstration avant de le corriger.
Concevoir les garde-fous
Cloisonnement des outils, principe du moindre privilège, validation humaine sur les actions irréversibles, isolation des contenus non fiables.
Exercice de red teaming
Construire un jeu de tests adverses réutilisable et l'intégrer à la chaîne de livraison pour détecter les régressions de sécurité.
Pré-requis
- Connaissances de base en cybersécurité
- Familiarité avec les concepts de machine learning ou d'IA (non obligatoire mais recommandé)
Programme de formation
Surface d'attaque d'un système IA
Cartographier ce que l'IA a réellement ajouté : entrées non fiables, outils, mémoire, sources documentaires, dépendances externes.
Injection de prompt
Directe et indirecte, en passant par un document, une page web ou un courriel. Pourquoi les filtres d'entrée échouent et ce qui fonctionne à la place.
Sécurité des agents et des outils
Périmètre des permissions, confusion du délégué, actions irréversibles, risques liés aux serveurs d'outils tiers et à leur chaîne de confiance.
Fuite et exfiltration de données
Par le contexte, la mémoire, les journaux ou les canaux de sortie. Ce qui doit être cloisonné et ce qui ne doit jamais entrer dans une invite.
Empoisonnement et chaîne d'approvisionnement
Corruption des données d'entraînement et des sources interrogées, provenance des poids de modèles, vérification des dépendances.
Attaques sur les modèles
Exemples adversariaux, extraction de modèle et inférence d'appartenance : dans quels contextes ces menaces restent réellement pertinentes.
Red teaming et évaluation continue
Constituer un jeu de tests adverses, l'automatiser dans la chaîne de livraison et suivre les régressions au fil des mises à jour de modèle.
Cadres et documentation
OWASP Top 10 for LLM Applications, ISO/IEC 42001, cadre de gestion des risques IA du NIST : structurer une posture défendable devant un auditeur.