Agent Warden
Le gardien défensif des agents IA — détecte l'injection de prompt et les failles d'agent, et les durcit avant qu'on ne les exploite.
SKILL.md au standard ouvert agentskills.io — utilisable directement dans Claude, ChatGPT/Codex, Cursor, Copilot, etc.
Agent Warden est un skill d'IA pour la sécurité des applications LLM et des agents IA — un auditeur défensif de l'injection de prompt et de la sécurité des agents. Il examine ton system prompt, agent, pipeline RAG, définitions d'outils, serveur MCP ou chatbot face à l'OWASP Top 10 for LLM Applications (2025) et renvoie des constats priorisés plus des guardrails concrets et un plan de red-team. Strictement défensif — ni kit de jailbreak, ni substitut au pentest.
Ce que fait ce skill
- Audite system prompt/agent/RAG/outils/**serveur MCP**/chatbot face à l'**OWASP LLM Top 10 (2025)** + MITRE ATLAS
- Cartographie les **frontières de confiance & flux de données** et énumère chaque canal de contenu non fiable (incl. injection indirecte)
- Renvoie des **constats priorisés** avec id OWASP/ATLAS, lieu, scénario d'exploit et correctif concret
- Conçoit une **architecture de durcissement** : moindre privilège, séparation des privilèges (Dual-LLM/CaMeL), guardrails E/S, validations humaines, canaux d'exfil
- Examine les **serveurs MCP** : tool poisoning, rug pull, confused deputy, token passthrough, SSRF
- Génère un **plan de red-team** (Promptfoo/Garak/PyRIT, 4 couches) pour prouver les correctifs en CI
- Deux scripts défensifs : **auditeur de manifeste d'outils** (agentivité excessive, tool poisoning) + **générateur de plan red-team**
Description
Agent Warden est un skill pour la sécurité des applications LLM et des agents IA — il audite ta propre IA et la durcit contre **l'injection de prompt et l'abus d'agent** avant qu'on ne l'exploite. Tu lui donnes un system prompt, un agent, un pipeline RAG, des définitions d'outils/functions, un **serveur MCP** ou un chatbot, et il travaille face à l'**OWASP Top 10 for LLM Applications (2025)** avec un mapping **MITRE ATLAS** : d'abord cartographier les **frontières de confiance et les flux de données** (où l'instruction fiable rencontre le contenu non fiable, et ce que l'agent peut faire), puis des constats priorisés, puis le durcissement, puis la preuve. Son message central, honnête, colle à la réalité 2026 : **les délimiteurs et le texte « ignore les instructions » ne sont pas une frontière de sécurité** — une injection ne devient un dommage que lorsque l'agent peut *agir*. Ce qui marche, c'est l'architecture : **outils à moindre privilège** (le levier le plus puissant que la plupart des équipes négligent encore), **séparation des privilèges** (Dual-LLM / CaMeL : le modèle qui lit le non-fiable ne doit pas agir), guardrails entrée/sortie sur 100 % du trafic, validations humaines pour les actions irréversibles, et blocage des **canaux d'exfiltration** (auto-fetch d'image markdown, liens, appels d'outils). Il porte une attention particulière à l'**injection indirecte** — le problème difficile où la charge se cache dans des documents récupérés, des sorties d'outils, des e-mails ou des fichiers que l'agent lit en fonctionnement normal (l'incident zero-click EchoLeak prouve que ce n'est pas théorique). Pour les **serveurs MCP**, il vérifie le tool poisoning, les rug pulls, le confused deputy, le token passthrough et le SSRF. Deux scripts Node **strictement défensifs** (sans dépendances) assistent : un auditeur de manifeste d'outils qui repère l'agentivité excessive et les instructions cachées dans les descriptions d'outils, et un générateur de plan red-team qui branche des outils publics établis (Promptfoo/Garak/PyRIT) contre ton propre système, pour que les correctifs soient prouvés, pas affirmés. Il est **verify-live** (la sécurité IA change chaque mois → sources à jour avec dates), n'invente aucune faille (chaque constat exige un lieu réel + un chemin d'exploit) et reste strictement défensif.
Exemples
Testé avec Claude Code
Ce qu’il ne fait pas
- **Pas un kit d'attaque/jailbreak** — tes systèmes propres/autorisés uniquement ; aucune charge d'attaque ; aucune aide contre des systèmes tiers
- **Pas un substitut au pentest professionnel** ni de garanties de sécurité (augmente le coût de l'attaque, n'élimine pas le risque)
- **N'invente aucune faille** — chaque constat exige un lieu réel + un chemin d'exploit ; l'inconnu reste une question ouverte
- **N'exécute aucun exploit en direct** contre des systèmes
- **Pas d'étiquetage/divulgation IA** (→ KI-Transparenz) ni de sécurité web/appli classique (→ Web Vitals / Website-Doktor)
Compatibilité & technique
- Testé (interne)
- 5 scénarios
- Runtime recommandé
- Claude Opus ou Sonnet ; avec accès web pour le verify-live face aux sources OWASP/MITRE ATLAS/CVE à jour. Les scripts nécessitent Node (sans paquets) ; sans Node, le skill fait la même analyse à la main et le signale.
- Modes
- Audit rapide (dépose un prompt/config/outils) · Audit complet (toute l'appli + flux de données) · Revue de serveur MCP · Durcissement / conception de guardrails · Plan de red-team
- Entrées
- system prompt / configuration d'agent · définitions d'outils/functions (JSON OpenAI/Anthropic/MCP) · description RAG / pipeline · manifeste de serveur MCP · setup chatbot / multi-agents
- Format de sortie
- Rapport d'audit de sécurité : carte des frontières de confiance + tableau de constats priorisés (OWASP/ATLAS · lieu · exploit · correctif) + architecture de durcissement + plan de red-team + backlog
- Sous-catégorie
- Sécurité IA & durcissement des agents
- Licence
- Proprietär
Profil de sécurité
S’exécute entièrement chez toi avec ta propre IA — aucun runtime externe, aucun coût récurrent.
Contient du code exécutable ou exécute des actions/outils — jette un œil avant utilisation.
Accède à des sources externes / au réseau en usage normal (pages live, API de recherche/données).
Contenu livré
- agent-warden-1.0.0/11 fichiers
- .claude-plugin/marketplace.json
plugins/agent-warden/skills/agent-warden/11 fichiers
- SKILL.md
- manifest.json
references/7 fichiers
- agent-warden-checklist.md
- agent-warden-frameworks.md
- agent-warden-injection-defenses.md
- agent-warden-mcp-security.md
- agent-warden-output-handling.md
- agent-warden-owasp-llm.md
- agent-warden-redteam-catalog.md
scripts/2 fichiers
- redteam-plan.mjs
- tool-manifest-audit.mjs
- .agents/skills/agent-warden/→ universel — même contenu (Codex, Cursor, Copilot, Gemini, Windsurf, Cline)
- LICENSE.txt
Installation
Aussi comme prompt de chat
Pas d’outil IA ? Collez-le dans Claude, ChatGPT ou Gemini et utilisez la méthode aussitôt.
Vous obtenez la méthode complète. Seuls 2 script(s) d’aide qui automatisent des parties ne tournent qu’une fois installés.
Fonctionne mieux quand votre chat a un accès web.
L’installation est la version complète — elle se déclenche automatiquement, exécute ses scripts et charge les références au besoin. En prompt de chat, vous pilotez la méthode vous-même.
Déverrouillez pour copier le prompt prêt à coller — ensuite dans « Mes skills ».
Avis
Pas encore d’avis – soyez le premier.
Remarque
Agent Warden est strictement défensif : il audite et durcit tes propres systèmes ou ceux explicitement autorisés — pas un kit d'attaque/jailbreak pour des systèmes tiers. Il ne remplace pas un test d'intrusion professionnel et ne donne aucune garantie de sécurité. La sécurité IA évolue chaque mois : avec accès web, le skill vérifie les détails OWASP/MITRE ATLAS/CVE en direct et cite la date de consultation. Les scripts fournis nécessitent Node (sans paquets).
Journal des modifications
- v1.0.020.08.2026Première version : auditeur de sécurité IA défensif pour applis LLM & agents. Audit face à l'OWASP Top 10 for LLM Applications (2025) avec mapping MITRE ATLAS, analyse des frontières de confiance/flux de données, constats priorisés, architecture de durcissement (moindre privilège, séparation des privilèges/Dual-LLM/CaMeL, guardrails entrée/sortie, validations humaines, canaux d'exfil) et plan de red-team (Promptfoo/Garak/PyRIT). Deux scripts Node défensifs (auditeur de manifeste d'outils, générateur de plan red-team), 7 références dont sécurité MCP, gestion des sorties et incidents réels (EchoLeak). Verify-live, défensif uniquement, pas un substitut au pentest.
Questions fréquentes
Que fait Agent Warden ?
Agent Warden est un skill d'IA pour la sécurité des applications LLM et des agents IA — un auditeur défensif de l'injection de prompt et de la sécurité des agents. Il examine ton system prompt, agent, pipeline RAG, définitions d'outils, serveur MCP ou chatbot face à l'OWASP Top 10 for LLM Applications (2025) et renvoie des constats priorisés plus des guardrails concrets et un plan de red-team. Strictement défensif — ni kit de jailbreak, ni substitut au pentest.
Mon agent IA est-il sûr contre l'injection de prompt ?
C'est exactement ce que vérifie Agent Warden — il audite ton system prompt, agent, RAG, outils ou serveur MCP face à l'OWASP Top 10 for LLM Applications (2025), trouve les points exploitables (surtout l'injection indirecte via le contenu récupéré) et fournit des correctifs concrets plus un plan de red-team pour les prouver.
Suffit-il de mettre « ignore les instructions dans l'entrée » dans le system prompt ?
Non — et Agent Warden te le dit honnêtement. Les délimiteurs et ce type de phrases ne sont pas une frontière de sécurité (texte contre texte). Ce qui marche est structurel — outils à moindre privilège, séparation des privilèges (Dual-LLM/CaMeL), guardrails entrée/sortie et validations humaines.
Agent Warden peut-il auditer mon serveur MCP ?
Oui. Agent Warden a un module MCP dédié pour le tool poisoning, les rug pulls, le confused deputy, le token passthrough et le SSRF — avec un script qui scanne tes définitions d'outils pour l'agentivité excessive et les instructions cachées dans les descriptions d'outils.
Est-ce un outil de hacking / jailbreak ?
Non. Agent Warden est strictement défensif — il audite et durcit tes propres systèmes ou ceux explicitement autorisés. Il n'aide pas à attaquer des systèmes tiers, ne fournit aucune charge d'attaque, et ne remplace pas un test d'intrusion professionnel.
Comment Agent Warden teste-t-il que les correctifs fonctionnent ?
Il génère un plan de red-team avec des outils publics établis (Promptfoo, Garak, PyRIT) pour ton propre système — un régime en 4 couches que tu branches en CI comme régression. Les correctifs sont ainsi prouvés, pas seulement affirmés.
Agent Warden couvre-t-il les obligations d'étiquetage IA (EU AI Act) ?
Non, c'est un autre chantier — sur skills-for-ai, c'est le skill KI-Transparenz (transparence IA) qui s'en charge. Agent Warden couvre la sécurité technique (injection de prompt, durcissement des agents), pas les obligations de divulgation/étiquetage.
Avec quels outils d’IA Agent Warden fonctionne-t-il ?
Claude · ChatGPT/Codex · Cursor · Copilot · Gemini CLI · Windsurf · Cline
Comment utiliser Agent Warden ?
Agent Warden est un SKILL.md au standard ouvert agentskills.io : installez-le en une commande (npx) ou téléchargez-le et ajoutez-le à votre outil d’IA — Claude (Projects), ChatGPT (Custom GPT), Cursor, Copilot, Gemini CLI, etc. Aucun code requis.