Développement Business Skill

Agent Warden

Le gardien défensif des agents IA — détecte l'injection de prompt et les failles d'agent, et les durcit avant qu'on ne les exploite.

Sécurité IAPrompt InjectionOWASPSécurité des agentsRed TeamingGuardrailsMCPModèle de menaceSécurité LLMExfiltration de données
Gratuit
0 0 v1.0.0 Mis à jour 20.08.2026 par skills-for-ai

SKILL.md au standard ouvert agentskills.io — utilisable directement dans Claude, ChatGPT/Codex, Cursor, Copilot, etc.

Agent Warden est un skill d'IA pour la sécurité des applications LLM et des agents IA — un auditeur défensif de l'injection de prompt et de la sécurité des agents. Il examine ton system prompt, agent, pipeline RAG, définitions d'outils, serveur MCP ou chatbot face à l'OWASP Top 10 for LLM Applications (2025) et renvoie des constats priorisés plus des guardrails concrets et un plan de red-team. Strictement défensif — ni kit de jailbreak, ni substitut au pentest.

Ce que fait ce skill

  • Audite system prompt/agent/RAG/outils/**serveur MCP**/chatbot face à l'**OWASP LLM Top 10 (2025)** + MITRE ATLAS
  • Cartographie les **frontières de confiance & flux de données** et énumère chaque canal de contenu non fiable (incl. injection indirecte)
  • Renvoie des **constats priorisés** avec id OWASP/ATLAS, lieu, scénario d'exploit et correctif concret
  • Conçoit une **architecture de durcissement** : moindre privilège, séparation des privilèges (Dual-LLM/CaMeL), guardrails E/S, validations humaines, canaux d'exfil
  • Examine les **serveurs MCP** : tool poisoning, rug pull, confused deputy, token passthrough, SSRF
  • Génère un **plan de red-team** (Promptfoo/Garak/PyRIT, 4 couches) pour prouver les correctifs en CI
  • Deux scripts défensifs : **auditeur de manifeste d'outils** (agentivité excessive, tool poisoning) + **générateur de plan red-team**

Description

Agent Warden est un skill pour la sécurité des applications LLM et des agents IA — il audite ta propre IA et la durcit contre **l'injection de prompt et l'abus d'agent** avant qu'on ne l'exploite. Tu lui donnes un system prompt, un agent, un pipeline RAG, des définitions d'outils/functions, un **serveur MCP** ou un chatbot, et il travaille face à l'**OWASP Top 10 for LLM Applications (2025)** avec un mapping **MITRE ATLAS** : d'abord cartographier les **frontières de confiance et les flux de données** (où l'instruction fiable rencontre le contenu non fiable, et ce que l'agent peut faire), puis des constats priorisés, puis le durcissement, puis la preuve. Son message central, honnête, colle à la réalité 2026 : **les délimiteurs et le texte « ignore les instructions » ne sont pas une frontière de sécurité** — une injection ne devient un dommage que lorsque l'agent peut *agir*. Ce qui marche, c'est l'architecture : **outils à moindre privilège** (le levier le plus puissant que la plupart des équipes négligent encore), **séparation des privilèges** (Dual-LLM / CaMeL : le modèle qui lit le non-fiable ne doit pas agir), guardrails entrée/sortie sur 100 % du trafic, validations humaines pour les actions irréversibles, et blocage des **canaux d'exfiltration** (auto-fetch d'image markdown, liens, appels d'outils). Il porte une attention particulière à l'**injection indirecte** — le problème difficile où la charge se cache dans des documents récupérés, des sorties d'outils, des e-mails ou des fichiers que l'agent lit en fonctionnement normal (l'incident zero-click EchoLeak prouve que ce n'est pas théorique). Pour les **serveurs MCP**, il vérifie le tool poisoning, les rug pulls, le confused deputy, le token passthrough et le SSRF. Deux scripts Node **strictement défensifs** (sans dépendances) assistent : un auditeur de manifeste d'outils qui repère l'agentivité excessive et les instructions cachées dans les descriptions d'outils, et un générateur de plan red-team qui branche des outils publics établis (Promptfoo/Garak/PyRIT) contre ton propre système, pour que les correctifs soient prouvés, pas affirmés. Il est **verify-live** (la sécurité IA change chaque mois → sources à jour avec dates), n'invente aucune faille (chaque constat exige un lieu réel + un chemin d'exploit) et reste strictement défensif.

Exemples

Testé avec Claude Code

Ce qu’il ne fait pas

  • **Pas un kit d'attaque/jailbreak** — tes systèmes propres/autorisés uniquement ; aucune charge d'attaque ; aucune aide contre des systèmes tiers
  • **Pas un substitut au pentest professionnel** ni de garanties de sécurité (augmente le coût de l'attaque, n'élimine pas le risque)
  • **N'invente aucune faille** — chaque constat exige un lieu réel + un chemin d'exploit ; l'inconnu reste une question ouverte
  • **N'exécute aucun exploit en direct** contre des systèmes
  • **Pas d'étiquetage/divulgation IA** (→ KI-Transparenz) ni de sécurité web/appli classique (→ Web Vitals / Website-Doktor)

Compatibilité & technique

ClaudeChatGPT/CodexCursorCopilotGemini CLIWindsurfCline
Testé (interne)
5 scénarios
Runtime recommandé
Claude Opus ou Sonnet ; avec accès web pour le verify-live face aux sources OWASP/MITRE ATLAS/CVE à jour. Les scripts nécessitent Node (sans paquets) ; sans Node, le skill fait la même analyse à la main et le signale.
Modes
Audit rapide (dépose un prompt/config/outils) · Audit complet (toute l'appli + flux de données) · Revue de serveur MCP · Durcissement / conception de guardrails · Plan de red-team
Entrées
system prompt / configuration d'agent · définitions d'outils/functions (JSON OpenAI/Anthropic/MCP) · description RAG / pipeline · manifeste de serveur MCP · setup chatbot / multi-agents
Format de sortie
Rapport d'audit de sécurité : carte des frontières de confiance + tableau de constats priorisés (OWASP/ATLAS · lieu · exploit · correctif) + architecture de durcissement + plan de red-team + backlog
Sous-catégorie
Sécurité IA & durcissement des agents
Licence
Proprietär

Profil de sécurité

Local

S’exécute entièrement chez toi avec ta propre IA — aucun runtime externe, aucun coût récurrent.

Contient des scripts

Contient du code exécutable ou exécute des actions/outils — jette un œil avant utilisation.

Accès réseau

Accède à des sources externes / au réseau en usage normal (pages live, API de recherche/données).

Que signifient ces badges ? →

Contenu livré

  • agent-warden-1.0.0/11 fichiers
    • .claude-plugin/marketplace.json
    • plugins/agent-warden/skills/agent-warden/11 fichiers
      • SKILL.md
      • manifest.json
      • references/7 fichiers
        • agent-warden-checklist.md
        • agent-warden-frameworks.md
        • agent-warden-injection-defenses.md
        • agent-warden-mcp-security.md
        • agent-warden-output-handling.md
        • agent-warden-owasp-llm.md
        • agent-warden-redteam-catalog.md
      • scripts/2 fichiers
        • redteam-plan.mjs
        • tool-manifest-audit.mjs
    • .agents/skills/agent-warden/→ universel — même contenu (Codex, Cursor, Copilot, Gemini, Windsurf, Cline)
    • LICENSE.txt

Installation

Après déverrouillage, installez avec une seule commande — elle détecte votre outil IA.

Fonctionne dansClaude CodeGitHub CopilotGemini CLICursorCodex CLIWindsurfCline

Aussi comme prompt de chat

Méthode en chat

Pas d’outil IA ? Collez-le dans Claude, ChatGPT ou Gemini et utilisez la méthode aussitôt.

Vous obtenez la méthode complète. Seuls 2 script(s) d’aide qui automatisent des parties ne tournent qu’une fois installés.

Fonctionne mieux quand votre chat a un accès web.

L’installation est la version complète — elle se déclenche automatiquement, exécute ses scripts et charge les références au besoin. En prompt de chat, vous pilotez la méthode vous-même.

Déverrouillez pour copier le prompt prêt à coller — ensuite dans « Mes skills ».

Avis

Pas encore d’avis – soyez le premier.

Remarque

Agent Warden est strictement défensif : il audite et durcit tes propres systèmes ou ceux explicitement autorisés — pas un kit d'attaque/jailbreak pour des systèmes tiers. Il ne remplace pas un test d'intrusion professionnel et ne donne aucune garantie de sécurité. La sécurité IA évolue chaque mois : avec accès web, le skill vérifie les détails OWASP/MITRE ATLAS/CVE en direct et cite la date de consultation. Les scripts fournis nécessitent Node (sans paquets).

Journal des modifications

  • v1.0.020.08.2026Première version : auditeur de sécurité IA défensif pour applis LLM & agents. Audit face à l'OWASP Top 10 for LLM Applications (2025) avec mapping MITRE ATLAS, analyse des frontières de confiance/flux de données, constats priorisés, architecture de durcissement (moindre privilège, séparation des privilèges/Dual-LLM/CaMeL, guardrails entrée/sortie, validations humaines, canaux d'exfil) et plan de red-team (Promptfoo/Garak/PyRIT). Deux scripts Node défensifs (auditeur de manifeste d'outils, générateur de plan red-team), 7 références dont sécurité MCP, gestion des sorties et incidents réels (EchoLeak). Verify-live, défensif uniquement, pas un substitut au pentest.

Questions fréquentes

Que fait Agent Warden ?

Agent Warden est un skill d'IA pour la sécurité des applications LLM et des agents IA — un auditeur défensif de l'injection de prompt et de la sécurité des agents. Il examine ton system prompt, agent, pipeline RAG, définitions d'outils, serveur MCP ou chatbot face à l'OWASP Top 10 for LLM Applications (2025) et renvoie des constats priorisés plus des guardrails concrets et un plan de red-team. Strictement défensif — ni kit de jailbreak, ni substitut au pentest.

Mon agent IA est-il sûr contre l'injection de prompt ?

C'est exactement ce que vérifie Agent Warden — il audite ton system prompt, agent, RAG, outils ou serveur MCP face à l'OWASP Top 10 for LLM Applications (2025), trouve les points exploitables (surtout l'injection indirecte via le contenu récupéré) et fournit des correctifs concrets plus un plan de red-team pour les prouver.

Suffit-il de mettre « ignore les instructions dans l'entrée » dans le system prompt ?

Non — et Agent Warden te le dit honnêtement. Les délimiteurs et ce type de phrases ne sont pas une frontière de sécurité (texte contre texte). Ce qui marche est structurel — outils à moindre privilège, séparation des privilèges (Dual-LLM/CaMeL), guardrails entrée/sortie et validations humaines.

Agent Warden peut-il auditer mon serveur MCP ?

Oui. Agent Warden a un module MCP dédié pour le tool poisoning, les rug pulls, le confused deputy, le token passthrough et le SSRF — avec un script qui scanne tes définitions d'outils pour l'agentivité excessive et les instructions cachées dans les descriptions d'outils.

Est-ce un outil de hacking / jailbreak ?

Non. Agent Warden est strictement défensif — il audite et durcit tes propres systèmes ou ceux explicitement autorisés. Il n'aide pas à attaquer des systèmes tiers, ne fournit aucune charge d'attaque, et ne remplace pas un test d'intrusion professionnel.

Comment Agent Warden teste-t-il que les correctifs fonctionnent ?

Il génère un plan de red-team avec des outils publics établis (Promptfoo, Garak, PyRIT) pour ton propre système — un régime en 4 couches que tu branches en CI comme régression. Les correctifs sont ainsi prouvés, pas seulement affirmés.

Agent Warden couvre-t-il les obligations d'étiquetage IA (EU AI Act) ?

Non, c'est un autre chantier — sur skills-for-ai, c'est le skill KI-Transparenz (transparence IA) qui s'en charge. Agent Warden couvre la sécurité technique (injection de prompt, durcissement des agents), pas les obligations de divulgation/étiquetage.

Avec quels outils d’IA Agent Warden fonctionne-t-il ?

Claude · ChatGPT/Codex · Cursor · Copilot · Gemini CLI · Windsurf · Cline

Comment utiliser Agent Warden ?

Agent Warden est un SKILL.md au standard ouvert agentskills.io : installez-le en une commande (npx) ou téléchargez-le et ajoutez-le à votre outil d’IA — Claude (Projects), ChatGPT (Custom GPT), Cursor, Copilot, Gemini CLI, etc. Aucun code requis.