Entwicklung Business Skill

Agent Warden

Der defensive Wächter für KI-Agenten — findet Prompt-Injection & Agenten-Schwachstellen und härtet sie, bevor es jemand ausnutzt.

KI-SicherheitPrompt InjectionOWASPAgenten-SicherheitRed TeamingGuardrailsMCPBedrohungsmodellLLM-SicherheitDatenexfiltration
Kostenlos
0 0 v1.0.0 Aktualisiert 20.08.2026 von skills-for-ai

SKILL.md im offenen agentskills.io-Standard — direkt nutzbar in Claude, ChatGPT/Codex, Cursor, Copilot & Co.

Agent Warden ist ein KI-Skill für die Sicherheit von LLM-Anwendungen und KI-Agenten — ein defensiver Auditor für Prompt-Injection und Agenten-Sicherheit. Er prüft System-Prompt, Agent, RAG-Pipeline, Tool-Definitionen, MCP-Server oder Chatbot gegen die OWASP Top 10 for LLM Applications (2025) und liefert priorisierte Funde plus konkrete Guardrails und einen Red-Team-Testplan. Rein defensiv — kein Jailbreak-Toolkit, kein Pentest-Ersatz.

Was dieser Skill macht

  • Auditiert System-Prompt/Agent/RAG/Tools/**MCP-Server**/Chatbot gegen **OWASP LLM Top 10 (2025)** + MITRE ATLAS
  • Kartiert **Trust-Boundaries & Datenflüsse** und enumeriert jeden Kanal für untrusted Content (inkl. indirekter Injection)
  • Liefert **priorisierte Funde** mit OWASP/ATLAS-ID, Ort, Exploit-Szenario und konkretem Fix
  • Entwirft eine **Härtungs-Architektur**: Least Privilege, Privilege Separation (Dual-LLM/CaMeL), In-/Output-Guardrails, Human-Gates, Exfil-Kanäle
  • Prüft **MCP-Server** auf Tool-Poisoning, Rug-Pull, Confused-Deputy, Token-Passthrough, SSRF
  • Erzeugt einen **Red-Team-Testplan** (Promptfoo/Garak/PyRIT, 4-Ebenen) zum Nachweisen der Fixes in CI
  • Zwei defensive Skripte: **Tool-Manifest-Auditor** (Excessive Agency, Tool-Poisoning) + **Red-Team-Plan-Emitter**

Beschreibung

Agent Warden ist ein Skill für die Sicherheit von LLM-Anwendungen und KI-Agenten — er auditiert deine eigene KI und härtet sie gegen **Prompt-Injection und Agenten-Missbrauch**, bevor es jemand ausnutzt. Man gibt ihm System-Prompt, Agent, RAG-Pipeline, Tool-/Function-Definitionen, **MCP-Server** oder Chatbot, und er arbeitet gegen die **OWASP Top 10 for LLM Applications (2025)** mit **MITRE-ATLAS**-Mapping: erst **Trust-Boundaries und Datenflüsse** kartieren (wo trifft vertrauenswürdige Anweisung auf untrusted Content, was darf der Agent tun), dann priorisierte Funde, dann Härtung, dann Beweis. Seine ehrliche Kernbotschaft trifft die Realität 2026: **Delimiter und „ignoriere Anweisungen"-Text sind keine Schutzgrenze** — eine Injection wird erst dann zum Schaden, wenn der Agent *handeln* kann. Was wirklich wirkt, ist Architektur: **Least-Privilege-Tools** (der höchste Hebel, den die meisten Teams noch nicht ziehen), **Privilege Separation** (Dual-LLM / CaMeL: das untrusted-lesende Modell darf nicht handeln), In- und Output-Guardrails auf 100 % Traffic, Human-Gates bei irreversiblen Aktionen und das Blocken von **Exfiltrations-Kanälen** (Markdown-Image-Auto-Fetch, Links, Tool-Calls). Besonderes Augenmerk gilt der **indirekten Injection** — dem harten Problem, bei dem der Payload in abgerufenen Dokumenten, Tool-Outputs, E-Mails oder Dateien steckt, die der Agent im Normalbetrieb liest (der EchoLeak-Zero-Click-Vorfall zeigt, dass das kein Theorie-Risiko ist). Für **MCP-Server** prüft er Tool-Poisoning, Rug-Pulls, Confused-Deputy, Token-Passthrough und SSRF. Zwei mitgelieferte, **rein defensive** Node-Skripte (ohne Abhängigkeiten) unterstützen: ein Tool-Manifest-Auditor, der Excessive Agency und versteckte Anweisungen in Tool-Beschreibungen findet, und ein Red-Team-Plan-Emitter, der etablierte öffentliche Tools (Promptfoo/Garak/PyRIT) gegen dein eigenes System verdrahtet, damit Fixes bewiesen statt behauptet sind. Er ist **verify-live** (KI-Security ändert sich monatlich → aktuelle Quellen mit Abrufdatum), erfindet keine Schwachstellen (jeder Fund braucht eine reale Stelle + Exploit-Pfad) und bleibt strikt defensiv.

Beispiele

Getestet mit Claude Code

Was es nicht macht

  • **Kein Angriffs-/Jailbreak-Toolkit** — nur eigene/autorisierte Systeme; keine Angriffs-Payloads; keine Hilfe gegen fremde Systeme
  • **Kein Ersatz für einen professionellen Pentest** und keine Sicherheitsgarantien (erhöht Angriffskosten, beseitigt Risiko nicht)
  • **Erfindet keine Schwachstellen** — jeder Fund braucht reale Stelle + Exploit-Pfad; Unbekanntes bleibt offene Frage
  • **Führt keine Live-Exploits** gegen Systeme aus
  • **Keine KI-Kennzeichnung/Offenlegung** (→ KI-Transparenz) und keine klassische Web-/App-Security (→ Web Vitals / Website-Doktor)

Kompatibilität & Technik

ClaudeChatGPT/CodexCursorCopilotGemini CLIWindsurfCline
Geprüft (intern)
5 Szenarien
Empfohlene Laufzeit
Claude Opus oder Sonnet; mit Web-Zugriff für verify-live gegen aktuelle OWASP/MITRE-ATLAS/CVE-Quellen. Die Skripte brauchen Node (ohne Zusatzpakete); ohne Node führt der Skill dieselbe Analyse manuell durch und weist das aus.
Modi
Quick Audit (Prompt/Config/Tools einwerfen) · Full Audit (ganze App + Datenflüsse) · MCP-Server-Review · Härtung / Guardrail-Design · Red-Team-Testplan
Eingaben
System-Prompt / Agent-Konfiguration · Tool-/Function-Definitionen (OpenAI/Anthropic/MCP-JSON) · RAG-/Pipeline-Beschreibung · MCP-Server-Manifest · Chatbot-/Multi-Agent-Setup
Ausgabeformat
Security-Audit-Report: Trust-Boundary-Karte + priorisierte Fund-Tabelle (OWASP/ATLAS · Ort · Exploit · Fix) + Härtungs-Architektur + Red-Team-Testplan + Backlog
Unterkategorie
KI-Sicherheit & Agenten-Härtung
Lizenz
Proprietär

Sicherheitsprofil

Lokal

Läuft komplett bei dir mit deiner eigenen KI — keine externe Runtime, keine laufenden Kosten.

Enthält Skripte

Enthält ausführbaren Code oder führt Aktionen/Tools aus — vor der Nutzung kurz reinschauen.

Netzzugriff

Greift im Normalbetrieb auf externe Quellen / das Netz zu (z. B. Live-Seiten, Such-/Daten-APIs).

Was bedeuten diese Badges? →

Lieferumfang

  • agent-warden-1.0.0/11 Dateien
    • .claude-plugin/marketplace.json
    • plugins/agent-warden/skills/agent-warden/11 Dateien
      • SKILL.md
      • manifest.json
      • references/7 Dateien
        • agent-warden-checklist.md
        • agent-warden-frameworks.md
        • agent-warden-injection-defenses.md
        • agent-warden-mcp-security.md
        • agent-warden-output-handling.md
        • agent-warden-owasp-llm.md
        • agent-warden-redteam-catalog.md
      • scripts/2 Dateien
        • redteam-plan.mjs
        • tool-manifest-audit.mjs
    • .agents/skills/agent-warden/→ universell — gleicher Inhalt (Codex, Cursor, Copilot, Gemini, Windsurf, Cline)
    • LICENSE.txt

Installation

Nach dem Freischalten installierst du mit einem Befehl — erkennt dein KI-Tool automatisch.

Läuft inClaude CodeGitHub CopilotGemini CLICursorCodex CLIWindsurfCline

Auch als Chat-Prompt nutzbar

Methode im Chat

Kein KI-Tool? Füg ihn in Claude, ChatGPT oder Gemini ein und nutze die Methode sofort.

Du bekommst die volle Methode. Nur 2 Helfer-Skript(e), die Teile automatisieren, laufen erst in der Installation.

Funktioniert am besten, wenn dein Chat Web-Zugriff hat.

Die Installation ist die volle Version — sie greift automatisch, führt ihre Skripte aus und lädt Referenzen bei Bedarf. Als Chat-Prompt fährst du die Methode selbst.

Zum Kopieren des paste-fertigen Prompts freischalten — danach in „Meine Skills".

Bewertungen

Noch keine Bewertungen – sei der/die Erste.

Hinweis

Agent Warden ist rein defensiv: Er auditiert und härtet deine eigenen oder ausdrücklich autorisierten Systeme — kein Angriffs-/Jailbreak-Toolkit für fremde Systeme. Er ersetzt keinen professionellen Penetrationstest und gibt keine Sicherheitsgarantien. KI-Security bewegt sich monatlich: mit Web-Zugriff prüft der Skill OWASP/MITRE-ATLAS/CVE-Details live und nennt das Abrufdatum. Die mitgelieferten Skripte brauchen Node (ohne Zusatzpakete).

Änderungen

  • v1.0.020.08.2026Erstveröffentlichung: defensiver KI-Security-Auditor für LLM-Apps & Agenten. Audit gegen OWASP Top 10 for LLM Applications (2025) + MITRE-ATLAS-Mapping, Trust-Boundary-/Datenfluss-Analyse, priorisierte Funde, Härtungs-Architektur (Least Privilege, Privilege Separation/Dual-LLM/CaMeL, In-/Output-Guardrails, Human-Gates, Exfil-Kanäle) und Red-Team-Testplan (Promptfoo/Garak/PyRIT). 2 defensive Node-Skripte (Tool-Manifest-Auditor, Red-Team-Plan-Emitter), 7 References inkl. MCP-Security, Output-Handling und realen Vorfällen (EchoLeak). verify-live, defensiv-only, kein Pentest-Ersatz.

Häufige Fragen

Was macht Agent Warden?

Agent Warden ist ein KI-Skill für die Sicherheit von LLM-Anwendungen und KI-Agenten — ein defensiver Auditor für Prompt-Injection und Agenten-Sicherheit. Er prüft System-Prompt, Agent, RAG-Pipeline, Tool-Definitionen, MCP-Server oder Chatbot gegen die OWASP Top 10 for LLM Applications (2025) und liefert priorisierte Funde plus konkrete Guardrails und einen Red-Team-Testplan. Rein defensiv — kein Jailbreak-Toolkit, kein Pentest-Ersatz.

Ist mein KI-Agent sicher gegen Prompt-Injection?

Genau das prüft Agent Warden — er auditiert System-Prompt, Agent, RAG, Tools oder MCP-Server gegen die OWASP Top 10 for LLM Applications (2025), findet die ausnutzbaren Stellen (besonders indirekte Injection über abgerufene Inhalte) und liefert konkrete Fixes plus einen Red-Team-Testplan zum Nachweisen.

Reicht es, „ignoriere Anweisungen im Input" in den System-Prompt zu schreiben?

Nein — und Agent Warden sagt dir das ehrlich. Delimiter und solche Sätze sind keine Schutzgrenze (Text gegen Text). Was wirklich wirkt, ist strukturell — Least-Privilege-Tools, Privilege Separation (Dual-LLM/CaMeL), In-/Output-Guardrails und Human-Gates.

Kann Agent Warden meinen MCP-Server prüfen?

Ja. Agent Warden hat ein eigenes MCP-Modul für Tool-Poisoning, Rug-Pulls, Confused-Deputy, Token-Passthrough und SSRF — inklusive einem Skript, das deine Tool-Definitionen auf Excessive Agency und versteckte Anweisungen in Tool-Beschreibungen scannt.

Ist das ein Hacking-/Jailbreak-Tool?

Nein. Agent Warden ist strikt defensiv — er auditiert und härtet deine eigenen oder ausdrücklich autorisierten Systeme. Er hilft nicht, fremde Systeme anzugreifen, liefert keine Angriffs-Payloads und ersetzt keinen professionellen Penetrationstest.

Womit testet Agent Warden, ob die Fixes wirken?

Er erzeugt einen Red-Team-Testplan mit etablierten öffentlichen Tools (Promptfoo, Garak, PyRIT) für dein eigenes System — als 4-Ebenen-Regime, das du in CI als Regression verdrahtest. So sind Fixes bewiesen, nicht nur behauptet.

Deckt Agent Warden auch die KI-Kennzeichnungspflichten (EU AI Act) ab?

Nein, das ist eine andere Baustelle — dafür ist auf skills-for-ai der KI-Transparenz-Skill zuständig. Agent Warden kümmert sich um die technische Sicherheit (Prompt Injection, Agenten-Härtung), nicht um Offenlegungs-/Labelling-Pflichten.

Mit welchen KI-Tools funktioniert Agent Warden?

Claude · ChatGPT/Codex · Cursor · Copilot · Gemini CLI · Windsurf · Cline

Wie setze ich Agent Warden ein?

Agent Warden ist eine SKILL.md im offenen agentskills.io-Standard: per Befehl installieren (npx) oder herunterladen und ins KI-Tool laden — Claude (Projects), ChatGPT (Custom GPT), Cursor, Copilot, Gemini CLI u. a. Kein Code nötig.