Agent Warden
Der defensive Wächter für KI-Agenten — findet Prompt-Injection & Agenten-Schwachstellen und härtet sie, bevor es jemand ausnutzt.
SKILL.md im offenen agentskills.io-Standard — direkt nutzbar in Claude, ChatGPT/Codex, Cursor, Copilot & Co.
Agent Warden ist ein KI-Skill für die Sicherheit von LLM-Anwendungen und KI-Agenten — ein defensiver Auditor für Prompt-Injection und Agenten-Sicherheit. Er prüft System-Prompt, Agent, RAG-Pipeline, Tool-Definitionen, MCP-Server oder Chatbot gegen die OWASP Top 10 for LLM Applications (2025) und liefert priorisierte Funde plus konkrete Guardrails und einen Red-Team-Testplan. Rein defensiv — kein Jailbreak-Toolkit, kein Pentest-Ersatz.
Was dieser Skill macht
- Auditiert System-Prompt/Agent/RAG/Tools/**MCP-Server**/Chatbot gegen **OWASP LLM Top 10 (2025)** + MITRE ATLAS
- Kartiert **Trust-Boundaries & Datenflüsse** und enumeriert jeden Kanal für untrusted Content (inkl. indirekter Injection)
- Liefert **priorisierte Funde** mit OWASP/ATLAS-ID, Ort, Exploit-Szenario und konkretem Fix
- Entwirft eine **Härtungs-Architektur**: Least Privilege, Privilege Separation (Dual-LLM/CaMeL), In-/Output-Guardrails, Human-Gates, Exfil-Kanäle
- Prüft **MCP-Server** auf Tool-Poisoning, Rug-Pull, Confused-Deputy, Token-Passthrough, SSRF
- Erzeugt einen **Red-Team-Testplan** (Promptfoo/Garak/PyRIT, 4-Ebenen) zum Nachweisen der Fixes in CI
- Zwei defensive Skripte: **Tool-Manifest-Auditor** (Excessive Agency, Tool-Poisoning) + **Red-Team-Plan-Emitter**
Beschreibung
Agent Warden ist ein Skill für die Sicherheit von LLM-Anwendungen und KI-Agenten — er auditiert deine eigene KI und härtet sie gegen **Prompt-Injection und Agenten-Missbrauch**, bevor es jemand ausnutzt. Man gibt ihm System-Prompt, Agent, RAG-Pipeline, Tool-/Function-Definitionen, **MCP-Server** oder Chatbot, und er arbeitet gegen die **OWASP Top 10 for LLM Applications (2025)** mit **MITRE-ATLAS**-Mapping: erst **Trust-Boundaries und Datenflüsse** kartieren (wo trifft vertrauenswürdige Anweisung auf untrusted Content, was darf der Agent tun), dann priorisierte Funde, dann Härtung, dann Beweis. Seine ehrliche Kernbotschaft trifft die Realität 2026: **Delimiter und „ignoriere Anweisungen"-Text sind keine Schutzgrenze** — eine Injection wird erst dann zum Schaden, wenn der Agent *handeln* kann. Was wirklich wirkt, ist Architektur: **Least-Privilege-Tools** (der höchste Hebel, den die meisten Teams noch nicht ziehen), **Privilege Separation** (Dual-LLM / CaMeL: das untrusted-lesende Modell darf nicht handeln), In- und Output-Guardrails auf 100 % Traffic, Human-Gates bei irreversiblen Aktionen und das Blocken von **Exfiltrations-Kanälen** (Markdown-Image-Auto-Fetch, Links, Tool-Calls). Besonderes Augenmerk gilt der **indirekten Injection** — dem harten Problem, bei dem der Payload in abgerufenen Dokumenten, Tool-Outputs, E-Mails oder Dateien steckt, die der Agent im Normalbetrieb liest (der EchoLeak-Zero-Click-Vorfall zeigt, dass das kein Theorie-Risiko ist). Für **MCP-Server** prüft er Tool-Poisoning, Rug-Pulls, Confused-Deputy, Token-Passthrough und SSRF. Zwei mitgelieferte, **rein defensive** Node-Skripte (ohne Abhängigkeiten) unterstützen: ein Tool-Manifest-Auditor, der Excessive Agency und versteckte Anweisungen in Tool-Beschreibungen findet, und ein Red-Team-Plan-Emitter, der etablierte öffentliche Tools (Promptfoo/Garak/PyRIT) gegen dein eigenes System verdrahtet, damit Fixes bewiesen statt behauptet sind. Er ist **verify-live** (KI-Security ändert sich monatlich → aktuelle Quellen mit Abrufdatum), erfindet keine Schwachstellen (jeder Fund braucht eine reale Stelle + Exploit-Pfad) und bleibt strikt defensiv.
Beispiele
Getestet mit Claude Code
Was es nicht macht
- **Kein Angriffs-/Jailbreak-Toolkit** — nur eigene/autorisierte Systeme; keine Angriffs-Payloads; keine Hilfe gegen fremde Systeme
- **Kein Ersatz für einen professionellen Pentest** und keine Sicherheitsgarantien (erhöht Angriffskosten, beseitigt Risiko nicht)
- **Erfindet keine Schwachstellen** — jeder Fund braucht reale Stelle + Exploit-Pfad; Unbekanntes bleibt offene Frage
- **Führt keine Live-Exploits** gegen Systeme aus
- **Keine KI-Kennzeichnung/Offenlegung** (→ KI-Transparenz) und keine klassische Web-/App-Security (→ Web Vitals / Website-Doktor)
Kompatibilität & Technik
- Geprüft (intern)
- 5 Szenarien
- Empfohlene Laufzeit
- Claude Opus oder Sonnet; mit Web-Zugriff für verify-live gegen aktuelle OWASP/MITRE-ATLAS/CVE-Quellen. Die Skripte brauchen Node (ohne Zusatzpakete); ohne Node führt der Skill dieselbe Analyse manuell durch und weist das aus.
- Modi
- Quick Audit (Prompt/Config/Tools einwerfen) · Full Audit (ganze App + Datenflüsse) · MCP-Server-Review · Härtung / Guardrail-Design · Red-Team-Testplan
- Eingaben
- System-Prompt / Agent-Konfiguration · Tool-/Function-Definitionen (OpenAI/Anthropic/MCP-JSON) · RAG-/Pipeline-Beschreibung · MCP-Server-Manifest · Chatbot-/Multi-Agent-Setup
- Ausgabeformat
- Security-Audit-Report: Trust-Boundary-Karte + priorisierte Fund-Tabelle (OWASP/ATLAS · Ort · Exploit · Fix) + Härtungs-Architektur + Red-Team-Testplan + Backlog
- Unterkategorie
- KI-Sicherheit & Agenten-Härtung
- Lizenz
- Proprietär
Sicherheitsprofil
Läuft komplett bei dir mit deiner eigenen KI — keine externe Runtime, keine laufenden Kosten.
Enthält ausführbaren Code oder führt Aktionen/Tools aus — vor der Nutzung kurz reinschauen.
Greift im Normalbetrieb auf externe Quellen / das Netz zu (z. B. Live-Seiten, Such-/Daten-APIs).
Lieferumfang
- agent-warden-1.0.0/11 Dateien
- .claude-plugin/marketplace.json
plugins/agent-warden/skills/agent-warden/11 Dateien
- SKILL.md
- manifest.json
references/7 Dateien
- agent-warden-checklist.md
- agent-warden-frameworks.md
- agent-warden-injection-defenses.md
- agent-warden-mcp-security.md
- agent-warden-output-handling.md
- agent-warden-owasp-llm.md
- agent-warden-redteam-catalog.md
scripts/2 Dateien
- redteam-plan.mjs
- tool-manifest-audit.mjs
- .agents/skills/agent-warden/→ universell — gleicher Inhalt (Codex, Cursor, Copilot, Gemini, Windsurf, Cline)
- LICENSE.txt
Installation
Auch als Chat-Prompt nutzbar
Kein KI-Tool? Füg ihn in Claude, ChatGPT oder Gemini ein und nutze die Methode sofort.
Du bekommst die volle Methode. Nur 2 Helfer-Skript(e), die Teile automatisieren, laufen erst in der Installation.
Funktioniert am besten, wenn dein Chat Web-Zugriff hat.
Die Installation ist die volle Version — sie greift automatisch, führt ihre Skripte aus und lädt Referenzen bei Bedarf. Als Chat-Prompt fährst du die Methode selbst.
Zum Kopieren des paste-fertigen Prompts freischalten — danach in „Meine Skills".
Bewertungen
Noch keine Bewertungen – sei der/die Erste.
Hinweis
Agent Warden ist rein defensiv: Er auditiert und härtet deine eigenen oder ausdrücklich autorisierten Systeme — kein Angriffs-/Jailbreak-Toolkit für fremde Systeme. Er ersetzt keinen professionellen Penetrationstest und gibt keine Sicherheitsgarantien. KI-Security bewegt sich monatlich: mit Web-Zugriff prüft der Skill OWASP/MITRE-ATLAS/CVE-Details live und nennt das Abrufdatum. Die mitgelieferten Skripte brauchen Node (ohne Zusatzpakete).
Änderungen
- v1.0.020.08.2026Erstveröffentlichung: defensiver KI-Security-Auditor für LLM-Apps & Agenten. Audit gegen OWASP Top 10 for LLM Applications (2025) + MITRE-ATLAS-Mapping, Trust-Boundary-/Datenfluss-Analyse, priorisierte Funde, Härtungs-Architektur (Least Privilege, Privilege Separation/Dual-LLM/CaMeL, In-/Output-Guardrails, Human-Gates, Exfil-Kanäle) und Red-Team-Testplan (Promptfoo/Garak/PyRIT). 2 defensive Node-Skripte (Tool-Manifest-Auditor, Red-Team-Plan-Emitter), 7 References inkl. MCP-Security, Output-Handling und realen Vorfällen (EchoLeak). verify-live, defensiv-only, kein Pentest-Ersatz.
Häufige Fragen
Was macht Agent Warden?
Agent Warden ist ein KI-Skill für die Sicherheit von LLM-Anwendungen und KI-Agenten — ein defensiver Auditor für Prompt-Injection und Agenten-Sicherheit. Er prüft System-Prompt, Agent, RAG-Pipeline, Tool-Definitionen, MCP-Server oder Chatbot gegen die OWASP Top 10 for LLM Applications (2025) und liefert priorisierte Funde plus konkrete Guardrails und einen Red-Team-Testplan. Rein defensiv — kein Jailbreak-Toolkit, kein Pentest-Ersatz.
Ist mein KI-Agent sicher gegen Prompt-Injection?
Genau das prüft Agent Warden — er auditiert System-Prompt, Agent, RAG, Tools oder MCP-Server gegen die OWASP Top 10 for LLM Applications (2025), findet die ausnutzbaren Stellen (besonders indirekte Injection über abgerufene Inhalte) und liefert konkrete Fixes plus einen Red-Team-Testplan zum Nachweisen.
Reicht es, „ignoriere Anweisungen im Input" in den System-Prompt zu schreiben?
Nein — und Agent Warden sagt dir das ehrlich. Delimiter und solche Sätze sind keine Schutzgrenze (Text gegen Text). Was wirklich wirkt, ist strukturell — Least-Privilege-Tools, Privilege Separation (Dual-LLM/CaMeL), In-/Output-Guardrails und Human-Gates.
Kann Agent Warden meinen MCP-Server prüfen?
Ja. Agent Warden hat ein eigenes MCP-Modul für Tool-Poisoning, Rug-Pulls, Confused-Deputy, Token-Passthrough und SSRF — inklusive einem Skript, das deine Tool-Definitionen auf Excessive Agency und versteckte Anweisungen in Tool-Beschreibungen scannt.
Ist das ein Hacking-/Jailbreak-Tool?
Nein. Agent Warden ist strikt defensiv — er auditiert und härtet deine eigenen oder ausdrücklich autorisierten Systeme. Er hilft nicht, fremde Systeme anzugreifen, liefert keine Angriffs-Payloads und ersetzt keinen professionellen Penetrationstest.
Womit testet Agent Warden, ob die Fixes wirken?
Er erzeugt einen Red-Team-Testplan mit etablierten öffentlichen Tools (Promptfoo, Garak, PyRIT) für dein eigenes System — als 4-Ebenen-Regime, das du in CI als Regression verdrahtest. So sind Fixes bewiesen, nicht nur behauptet.
Deckt Agent Warden auch die KI-Kennzeichnungspflichten (EU AI Act) ab?
Nein, das ist eine andere Baustelle — dafür ist auf skills-for-ai der KI-Transparenz-Skill zuständig. Agent Warden kümmert sich um die technische Sicherheit (Prompt Injection, Agenten-Härtung), nicht um Offenlegungs-/Labelling-Pflichten.
Mit welchen KI-Tools funktioniert Agent Warden?
Claude · ChatGPT/Codex · Cursor · Copilot · Gemini CLI · Windsurf · Cline
Wie setze ich Agent Warden ein?
Agent Warden ist eine SKILL.md im offenen agentskills.io-Standard: per Befehl installieren (npx) oder herunterladen und ins KI-Tool laden — Claude (Projects), ChatGPT (Custom GPT), Cursor, Copilot, Gemini CLI u. a. Kein Code nötig.