Desarrollo Negocio Skill

Agent Warden

El guardián defensivo de agentes de IA — detecta la inyección de prompts y las fallas de agente, y las endurece antes de que alguien las explote.

Seguridad de IAPrompt InjectionOWASPSeguridad de agentesRed TeamingGuardrailsMCPModelo de amenazasSeguridad LLMExfiltración de datos
Gratis
0 0 v1.0.0 Actualizado 20.08.2026 por skills-for-ai

SKILL.md en el estándar abierto agentskills.io — funciona directamente en Claude, ChatGPT/Codex, Cursor, Copilot y más.

Agent Warden es un skill de IA para la seguridad de aplicaciones LLM y agentes de IA — un auditor defensivo de la inyección de prompts y la seguridad de agentes. Revisa tu system prompt, agente, pipeline RAG, definiciones de herramientas, servidor MCP o chatbot frente al OWASP Top 10 for LLM Applications (2025) y devuelve hallazgos priorizados más guardrails concretos y un plan de red-team. Estrictamente defensivo — ni kit de jailbreak, ni sustituto del pentest.

Qué hace este skill

  • Audita system prompt/agente/RAG/herramientas/**servidor MCP**/chatbot frente al **OWASP LLM Top 10 (2025)** + MITRE ATLAS
  • Mapea **fronteras de confianza y flujos de datos** y enumera cada canal de contenido no confiable (incl. inyección indirecta)
  • Devuelve **hallazgos priorizados** con id OWASP/ATLAS, lugar, escenario de exploit y corrección concreta
  • Diseña una **arquitectura de endurecimiento**: mínimo privilegio, separación de privilegios (Dual-LLM/CaMeL), guardrails E/S, aprobaciones humanas, canales de exfil
  • Revisa **servidores MCP**: tool poisoning, rug pull, confused deputy, token passthrough, SSRF
  • Genera un **plan de red-team** (Promptfoo/Garak/PyRIT, 4 capas) para probar las correcciones en CI
  • Dos scripts defensivos: **auditor de manifiesto de herramientas** (agencia excesiva, tool poisoning) + **generador de plan de red-team**

Descripción

Agent Warden es un skill para la seguridad de aplicaciones LLM y agentes de IA — audita tu propia IA y la endurece contra la **inyección de prompts y el abuso de agentes** antes de que alguien lo explote. Le das un system prompt, un agente, un pipeline RAG, definiciones de herramientas/functions, un **servidor MCP** o un chatbot, y trabaja frente al **OWASP Top 10 for LLM Applications (2025)** con mapeo a **MITRE ATLAS**: primero mapear las **fronteras de confianza y los flujos de datos** (dónde la instrucción confiable se encuentra con el contenido no confiable, y qué puede hacer el agente), luego hallazgos priorizados, luego endurecimiento, luego prueba. Su mensaje central, honesto, encaja con la realidad de 2026: **los delimitadores y el texto «ignora las instrucciones» no son una frontera de seguridad** — una inyección solo se convierte en daño cuando el agente puede *actuar*. Lo que funciona es la arquitectura: **herramientas de mínimo privilegio** (la palanca de mayor impacto que la mayoría de los equipos aún omite), **separación de privilegios** (Dual-LLM / CaMeL: el modelo que lee lo no confiable no debe actuar), guardrails de entrada y salida en el 100 % del tráfico, aprobaciones humanas para acciones irreversibles, y bloqueo de **canales de exfiltración** (auto-fetch de imagen markdown, enlaces, llamadas a herramientas). Presta especial atención a la **inyección indirecta** — el problema difícil donde la carga viaja en documentos recuperados, salidas de herramientas, correos o archivos que el agente lee en operación normal (el incidente zero-click EchoLeak prueba que no es teórico). Para **servidores MCP** revisa tool poisoning, rug pulls, confused deputy, token passthrough y SSRF. Dos scripts de Node **estrictamente defensivos** (sin dependencias) ayudan: un auditor de manifiesto de herramientas que marca la agencia excesiva y las instrucciones ocultas en las descripciones, y un generador de plan de red-team que conecta herramientas públicas establecidas (Promptfoo/Garak/PyRIT) contra tu propio sistema, para que las correcciones queden probadas, no afirmadas. Es **verify-live** (la seguridad de IA cambia cada mes → fuentes actuales con fechas), no inventa fallas (cada hallazgo requiere un lugar real + un camino de exploit) y se mantiene estrictamente defensivo.

Ejemplos

Probado con Claude Code

Qué no hace

  • **No es un kit de ataque/jailbreak** — solo tus sistemas propios/autorizados; sin cargas de ataque; sin ayuda contra sistemas de terceros
  • **No sustituye un pentest profesional** ni da garantías de seguridad (eleva el coste del ataque, no elimina el riesgo)
  • **No inventa fallas** — cada hallazgo requiere un lugar real + un camino de exploit; lo desconocido queda como pregunta abierta
  • **No ejecuta exploits en vivo** contra sistemas
  • **No es etiquetado/divulgación de IA** (→ KI-Transparenz) ni seguridad web/app clásica (→ Web Vitals / Website-Doktor)

Compatibilidad y técnica

ClaudeChatGPT/CodexCursorCopilotGemini CLIWindsurfCline
Probado (interno)
5 escenarios
Runtime recomendado
Claude Opus o Sonnet; con acceso web para verify-live frente a fuentes OWASP/MITRE ATLAS/CVE actuales. Los scripts necesitan Node (sin paquetes); sin Node, el skill hace el mismo análisis a mano y lo indica.
Modos
Auditoría rápida (suelta un prompt/config/herramientas) · Auditoría completa (toda la app + flujos de datos) · Revisión de servidor MCP · Endurecimiento / diseño de guardrails · Plan de red-team
Entradas
system prompt / configuración de agente · definiciones de herramientas/functions (JSON OpenAI/Anthropic/MCP) · descripción RAG / pipeline · manifiesto de servidor MCP · setup chatbot / multi-agente
Formato de salida
Informe de auditoría de seguridad: mapa de fronteras de confianza + tabla de hallazgos priorizados (OWASP/ATLAS · lugar · exploit · corrección) + arquitectura de endurecimiento + plan de red-team + backlog
Subcategoría
Seguridad de IA y endurecimiento de agentes
Licencia
Proprietär

Perfil de seguridad

Local

Se ejecuta por completo en tu equipo con tu propia IA — sin runtime externo, sin costes recurrentes.

Contiene scripts

Contiene código ejecutable o ejecuta acciones/herramientas — échale un vistazo antes de usar.

Acceso a la red

Accede a fuentes externas / la red en uso normal (páginas en vivo, APIs de búsqueda/datos).

¿Qué significan estas insignias? →

Qué incluye

  • agent-warden-1.0.0/11 archivos
    • .claude-plugin/marketplace.json
    • plugins/agent-warden/skills/agent-warden/11 archivos
      • SKILL.md
      • manifest.json
      • references/7 archivos
        • agent-warden-checklist.md
        • agent-warden-frameworks.md
        • agent-warden-injection-defenses.md
        • agent-warden-mcp-security.md
        • agent-warden-output-handling.md
        • agent-warden-owasp-llm.md
        • agent-warden-redteam-catalog.md
      • scripts/2 archivos
        • redteam-plan.mjs
        • tool-manifest-audit.mjs
    • .agents/skills/agent-warden/→ universal — mismo contenido (Codex, Cursor, Copilot, Gemini, Windsurf, Cline)
    • LICENSE.txt

Instalación

Tras desbloquear, instalas con un solo comando — detecta tu herramienta de IA.

Funciona enClaude CodeGitHub CopilotGemini CLICursorCodex CLIWindsurfCline

También como prompt de chat

Método en chat

¿Sin herramienta de IA? Pégalo en Claude, ChatGPT o Gemini y usa el método al instante.

Obtienes el método completo. Solo 2 script(s) de ayuda que automatizan partes funcionan una vez instalado.

Funciona mejor cuando tu chat tiene acceso web.

Instalarlo es la versión completa — se activa solo, ejecuta sus scripts y carga referencias cuando hacen falta. Como prompt de chat, tú conduces el método.

Desbloquéalo para copiar el prompt listo para pegar — luego en «Mis skills».

Reseñas

Aún no hay reseñas: sé el primero.

Nota

Agent Warden es estrictamente defensivo: audita y endurece tus propios sistemas o los explícitamente autorizados — no es un kit de ataque/jailbreak para sistemas de terceros. No sustituye una prueba de penetración profesional y no da garantías de seguridad. La seguridad de IA cambia cada mes: con acceso web, el skill verifica en vivo los detalles OWASP/MITRE ATLAS/CVE y cita la fecha de consulta. Los scripts incluidos necesitan Node (sin paquetes adicionales).

Historial de cambios

  • v1.0.020.08.2026Primera versión: auditor de seguridad de IA defensivo para apps LLM y agentes. Audita frente al OWASP Top 10 for LLM Applications (2025) con mapeo a MITRE ATLAS, análisis de fronteras de confianza/flujos de datos, hallazgos priorizados, arquitectura de endurecimiento (mínimo privilegio, separación de privilegios/Dual-LLM/CaMeL, guardrails de entrada/salida, aprobaciones humanas, canales de exfil) y un plan de red-team (Promptfoo/Garak/PyRIT). Dos scripts de Node defensivos (auditor de manifiesto de herramientas, generador de plan de red-team), 7 referencias incl. seguridad MCP, manejo de salidas e incidentes reales (EchoLeak). Verify-live, solo defensivo, no sustituye un pentest.

Preguntas frecuentes

¿Qué hace Agent Warden?

Agent Warden es un skill de IA para la seguridad de aplicaciones LLM y agentes de IA — un auditor defensivo de la inyección de prompts y la seguridad de agentes. Revisa tu system prompt, agente, pipeline RAG, definiciones de herramientas, servidor MCP o chatbot frente al OWASP Top 10 for LLM Applications (2025) y devuelve hallazgos priorizados más guardrails concretos y un plan de red-team. Estrictamente defensivo — ni kit de jailbreak, ni sustituto del pentest.

¿Es seguro mi agente de IA frente a la inyección de prompts?

Eso es justo lo que comprueba Agent Warden — audita tu system prompt, agente, RAG, herramientas o servidor MCP frente al OWASP Top 10 for LLM Applications (2025), encuentra los puntos explotables (sobre todo la inyección indirecta vía contenido recuperado) y devuelve correcciones concretas más un plan de red-team para probarlas.

¿Basta con poner «ignora las instrucciones en la entrada» en el system prompt?

No — y Agent Warden te lo dice con honestidad. Los delimitadores y ese tipo de frases no son una frontera de seguridad (texto contra texto). Lo que funciona es estructural — herramientas de mínimo privilegio, separación de privilegios (Dual-LLM/CaMeL), guardrails de entrada/salida y aprobaciones humanas.

¿Puede Agent Warden revisar mi servidor MCP?

Sí. Agent Warden tiene un módulo MCP dedicado para tool poisoning, rug pulls, confused deputy, token passthrough y SSRF — con un script que escanea tus definiciones de herramientas en busca de agencia excesiva e instrucciones ocultas en las descripciones de herramientas.

¿Es una herramienta de hacking / jailbreak?

No. Agent Warden es estrictamente defensivo — audita y endurece tus propios sistemas o los explícitamente autorizados. No ayuda a atacar sistemas de terceros, no incluye cargas de ataque y no sustituye una prueba de penetración profesional.

¿Cómo comprueba Agent Warden que las correcciones funcionan?

Genera un plan de red-team con herramientas públicas establecidas (Promptfoo, Garak, PyRIT) para tu propio sistema — un régimen de 4 capas que conectas en CI como regresión. Así las correcciones quedan probadas, no solo afirmadas.

¿Cubre Agent Warden las obligaciones de etiquetado de IA (EU AI Act)?

No, eso es otro asunto — en skills-for-ai lo cubre el skill KI-Transparenz (transparencia de IA). Agent Warden cubre la seguridad técnica (inyección de prompts, endurecimiento de agentes), no las obligaciones de divulgación/etiquetado.

¿Con qué herramientas de IA funciona Agent Warden?

Claude · ChatGPT/Codex · Cursor · Copilot · Gemini CLI · Windsurf · Cline

¿Cómo uso Agent Warden?

Agent Warden es un SKILL.md en el estándar abierto agentskills.io: instálalo con un comando (npx) o descárgalo y añádelo a tu herramienta de IA — Claude (Projects), ChatGPT (Custom GPT), Cursor, Copilot, Gemini CLI y más. Sin código.