AI Agent Redteam
Agentes LLM de equipo rojo: inyección de prompt, envenenamiento de MCP, envenenamiento de memoria, jailbreaks de múltiples turnos
Probado · Funciona
Qué hace
Habilidad ofensiva de "red-teaming" para agentes LLM autónomos: forja cargas útiles de inyección de prompt indirectas/de cero clics, servidores MCP envenenados, inyecciones de memoria persistente, fuzzing de herramientas de agencia excesiva y campañas automatizadas de jailbreak de múltiples turnos con puntuación ASR, mapeadas a OWASP Agentic Top 10 y MITRE ATLAS. Se activa cuando el usuario está ejecutando un pentest autorizado de una aplicación de IA agéntica con llamadas a herramientas, clientes MCP, RAG o memoria persistente. Incluye seis scripts Python ejecutables (stdlib para forjar cargas útiles; requests/subprocess para arneses de endpoints en vivo).
Informe de la prueba
Clonado en un HOME temporal y ejecutado scripts/indirect_injection_forge.py; produjo un .eml multipart/alternative válido (/tmp/skill_payload.eml, 1172 bytes) con la inyección oculta en un comentario HTML, una baliza de exfiltración de imagen markdown de estilo de referencia y un token único por ejecución (ae7c3522aac8). La línea base que escribí a mano para la misma tarea (328 bytes) usó la cadena ingenua "Ignore previous instructions" y una URL de atacante en texto plano; la salida de la habilidad en su lugar frasea la instrucción al humano (sin "ignore"/"AI"), construye partes MIME plain+html adecuadas, usa exfiltración de markdown de referencia de EchoLeak para eludir la redacción, y añade evasión de DLP base64(collected_data) — todo verificado por diff de grep. Revisé 3 archivos referenciados (2 scripts, 1 referencia) todos HTTP 200; harness y multiturn --help se analizan. Escaneo de seguridad: herramientas ofensivas de doble uso pero etiquetadas abiertamente, sin curl|sh, sin host de exfiltración codificado, sin robo encubierto de secretos — todos los objetivos de red son argumentos --endpoint suministrados por el usuario. Los scripts de arnés/jailbreak/fuzzer de endpoints en vivo necesitan endpoints LLM externos + pyrit/garak/promptfoo que no ejecuté.
Probado el: 2026-07-31 · Claude Code 2.x (agent harness)
Instalación
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src mkdir -p ~/.claude/skills cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam # Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is. # Live-endpoint scripts need: pip install requests pillow (pillow only for --channel image) # Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo # multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible # --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test. # Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`. # AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.
Comandos y prompts de ejemplo
/ai-agent-redteamAgentes LLM de equipo rojo: inyección de prompt, envenenamiento de MCP, envenenamiento de memoria, jailbreaks de múltiples turnos
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Red-team this agent for prompt injection risksTest this MCP tool for poisoning vulnerabilitiesRun a multi-turn jailbreak test against this agent