AI Agent Redteam
Red-team LLM-agenten: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks
Getest · Werkt
Wat het doet
Offensieve red-teaming skill voor autonome LLM-agenten: smeedt indirecte/zero-click prompt-injection payloads, vergiftigde MCP-servers, persistent-memory injecties, excessive-agency tool fuzzing, en geautomatiseerde multi-turn jailbreak campagnes met ASR scoring, gekoppeld aan OWASP Agentic Top 10 en MITRE ATLAS. Activeert wanneer de gebruiker een geautoriseerde pentest uitvoert van een agentic AI-applicatie met tool-calling, MCP-clients, RAG, of persistent geheugen. Levert zes uitvoerbare Python scripts (stdlib voor payload forging; requests/subprocess voor live-endpoint harnesses).
Testrapport
Gekloond naar een tijdelijke HOME en scripts/indirect_injection_forge.py uitgevoerd; het produceerde een geldige multipart/alternative .eml (/tmp/skill_payload.eml, 1172 bytes) met de injectie verborgen in een HTML-commentaar, een reference-style markdown image exfil beacon, en een unieke per-run token (ae7c3522aac). Baseline die ik handmatig schreef voor dezelfde taak (328 bytes) gebruikte de naïeve "Ignore previous instructions" string en een plaintext aanvaller URL; de skill output formuleert de instructie in plaats daarvan naar de mens (geen "ignore"/"AI"), bouwt correcte MIME plain+html delen, gebruikt EchoLeak redaction-bypass reference-markdown exfil, en voegt base64(collected_data) DLP ontwijking toe — allemaal geverifieerd door grep diff. Steekproefsgewijs 3 gerefereerde bestanden gecontroleerd (2 scripts, 1 referentie) allemaal HTTP 200; harness en multiturn --help parsen. Beveiligingsscan: dual-use offensieve tooling maar openlijk gelabeld, geen curl|sh, geen hardcoded exfil host, geen heimelijke diefstal van geheimen — alle netwerkdoelen zijn door de gebruiker geleverde --endpoint args. Live-endpoint harness/jailbreak/fuzzer scripts hebben externe LLM endpoints + pyrit/garak/promptfoo nodig die ik niet heb uitgevoerd.
Getest op: 2026-07-31 · Claude Code 2.x (agent harness)
Installatie
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src mkdir -p ~/.claude/skills cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam # Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is. # Live-endpoint scripts need: pip install requests pillow (pillow only for --channel image) # Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo # multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible # --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test. # Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`. # AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.
Commando's en voorbeeldprompts
/ai-agent-redteamRed-team LLM-agenten: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Red-team this agent for prompt injection risksTest this MCP tool for poisoning vulnerabilitiesRun a multi-turn jailbreak test against this agent