AI Agent Redteam
Red-Team LLM-Agenten: Prompt-Injection, MCP-Poisoning, Memory-Poisoning, Multi-Turn-Jailbreaks
Getestet · Funktioniert
Was es kann
Offensive Red-Teaming-Fähigkeit für autonome LLM-Agenten: schmiedet indirekte/Zero-Click-Prompt-Injection-Payloads, vergiftete MCP-Server, persistente Speicherinjektionen, übermäßige Agenten-Tool-Fuzzing und automatisierte Multi-Turn-Jailbreak-Kampagnen mit ASR-Scoring, abgebildet auf OWASP Agentic Top 10 und MITRE ATLAS. Wird ausgelöst, wenn der Benutzer einen autorisierten Penetrationstest einer agentenbasierten KI-Anwendung mit Tool-Calling, MCP-Clients, RAG oder persistentem Speicher durchführt. Liefert sechs ausführbare Python-Skripte (stdlib für Payload-Schmieden; requests/subprocess für Live-Endpoint-Harnesses).
Testbericht
In ein temporäres HOME geklont und scripts/indirect_injection_forge.py ausgeführt; es erzeugte eine gültige multipart/alternative .eml (/tmp/skill_payload.eml, 1172 Bytes) mit der Injektion, die in einem HTML-Kommentar versteckt war, einem Referenz-Stil Markdown-Bild-Exfil-Beacon und einem eindeutigen pro-Lauf-Token (ae7c3522aac8). Die von mir handgeschriebene Baseline für dieselbe Aufgabe (328 Bytes) verwendete den naiven String "Ignore previous instructions" und eine Klartext-Angreifer-URL; die Skill-Ausgabe formuliert die Anweisung stattdessen an den Menschen (kein "ignore"/"AI"), erstellt ordnungsgemäße MIME plain+html-Teile, verwendet EchoLeak Redaktions-Bypass-Referenz-Markdown-Exfil und fügt base64(collected_data) DLP-Umgehung hinzu – alles durch grep diff verifiziert. 3 referenzierte Dateien (2 Skripte, 1 Referenz) stichprobenartig überprüft, alle HTTP 200; harness und multiturn --help parsen. Sicherheitsscan: Dual-Use-Offensive-Tools, aber offen gekennzeichnet, keine curl|sh, kein fest codierter Exfil-Host, kein verdeckter Geheimnisdiebstahl – alle Netzwerkziele sind vom Benutzer bereitgestellte --endpoint-Argumente. Live-Endpoint-Harness/Jailbreak/Fuzzer-Skripte benötigen externe LLM-Endpunkte + pyrit/garak/promptfoo I did not run.
Getestet am: 2026-07-31 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src mkdir -p ~/.claude/skills cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam # Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is. # Live-endpoint scripts need: pip install requests pillow (pillow only for --channel image) # Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo # multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible # --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test. # Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`. # AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.
Befehle & Beispiel-Prompts
/ai-agent-redteamRed-Team LLM-Agenten: Prompt-Injection, MCP-Poisoning, Memory-Poisoning, Multi-Turn-Jailbreaks
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Red-team this agent for prompt injection risksTest this MCP tool for poisoning vulnerabilitiesRun a multi-turn jailbreak test against this agent