AI Agent Redteam

Red-Team LLM-Agenten: Prompt-Injection, MCP-Poisoning, Memory-Poisoning, Multi-Turn-Jailbreaks

von hypnguyen1209 · hypnguyen1209/offensive-claude

Getestet · Funktioniert ★ 9.2/10

AI Agent Redteam — Red-Team LLM-Agenten: Prompt-Injection, MCP-Poisoning, Memory-Poisoning, Multi-Turn-Jailbreaks

Was es kann

Offensive Red-Teaming-Fähigkeit für autonome LLM-Agenten: schmiedet indirekte/Zero-Click-Prompt-Injection-Payloads, vergiftete MCP-Server, persistente Speicherinjektionen, übermäßige Agenten-Tool-Fuzzing und automatisierte Multi-Turn-Jailbreak-Kampagnen mit ASR-Scoring, abgebildet auf OWASP Agentic Top 10 und MITRE ATLAS. Wird ausgelöst, wenn der Benutzer einen autorisierten Penetrationstest einer agentenbasierten KI-Anwendung mit Tool-Calling, MCP-Clients, RAG oder persistentem Speicher durchführt. Liefert sechs ausführbare Python-Skripte (stdlib für Payload-Schmieden; requests/subprocess für Live-Endpoint-Harnesses).

Testbericht

In ein temporäres HOME geklont und scripts/indirect_injection_forge.py ausgeführt; es erzeugte eine gültige multipart/alternative .eml (/tmp/skill_payload.eml, 1172 Bytes) mit der Injektion, die in einem HTML-Kommentar versteckt war, einem Referenz-Stil Markdown-Bild-Exfil-Beacon und einem eindeutigen pro-Lauf-Token (ae7c3522aac8). Die von mir handgeschriebene Baseline für dieselbe Aufgabe (328 Bytes) verwendete den naiven String "Ignore previous instructions" und eine Klartext-Angreifer-URL; die Skill-Ausgabe formuliert die Anweisung stattdessen an den Menschen (kein "ignore"/"AI"), erstellt ordnungsgemäße MIME plain+html-Teile, verwendet EchoLeak Redaktions-Bypass-Referenz-Markdown-Exfil und fügt base64(collected_data) DLP-Umgehung hinzu – alles durch grep diff verifiziert. 3 referenzierte Dateien (2 Skripte, 1 Referenz) stichprobenartig überprüft, alle HTTP 200; harness und multiturn --help parsen. Sicherheitsscan: Dual-Use-Offensive-Tools, aber offen gekennzeichnet, keine curl|sh, kein fest codierter Exfil-Host, kein verdeckter Geheimnisdiebstahl – alle Netzwerkziele sind vom Benutzer bereitgestellte --endpoint-Argumente. Live-Endpoint-Harness/Jailbreak/Fuzzer-Skripte benötigen externe LLM-Endpunkte + pyrit/garak/promptfoo I did not run.

Getestet am: 2026-07-31 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam
# Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is.
# Live-endpoint scripts need: pip install requests pillow  (pillow only for --channel image)
# Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo
# multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible
#   --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test.
# Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`.
# AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.

Befehle & Beispiel-Prompts

  • /ai-agent-redteamRed-Team LLM-Agenten: Prompt-Injection, MCP-Poisoning, Memory-Poisoning, Multi-Turn-Jailbreaks

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Red-team this agent for prompt injection risks
  • Test this MCP tool for poisoning vulnerabilities
  • Run a multi-turn jailbreak test against this agent