AI Agent Redteam

Red-team LLM-agenter: prompt injection, MCP-forgiftning, minneforgiftning, multi-turn jailbreaks

av hypnguyen1209 · hypnguyen1209/offensive-claude

Bestått ★ 9.2/10

AI Agent Redteam — Red-team LLM-agenter: prompt injection, MCP-forgiftning, minneforgiftning, multi-turn jailbreaks

Hva den gjør

Offensiv red-teaming-ferdighet for autonome LLM-agenter: smir indirekte/null-klikk prompt-injection-nyttelast, forgiftede MCP-servere, vedvarende-minne-injeksjoner, overdreven-agent-verktøy-fuzzing, og automatiserte multi-turn jailbreak-kampanjer med ASR-scoring, kartlagt til OWASP Agentic Top 10 og MITRE ATLAS. Utløses når brukeren kjører en autorisert pentest av en agentisk AI-applikasjon med verktøy-kalling, MCP-klienter, RAG, eller vedvarende minne. Leverer seks kjørbare Python-skript (stdlib for nyttelast-smiing; requests/subprocess for live-endepunkt-harnesser).

Testrapport

Klonet til en midlertidig HOME og kjørte scripts/indirect_injection_forge.py; den produserte en gyldig multipart/alternative .eml (/tmp/skill_payload.eml, 1172 bytes) med injeksjonen skjult i en HTML-kommentar, en referanse-stil markdown-bilde exfil-beacon, og en unik per-kjøring token (ae7c3522aac8). Grunnlinjen jeg håndskrev for samme oppgave (328 bytes) brukte den naive "Ignore previous instructions"-strengen og en ren tekst angriper-URL; ferdighetsutdataet formulerer i stedet instruksjonen til mennesket (ingen "ignore"/"AI"), bygger riktige MIME plain+html-deler, bruker EchoLeak redaction-bypass reference-markdown exfil, og legger til base64(collected_data) DLP-unngåelse — alt verifisert av grep diff. Stikkprøvekontrollerte 3 refererte filer (2 skript, 1 referanse) alle HTTP 200; harness og multiturn --help parse. Sikkerhetsskanning: to-bruks offensivt verktøy, men åpent merket, ingen curl|sh, ingen hardkodet exfil-vert, ingen skjult hemmelig tyveri — alle nettverksmål er bruker-leverte --endpoint-argumenter. Live-endepunkt harness/jailbreak/fuzzer-skript trenger eksterne LLM-endepunkter + pyrit/garak/promptfoo jeg ikke kjørte.

Testet på: 2026-07-31 · Claude Code 2.x (agent harness)

Installer

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam
# Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is.
# Live-endpoint scripts need: pip install requests pillow  (pillow only for --channel image)
# Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo
# multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible
#   --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test.
# Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`.
# AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.

Kommandoer og eksempelprompter

  • /ai-agent-redteamRed-team LLM-agenter: prompt injection, MCP-forgiftning, minneforgiftning, multi-turn jailbreaks

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Red-team this agent for prompt injection risks
  • Test this MCP tool for poisoning vulnerabilities
  • Run a multi-turn jailbreak test against this agent