AI Agent Redteam

Red-team LLM-agenter: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks

Af hypnguyen1209 · hypnguyen1209/offensive-claude

Testet · Virker ★ 9.2/10

AI Agent Redteam — Red-team LLM-agenter: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks

Hvad det gør

Offensiv red-teaming færdighed for autonome LLM-agenter: smeder indirekte/zero-click prompt-injection payloads, forgiftede MCP-servere, persistent-memory injections, excessive-agency tool fuzzing og automatiserede multi-turn jailbreak-kampagner med ASR-scoring, kortlagt til OWASP Agentic Top 10 og MITRE ATLAS. Udløses, når brugeren udfører en autoriseret pentest af en agentisk AI-applikation med tool-calling, MCP-klienter, RAG eller persistent memory. Leverer seks kørbare Python-scripts (stdlib til payload-smedning; requests/subprocess til live-endpoint harnesses).

Testrapport

Klonede til en midlertidig HOME og kørte scripts/indirect_injection_forge.py; den producerede en gyldig multipart/alternative .eml (/tmp/skill_payload.eml, 1172 bytes) med injektionen skjult i en HTML-kommentar, en reference-stil markdown image exfil beacon og et unikt per-run token (ae7c3522aac8). Baseline, jeg håndskrev til samme opgave (328 bytes), brugte den naive "Ignore previous instructions"-streng og en plaintext attacker URL; færdighedsoutputtet formulerer i stedet instruktionen til mennesket (ingen "ignore"/"AI"), bygger korrekte MIME plain+html dele, bruger EchoLeak redaction-bypass reference-markdown exfil og tilføjer base64(collected_data) DLP evasion — alt verificeret af grep diff. Spot-tjekkede 3 refererede filer (2 scripts, 1 reference) alle HTTP 200; harness og multiturn --help parse. Sikkerhedsscanning: dobbeltanvendelig offensiv værktøjer, men åbent mærket, ingen curl|sh, ingen hardkodet exfil host, ingen skjult hemmelighedstyveri — alle netværksmål er brugerleverede --endpoint args. Live-endpoint harness/jailbreak/fuzzer scripts kræver eksterne LLM endpoints + pyrit/garak/promptfoo, som jeg ikke kørte.

Testet: 2026-07-31 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam
# Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is.
# Live-endpoint scripts need: pip install requests pillow  (pillow only for --channel image)
# Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo
# multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible
#   --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test.
# Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`.
# AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.

Kommandoer og eksempelprompter

  • /ai-agent-redteamRed-team LLM-agenter: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Red-team this agent for prompt injection risks
  • Test this MCP tool for poisoning vulnerabilities
  • Run a multi-turn jailbreak test against this agent