AI Agent Redteam

Red-team LLM-agenter: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks

av hypnguyen1209 · hypnguyen1209/offensive-claude

Testad · Fungerar ★ 9.2/10

AI Agent Redteam — Red-team LLM-agenter: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks

Vad den gör

Offensiv red-teaming-färdighet för autonoma LLM-agenter: skapar indirekta/noll-klick prompt-injection-nyttolaster, förgiftade MCP-servrar, ihållande minnesinjektioner, överdriven agentverktygsfuzzing, och automatiserade flerstegs jailbreak-kampanjer med ASR-poängsättning, mappade till OWASP Agentic Top 10 och MITRE ATLAS. Utlöses när användaren kör en auktoriserad pentest av en agentisk AI-applikation med verktygsanrop, MCP-klienter, RAG, eller ihållande minne. Levererar sex körbara Python-skript (stdlib för nyttolastskapande; requests/subprocess för live-endpoint-harnes).

Testrapport

Klonade till en tillfällig HOME och körde scripts/indirect_injection_forge.py; den producerade en giltig multipart/alternative .eml (/tmp/skill_payload.eml, 1172 bytes) med injektionen dold i en HTML-kommentar, en referensstil markdown-bild exfil-beacon, och en unik per-körningstoken (ae7c3522aac8). Baseline jag handskrev för samma uppgift (328 bytes) använde den naiva strängen "Ignore previous instructions" och en klartext-attacker-URL; färdighetsutdata formulerar istället instruktionen till människan (inga "ignore"/"AI"), bygger korrekta MIME plain+html-delar, använder EchoLeak redaction-bypass reference-markdown exfil, och lägger till base64(collected_data) DLP-undvikande — allt verifierat med grep diff. Stickprovskontrollerade 3 refererade filer (2 skript, 1 referens) alla HTTP 200; harness och multiturn --help tolkas. Säkerhetsskanning: offensiva verktyg med dubbla användningsområden men öppet märkta, inga curl|sh, ingen hårdkodad exfil-värd, ingen hemlig stöld av hemligheter — alla nätverksmål är användardefinierade --endpoint-argument. Live-endpoint harness/jailbreak/fuzzer-skript behöver externa LLM-slutpunkter + pyrit/garak/promptfoo som jag inte körde.

Testad: 2026-07-31 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam
# Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is.
# Live-endpoint scripts need: pip install requests pillow  (pillow only for --channel image)
# Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo
# multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible
#   --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test.
# Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`.
# AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.

Kommandon och exempelprompter

  • /ai-agent-redteamRed-team LLM-agenter: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Red-team this agent for prompt injection risks
  • Test this MCP tool for poisoning vulnerabilities
  • Run a multi-turn jailbreak test against this agent