AI Agent Redteam
Red-team LLM-agenter: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks
Testad · Fungerar
Vad den gör
Offensiv red-teaming-färdighet för autonoma LLM-agenter: skapar indirekta/noll-klick prompt-injection-nyttolaster, förgiftade MCP-servrar, ihållande minnesinjektioner, överdriven agentverktygsfuzzing, och automatiserade flerstegs jailbreak-kampanjer med ASR-poängsättning, mappade till OWASP Agentic Top 10 och MITRE ATLAS. Utlöses när användaren kör en auktoriserad pentest av en agentisk AI-applikation med verktygsanrop, MCP-klienter, RAG, eller ihållande minne. Levererar sex körbara Python-skript (stdlib för nyttolastskapande; requests/subprocess för live-endpoint-harnes).
Testrapport
Klonade till en tillfällig HOME och körde scripts/indirect_injection_forge.py; den producerade en giltig multipart/alternative .eml (/tmp/skill_payload.eml, 1172 bytes) med injektionen dold i en HTML-kommentar, en referensstil markdown-bild exfil-beacon, och en unik per-körningstoken (ae7c3522aac8). Baseline jag handskrev för samma uppgift (328 bytes) använde den naiva strängen "Ignore previous instructions" och en klartext-attacker-URL; färdighetsutdata formulerar istället instruktionen till människan (inga "ignore"/"AI"), bygger korrekta MIME plain+html-delar, använder EchoLeak redaction-bypass reference-markdown exfil, och lägger till base64(collected_data) DLP-undvikande — allt verifierat med grep diff. Stickprovskontrollerade 3 refererade filer (2 skript, 1 referens) alla HTTP 200; harness och multiturn --help tolkas. Säkerhetsskanning: offensiva verktyg med dubbla användningsområden men öppet märkta, inga curl|sh, ingen hårdkodad exfil-värd, ingen hemlig stöld av hemligheter — alla nätverksmål är användardefinierade --endpoint-argument. Live-endpoint harness/jailbreak/fuzzer-skript behöver externa LLM-slutpunkter + pyrit/garak/promptfoo som jag inte körde.
Testad: 2026-07-31 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src mkdir -p ~/.claude/skills cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam # Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is. # Live-endpoint scripts need: pip install requests pillow (pillow only for --channel image) # Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo # multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible # --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test. # Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`. # AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.
Kommandon och exempelprompter
/ai-agent-redteamRed-team LLM-agenter: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Red-team this agent for prompt injection risksTest this MCP tool for poisoning vulnerabilitiesRun a multi-turn jailbreak test against this agent