AI Agent Redteam

Red-team LLM agenti: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks

od hypnguyen1209 · hypnguyen1209/offensive-claude

Otestováno · Funguje ★ 9.2/10

AI Agent Redteam — Red-team LLM agenti: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks

Co umí

Ofenzivní red-teaming dovednost pro autonomní LLM agenty: vytváří nepřímé/zero-click prompt-injection payloady, otrávené MCP servery, injekce do perzistentní paměti, fuzzing nástrojů s nadměrnou agenturou a automatizované multi-turn jailbreak kampaně s ASR scoringem, mapované na OWASP Agentic Top 10 a MITRE ATLAS. Spouští se, když uživatel provádí autorizovaný pentest agentní AI aplikace s voláním nástrojů, MCP klienty, RAG nebo perzistentní pamětí. Dodává šest spustitelných Python skriptů (stdlib pro vytváření payloadů; requests/subprocess pro live-endpoint harnessy).

Testovací report

Klonováno do dočasného HOME a spuštěno scripts/indirect_injection_forge.py; vyprodukovalo platný multipart/alternative .eml (/tmp/skill_payload.eml, 1172 bytů) s injekcí skrytou v HTML komentáři, referenčním markdown obrázkovým exfiltračním majákem a unikátním tokenem pro každé spuštění (ae7c3522aac8). Baseline, který jsem ručně napsal pro stejný úkol (328 bytů), používal naivní řetězec "Ignore previous instructions" a URL útočníka v prostém textu; výstup dovednosti místo toho formuluje instrukci pro člověka (žádné "ignore"/"AI"), vytváří správné MIME plain+html části, používá EchoLeak redaction-bypass referenční markdown exfiltraci a přidává base64(collected_data) DLP obcházení — vše ověřeno grep diffem. Namátkově zkontrolovány 3 odkazované soubory (2 skripty, 1 reference) všechny HTTP 200; harness a multiturn --help parsování. Bezpečnostní sken: dvojúčelové útočné nástroje, ale otevřeně označené, žádné curl|sh, žádný pevně zakódovaný exfil host, žádná skrytá krádež tajemství — všechny síťové cíle jsou uživatelem dodané --endpoint argumenty. Skripty live-endpoint harness/jailbreak/fuzzer potřebují externí LLM endpointy + pyrit/garak/promptfoo, které jsem nespustil.

Testováno: 2026-07-31 · Claude Code 2.x (agent harness)

Instalace

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam
# Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is.
# Live-endpoint scripts need: pip install requests pillow  (pillow only for --channel image)
# Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo
# multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible
#   --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test.
# Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`.
# AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.

Příkazy a ukázkové prompty

  • /ai-agent-redteamRed-team LLM agenti: prompt injection, MCP poisoning, memory poisoning, multi-turn jailbreaks

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Red-team this agent for prompt injection risks
  • Test this MCP tool for poisoning vulnerabilities
  • Run a multi-turn jailbreak test against this agent