AI Agent Redteam

Red-teamowanie agentów LLM: wstrzykiwanie promptów, zatruwanie MCP, zatruwanie pamięci, wieloetapowe jailbreaki

Autor: hypnguyen1209 · hypnguyen1209/offensive-claude

Testowano · Działa ★ 9.2/10

AI Agent Redteam — Red-teamowanie agentów LLM: wstrzykiwanie promptów, zatruwanie MCP, zatruwanie pamięci, wieloetapowe jailbreaki

Co robi ten skill

Ofensywna umiejętność red-teamingu dla autonomicznych agentów LLM: tworzy pośrednie/zero-kliknięć ładunki wstrzykiwania promptów, zatrute serwery MCP, wstrzyknięcia do pamięci trwałej, fuzzing narzędzi z nadmierną autonomią oraz zautomatyzowane wieloetapowe kampanie jailbreak z oceną ASR, mapowane na OWASP Agentic Top 10 i MITRE ATLAS. Uruchamia się, gdy użytkownik przeprowadza autoryzowany pentest aplikacji AI z agentami, z wywoływaniem narzędzi, klientami MCP, RAG lub pamięcią trwałą. Dostarcza sześć uruchamialnych skryptów Pythona (stdlib do tworzenia ładunków; requests/subprocess do uprzęży dla aktywnych punktów końcowych).

Raport z testu

Sklonowano do tymczasowego HOME i uruchomiono scripts/indirect_injection_forge.py; wygenerowało to prawidłowy multipart/alternative .eml (/tmp/skill_payload.eml, 1172 bajty) z wstrzyknięciem ukrytym w komentarzu HTML, beaconem exfil obrazu markdown w stylu referencyjnym oraz unikalnym tokenem na każde uruchomienie (ae7c3522aac8). Linia bazowa, którą napisałem ręcznie dla tego samego zadania (328 bajtów), używała naiwnego ciągu "Ignore previous instructions" i prostego URL atakującego; wyjście umiejętności zamiast tego formułuje instrukcję dla człowieka (bez "ignore"/"AI"), buduje prawidłowe części MIME plain+html, używa EchoLeak redaction-bypass reference-markdown exfil i dodaje base64(collected_data) unikanie DLP — wszystko zweryfikowane przez grep diff. Sprawdzono wyrywkowo 3 odwołujące się pliki (2 skrypty, 1 odniesienie) wszystkie HTTP 200; harness i multiturn --help parsowały się. Skan bezpieczeństwa: narzędzia ofensywne o podwójnym zastosowaniu, ale jawnie oznaczone, brak curl|sh, brak zakodowanego na stałe hosta exfil, brak ukrytej kradzieży sekretów — wszystkie cele sieciowe są dostarczane przez użytkownika za pomocą argumentów --endpoint. Skrypty harness/jailbreak/fuzzer dla aktywnych punktów końcowych wymagają zewnętrznych punktów końcowych LLM + pyrit/garak/promptfoo, których nie uruchamiałem.

Testowano: 2026-07-31 · Claude Code 2.x (agent harness)

Instalacja

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam
# Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is.
# Live-endpoint scripts need: pip install requests pillow  (pillow only for --channel image)
# Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo
# multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible
#   --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test.
# Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`.
# AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.

Komendy i przykładowe prompty

  • /ai-agent-redteamRed-teamowanie agentów LLM: wstrzykiwanie promptów, zatruwanie MCP, zatruwanie pamięci, wieloetapowe jailbreaki

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Red-team this agent for prompt injection risks
  • Test this MCP tool for poisoning vulnerabilities
  • Run a multi-turn jailbreak test against this agent