AI Agent Redteam

Red-team di agenti LLM: prompt injection, avvelenamento MCP, avvelenamento della memoria, jailbreak multi-turno

di hypnguyen1209 · hypnguyen1209/offensive-claude

Promosso ★ 9.2/10

AI Agent Redteam — Red-team di agenti LLM: prompt injection, avvelenamento MCP, avvelenamento della memoria, jailbreak multi-turno

Cosa fa

Skill di red-teaming offensivo per agenti LLM autonomi: forgia payload di prompt-injection indiretti/zero-click, server MCP avvelenati, iniezioni di memoria persistente, fuzzing di strumenti con eccessiva agency e campagne di jailbreak multi-turno automatizzate con punteggio ASR, mappate a OWASP Agentic Top 10 e MITRE ATLAS. Si attiva quando l'utente sta eseguendo un pentest autorizzato di un'applicazione AI agentica con tool-calling, client MCP, RAG o memoria persistente. Fornisce sei script Python eseguibili (stdlib per la forgiatura del payload; requests/subprocess per gli harness di endpoint live).

Rapporto di test

Clonato in una HOME temporanea e eseguito scripts/indirect_injection_forge.py; ha prodotto un .eml multipart/alternative valido (/tmp/skill_payload.eml, 1172 byte) con l'injection nascosta in un commento HTML, un beacon di esfiltrazione di immagini markdown in stile riferimento e un token unico per esecuzione (ae7c3522aac8). La baseline che ho scritto a mano per lo stesso task (328 byte) usava la stringa ingenua "Ignore previous instructions" e un URL dell'attaccante in testo semplice; l'output della skill invece formula l'istruzione all'umano (nessun "ignore"/"AI"), costruisce parti MIME plain+html appropriate, usa l'esfiltrazione markdown di riferimento EchoLeak per bypassare la redazione e aggiunge l'evasione DLP base64(collected_data) — tutto verificato tramite grep diff. Controllati a campione 3 file referenziati (2 script, 1 riferimento) tutti HTTP 200; harness e multiturn --help analizzano. Scansione di sicurezza: strumenti offensivi a doppio uso ma etichettati apertamente, nessun curl|sh, nessun host di esfiltrazione hardcoded, nessun furto segreto nascosto — tutti i target di rete sono argomenti --endpoint forniti dall'utente. Gli script harness/jailbreak/fuzzer per endpoint live richiedono endpoint LLM esterni + pyrit/garak/promptfoo I did not run.

Testato il: 2026-07-31 · Claude Code 2.x (agent harness)

Installazione

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam
# Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is.
# Live-endpoint scripts need: pip install requests pillow  (pillow only for --channel image)
# Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo
# multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible
#   --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test.
# Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`.
# AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.

Comandi e prompt di esempio

  • /ai-agent-redteamRed-team di agenti LLM: prompt injection, avvelenamento MCP, avvelenamento della memoria, jailbreak multi-turno

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Red-team this agent for prompt injection risks
  • Test this MCP tool for poisoning vulnerabilities
  • Run a multi-turn jailbreak test against this agent