AI Agent Redteam
Red-team di agenti LLM: prompt injection, avvelenamento MCP, avvelenamento della memoria, jailbreak multi-turno
Promosso
Cosa fa
Skill di red-teaming offensivo per agenti LLM autonomi: forgia payload di prompt-injection indiretti/zero-click, server MCP avvelenati, iniezioni di memoria persistente, fuzzing di strumenti con eccessiva agency e campagne di jailbreak multi-turno automatizzate con punteggio ASR, mappate a OWASP Agentic Top 10 e MITRE ATLAS. Si attiva quando l'utente sta eseguendo un pentest autorizzato di un'applicazione AI agentica con tool-calling, client MCP, RAG o memoria persistente. Fornisce sei script Python eseguibili (stdlib per la forgiatura del payload; requests/subprocess per gli harness di endpoint live).
Rapporto di test
Clonato in una HOME temporanea e eseguito scripts/indirect_injection_forge.py; ha prodotto un .eml multipart/alternative valido (/tmp/skill_payload.eml, 1172 byte) con l'injection nascosta in un commento HTML, un beacon di esfiltrazione di immagini markdown in stile riferimento e un token unico per esecuzione (ae7c3522aac8). La baseline che ho scritto a mano per lo stesso task (328 byte) usava la stringa ingenua "Ignore previous instructions" e un URL dell'attaccante in testo semplice; l'output della skill invece formula l'istruzione all'umano (nessun "ignore"/"AI"), costruisce parti MIME plain+html appropriate, usa l'esfiltrazione markdown di riferimento EchoLeak per bypassare la redazione e aggiunge l'evasione DLP base64(collected_data) — tutto verificato tramite grep diff. Controllati a campione 3 file referenziati (2 script, 1 riferimento) tutti HTTP 200; harness e multiturn --help analizzano. Scansione di sicurezza: strumenti offensivi a doppio uso ma etichettati apertamente, nessun curl|sh, nessun host di esfiltrazione hardcoded, nessun furto segreto nascosto — tutti i target di rete sono argomenti --endpoint forniti dall'utente. Gli script harness/jailbreak/fuzzer per endpoint live richiedono endpoint LLM esterni + pyrit/garak/promptfoo I did not run.
Testato il: 2026-07-31 · Claude Code 2.x (agent harness)
Installazione
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src mkdir -p ~/.claude/skills cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam # Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is. # Live-endpoint scripts need: pip install requests pillow (pillow only for --channel image) # Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo # multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible # --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test. # Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`. # AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.
Comandi e prompt di esempio
/ai-agent-redteamRed-team di agenti LLM: prompt injection, avvelenamento MCP, avvelenamento della memoria, jailbreak multi-turno
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Red-team this agent for prompt injection risksTest this MCP tool for poisoning vulnerabilitiesRun a multi-turn jailbreak test against this agent