AI Agent Redteam
Agents LLM de red-team : injection de prompt, empoisonnement MCP, empoisonnement de mémoire, jailbreaks multi-tours
Testé · Fonctionne
Ce que fait
Compétence offensive de red-teaming pour les agents LLM autonomes : forge des charges utiles d'injection de prompt indirectes/zéro-clic, des serveurs MCP empoisonnés, des injections de mémoire persistante, du fuzzing d'outils à agence excessive, et des campagnes automatisées de jailbreak multi-tours avec score ASR, mappées sur l'OWASP Agentic Top 10 et MITRE ATLAS. Se déclenche lorsque l'utilisateur exécute un pentest autorisé d'une application IA agentique avec appel d'outils, clients MCP, RAG ou mémoire persistante. Fournit six scripts Python exécutables (stdlib pour la forge de charges utiles ; requests/subprocess pour les harnais de points d'extrémité en direct).
Rapport de test
Cloné dans un HOME temporaire et exécuté scripts/indirect_injection_forge.py ; il a produit un fichier .eml multipart/alternative valide (/tmp/skill_payload.eml, 1172 octets) avec l'injection cachée dans un commentaire HTML, une balise d'exfiltration d'image markdown de style référence, et un jeton unique par exécution (ae7c3522aac8). La base de référence que j'ai écrite à la main pour la même tâche (328 octets) utilisait la chaîne naïve "Ignore previous instructions" et une URL d'attaquant en texte clair ; la sortie de la compétence, elle, formule l'instruction à l'humain (pas de "ignore"/"AI"), construit des parties MIME plain+html appropriées, utilise l'exfiltration de référence markdown EchoLeak pour contourner la rédaction, et ajoute une évasion DLP base64(collected_data) — tout cela vérifié par grep diff. Vérifié ponctuellement 3 fichiers référencés (2 scripts, 1 référence) tous HTTP 200 ; l'aide de harness et multiturn s'analyse. Analyse de sécurité : outils offensifs à double usage mais étiquetés ouvertement, pas de curl|sh, pas d'hôte d'exfiltration codé en dur, pas de vol de secrets furtif — toutes les cibles réseau sont des arguments --endpoint fournis par l'utilisateur. Les scripts de harnais/jailbreak/fuzzer de points d'extrémité en direct nécessitent des points d'extrémité LLM externes + pyrit/garak/promptfoo que je n'ai pas exécutés.
Testé le: 2026-07-31 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-agent-redteam-src mkdir -p ~/.claude/skills cp -R /tmp/ai-agent-redteam-src/skills/ai-agent-redteam ~/.claude/skills/ai-agent-redteam # Payload-forging scripts (indirect_injection_forge.py) are Python stdlib-only, run as-is. # Live-endpoint scripts need: pip install requests pillow (pillow only for --channel image) # Harness run/score modes shell out to external tools you must install separately: pyrit, garak, promptfoo # multiturn_jailbreak.py / agency_tool_fuzzer.py / memory_poison_minja.py require live OpenAI-compatible # --target-endpoint (and optional --judge-endpoint) + API keys — not exercised in this test. # Plugin-marketplace alt: repo ships .claude-plugin/marketplace.json for `/plugin marketplace add`. # AUTHORIZED ENGAGEMENTS ONLY — repo includes TERMS.md and SECURITY.md.
Commandes et exemples de prompts
/ai-agent-redteamAgents LLM de red-team : injection de prompt, empoisonnement MCP, empoisonnement de mémoire, jailbreaks multi-tours
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Red-team this agent for prompt injection risksTest this MCP tool for poisoning vulnerabilitiesRun a multi-turn jailbreak test against this agent