CTF AI/ML

Riferimento CTF per attacchi ML: trucchi sui pesi del modello, esempi adversarial, jailbreak LLM.

di ljagiello · ljagiello/ctf-skills

Richiede configurazione ★ 8.8/10

CTF AI/ML — Riferimento CTF per attacchi ML: trucchi sui pesi del modello, esempi adversarial, jailbreak LLM.

Cosa fa

Sotto-skill di riferimento rapido che copre le tecniche di attacco AI/ML per competizioni CTF: analisi dei pesi del modello (negazione del fine-tuning, merging LoRA, model inversion), generazione di esempi adversarial (FGSM/PGD/C&W) e attacchi LLM (prompt injection, jailbreaking, token smuggling). È uno degli otto skill di categoria nel repo ljagiello/ctf-skills, pensato per essere invocato dall'orchestratore solve-challenge di quel repo piuttosto che attivato in modo completamente standalone (il frontmatter imposta user-invocable: false). Si attiva su task CTF che coinvolgono file di modelli ML, robustezza adversarial o sfide di jailbreak/prompt-injection su LLM.

Rapporto di test

Ha fornito la formula chiusa esatta (2xW_orig - W_chal) con codice eseguibile per recuperare una flag soppressa, ben oltre il confronto manuale dei pesi. È marcato come non invocabile da solo, quindi installare solo questa cartella potrebbe non attivarsi mai.

Testato il: 2026-07-10 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/ljagiello/ctf-skills
cd ctf-skills
mkdir -p ~/.claude/skills
cp -r ctf-ai-ml ~/.claude/skills/ctf-ai-ml

Comandi e prompt di esempio

  • /ctf-ai-mlRiferimento CTF per attacchi ML: trucchi sui pesi del modello, esempi adversarial, jailbreak LLM.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Craft an adversarial example to bypass this CTF model classifier
  • Find a jailbreak prompt injection for this LLM CTF challenge
  • Analyze this model's weights for a fine-tuning negation trick