CTF AI/ML

CTF-referens för ML-attacker: knep med modellvikter, adversariella exempel, LLM-jailbreaks.

av ljagiello · ljagiello/ctf-skills

Fungerar med konfiguration ★ 8.8/10

CTF AI/ML — CTF-referens för ML-attacker: knep med modellvikter, adversariella exempel, LLM-jailbreaks.

Vad den gör

Snabbreferens-underskill som täcker AI-/ML-attacktekniker för CTF-tävlingar: analys av modellvikter (negation av finjustering, LoRA-sammanslagning, modellinversion), generering av adversariella exempel (FGSM/PGD/C&W), samt LLM-attacker (prompt-injektion, jailbreaking, token smuggling). Den är en av åtta kategoriskills i repot ljagiello/ctf-skills, avsedd att dirigeras av det repots solve-challenge-orkestrerare snarare än att triggas helt fristående (frontmatter sätter user-invocable: false). Aktiveras vid CTF-uppgifter som involverar ML-modellfiler, adversariell robusthet, eller LLM-jailbreak-/prompt-injektionsutmaningar.

Testrapport

Gav den exakta slutna lösningen (2xW_orig - W_chal) med körbar kod för att återställa en undertryckt flagga, långt bortom att diffa vikter för hand. Den är markerad som icke fristående anropsbar, så att bara installera den här mappen kanske aldrig triggas.

Testad: 2026-07-10 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/ljagiello/ctf-skills
cd ctf-skills
mkdir -p ~/.claude/skills
cp -r ctf-ai-ml ~/.claude/skills/ctf-ai-ml

Kommandon och exempelprompter

  • /ctf-ai-mlCTF-referens för ML-attacker: knep med modellvikter, adversariella exempel, LLM-jailbreaks.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Craft an adversarial example to bypass this CTF model classifier
  • Find a jailbreak prompt injection for this LLM CTF challenge
  • Analyze this model's weights for a fine-tuning negation trick