CTF AI/ML

CTF reference pro útoky na ML: triky s vahami modelu, adversariální příklady, jailbreaky LLM.

od ljagiello · ljagiello/ctf-skills

Funguje s nastavením ★ 8.8/10

CTF AI/ML — CTF reference pro útoky na ML: triky s vahami modelu, adversariální příklady, jailbreaky LLM.

Co umí

Rychlá referenční podskill pokrývající techniky útoků AI/ML pro CTF soutěže: analýza vah modelu (negace fine-tuningu, slučování LoRA, inverze modelu), generování adversariálních příkladů (FGSM/PGD/C&W) a útoky na LLM (prompt injection, jailbreaking, token smuggling). Je to jeden z osmi kategoriových skillů v repozitáři ljagiello/ctf-skills, určený k vyvolávání orchestrátorem solve-challenge z toho repozitáře spíš než ke spouštění zcela samostatně (frontmatter má nastaveno user-invocable: false). Spouští se na CTF úkoly zahrnující soubory ML modelů, adversariální robustnost nebo výzvy typu jailbreak/prompt-injection u LLM.

Testovací report

Dal přesnou uzavřenou opravu (2xW_orig - W_chal) se spustitelným kódem pro obnovu potlačené vlajky, výrazně nad rámec ručního porovnávání vah. Je označen jako samostatně nespustitelný, takže instalace jen této složky se nemusí nikdy spustit.

Testováno: 2026-07-10 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/ljagiello/ctf-skills
cd ctf-skills
mkdir -p ~/.claude/skills
cp -r ctf-ai-ml ~/.claude/skills/ctf-ai-ml

Příkazy a ukázkové prompty

  • /ctf-ai-mlCTF reference pro útoky na ML: triky s vahami modelu, adversariální příklady, jailbreaky LLM.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Craft an adversarial example to bypass this CTF model classifier
  • Find a jailbreak prompt injection for this LLM CTF challenge
  • Analyze this model's weights for a fine-tuning negation trick