CTF AI/ML

CTF-reference til ML-angreb: modelvægt-tricks, adversarial examples, LLM-jailbreaks.

Af ljagiello · ljagiello/ctf-skills

Virker med opsætning ★ 8.8/10

CTF AI/ML — CTF-reference til ML-angreb: modelvægt-tricks, adversarial examples, LLM-jailbreaks.

Hvad det gør

Hurtig-reference-underskill der dækker AI-/ML-angrebsteknikker til CTF-konkurrencer: modelvægtanalyse (fine-tuning-negation, LoRA-merging, model-inversion), generering af adversarial examples (FGSM/PGD/C&W), og LLM-angreb (prompt-injection, jailbreaking, token smuggling). Det er ét af otte kategoriskills i ljagiello/ctf-skills-repoet, tænkt til at blive uddelegeret af det repos solve-challenge-orkestrator frem for at trigge fuldt selvstændigt (frontmatter sætter user-invocable: false). Trigger på CTF-opgaver med ML-modelfiler, adversarial robusthed, eller LLM-jailbreak-/prompt-injection-udfordringer.

Testrapport

Gav det præcise lukkede-form-fix (2xW_orig - W_chal) med kørbar kode til at genskabe et undertrykt flag, langt ud over at diffe vægte manuelt. Det er markeret som ikke selvstændigt kaldbart, så en isoleret installation trigger måske aldrig.

Testet: 2026-07-10 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/ljagiello/ctf-skills
cd ctf-skills
mkdir -p ~/.claude/skills
cp -r ctf-ai-ml ~/.claude/skills/ctf-ai-ml

Kommandoer og eksempelprompter

  • /ctf-ai-mlCTF-reference til ML-angreb: modelvægt-tricks, adversarial examples, LLM-jailbreaks.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Craft an adversarial example to bypass this CTF model classifier
  • Find a jailbreak prompt injection for this LLM CTF challenge
  • Analyze this model's weights for a fine-tuning negation trick