CTF AI/ML

Referencja CTF dla ataków ML: sztuczki z wagami modelu, przykłady adwersarialne, jailbreaki LLM.

Autor: ljagiello · ljagiello/ctf-skills

Działa po konfiguracji ★ 8.8/10

CTF AI/ML — Referencja CTF dla ataków ML: sztuczki z wagami modelu, przykłady adwersarialne, jailbreaki LLM.

Co robi ten skill

Szybka referencja pokrywająca techniki ataków AI/ML na zawody CTF: analiza wag modelu (negacja fine-tuningu, scalanie LoRA, inwersja modelu), generowanie przykładów adwersarialnych (FGSM/PGD/C&W) i ataki na LLM (prompt injection, jailbreaking, przemyt tokenów). To jeden z ośmiu skilli kategorii w repo ljagiello/ctf-skills, mający być dyspozycjonowany przez orkiestrator solve-challenge tego repo, a nie wywoływany w pełni samodzielnie (frontmatter ustawia user-invocable: false). Uruchamia się przy zadaniach CTF dotyczących plików modeli ML, odporności adwersarialnej albo wyzwań jailbreak/prompt-injection LLM.

Raport z testu

Dał dokładną poprawkę w postaci wzoru zamkniętego (2xW_orig - W_chal) z uruchamialnym kodem do odzyskania zablokowanej flagi, dalece wykraczając poza ręczne porównywanie wag. Oznaczony jako niewywoływalny samodzielnie, więc instalacja tylko tego folderu może nigdy się nie uruchomić.

Testowano: 2026-07-10 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/ljagiello/ctf-skills
cd ctf-skills
mkdir -p ~/.claude/skills
cp -r ctf-ai-ml ~/.claude/skills/ctf-ai-ml

Komendy i przykładowe prompty

  • /ctf-ai-mlReferencja CTF dla ataków ML: sztuczki z wagami modelu, przykłady adwersarialne, jailbreaki LLM.

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Craft an adversarial example to bypass this CTF model classifier
  • Find a jailbreak prompt injection for this LLM CTF challenge
  • Analyze this model's weights for a fine-tuning negation trick