LoRA Fine-Tuning

Recettes de configuration PEFT/LoRA et QLoRA pour le fine-tuning de LLM sur une mémoire GPU limitée.

par itsmostafa · itsmostafa/llm-engineering-skills

Testé · Fonctionne ★ 9.2/10

LoRA Fine-Tuning — Recettes de configuration PEFT/LoRA et QLoRA pour le fine-tuning de LLM sur une mémoire GPU limitée.

Ce que fait

Fournit des recettes concrètes LoraConfig/QLoRA (rank, alpha, target_modules, memory tables) pour le fine-tuning de LLM avec Hugging Face transformers, peft et TRL. Se déclenche sur les demandes de fine-tuning d'un modèle sous contraintes de mémoire GPU, de construction d'adaptateurs spécifiques à une tâche, ou d'exécution de QLoRA sur du matériel grand public.

Rapport de test

Suivre la compétence plutôt qu'une réponse LoRA improvisée a produit des gains vérifiables : tous les target_modules attention+MLP au lieu de seulement q/v, l'heuristique alpha=2×r explicitée, et une étape explicite 'merge on CPU' qui évite un piège OOM courant dans lequel la réponse de base est tombée.

Testé le: 2026-07-14 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/itsmostafa/llm-engineering-skills
cd llm-engineering-skills
mkdir -p ~/.claude/skills
cp -r skills/lora ~/.claude/skills/lora

Commandes et exemples de prompts

  • /loraRecettes de configuration PEFT/LoRA et QLoRA pour le fine-tuning de LLM sur une mémoire GPU limitée.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Give me a QLoRA config to fine-tune Llama 3.1 8B on one GPU
  • What rank and alpha should I use for fine-tuning this model?
  • Help me fine-tune an LLM on 24GB of VRAM without hitting OOM