Chunking Strategy

Guida per il chunking di documenti nelle pipeline RAG: dimensione, sovrapposizione e strategia di confine

di giuseppe-trisciuoglio · giuseppe-trisciuoglio/developer-kit

Promosso ★ 8.0/10

Chunking Strategy — Guida per il chunking di documenti nelle pipeline RAG: dimensione, sovrapposizione e strategia di confine

Cosa fa

Una skill di conoscenza che raccomanda strategie di chunking per la generazione aumentata da recupero: dimensione del chunk (256-1024 token), sovrapposizione (10-20%) e una scala a 5 livelli dal chunking a dimensione fissa a quello semantico e tardivo, più snippet di validazione inline per coerenza e precisione. Si attiva quando si costruiscono sistemi RAG, database vettoriali o si dividono documenti di grandi dimensioni per l'embedding.

Rapporto di test

SKILL.md trovato in plugins/developer-kit-ai/skills/chunking-strategy; il frontmatter viene analizzato con name+description e allowed-tools puliti. Riferimenti controllati a campione references/strategies.md, implementation.md, evaluation.md — tutti HTTP 200 e sostanziali (strategies.md è di 422 righe con codice langchain reale e una tabella di parametri). Installazione/documentazione penalizzate di un punto ciascuna: il corpo dice di eseguire `evaluate_chunks.py --coherence` ma nessuno script del genere esiste nell'albero del repo (in realtà reindirizza a snippet python -c inline). Test di output: ho diviso un documento markdown di 4 sezioni in due modi. La divisione ingenua della baseline di 220 caratteri ha separato parole e frasi (il chunk 2 iniziava con "ooting" dalla divisione "Troubleshooting"; il chunk 1 si apriva con un frammento orfano "reads it at startup..." senza intestazione). Seguendo la guida della skill di Livello 3, consapevole della struttura per markdown, ha prodotto 4 chunk di sezione puliti (22-29 parole ciascuno), ogni chunk con la propria intestazione e zero parole/frasi divise — soddisfacendo direttamente il requisito della skill "i chunk mantengono un significato autonomo". Miglioramento concreto e misurabile rispetto alla baseline.

Testato il: 2026-07-31 · Claude Code 2.x (agent harness)

Installazione

git clone --depth 1 https://github.com/giuseppe-trisciuoglio/developer-kit.git /tmp/chunking-strategy-src
mkdir -p ~/.claude/skills
cp -R /tmp/chunking-strategy-src/plugins/developer-kit-ai/skills/chunking-strategy ~/.claude/skills/chunking-strategy
# Pure-guidance skill: no runtime deps to install the skill itself.
# The optional inline validation snippets in SKILL.md need: pip install sentence-transformers numpy
# Note: SKILL.md says "run evaluate_chunks.py --coherence" but no such script is bundled;
#   the actual validation is the inline `python -c` snippets directly below that line.

Comandi e prompt di esempio

  • /chunking-strategyGuida per il chunking di documenti nelle pipeline RAG: dimensione, sovrapposizione e strategia di confine

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Recommend a chunk size for this document set
  • Evaluate retrieval precision for my RAG pipeline
  • Choose an overlap percentage for semantic chunking