Chunking Strategy

Wskazówki dotyczące dzielenia dokumentów w potokach RAG: rozmiar, nakładanie się i strategia granic

Autor: giuseppe-trisciuoglio · giuseppe-trisciuoglio/developer-kit

Testowano · Działa ★ 8.0/10

Chunking Strategy — Wskazówki dotyczące dzielenia dokumentów w potokach RAG: rozmiar, nakładanie się i strategia granic

Co robi ten skill

Umiejętność wiedzy, która rekomenduje strategie dzielenia na fragmenty dla generacji wspomaganej wyszukiwaniem (RAG): rozmiar fragmentu (256-1024 tokenów), nakładanie się (10-20%) oraz 5-poziomowa drabina od fragmentowania o stałym rozmiarze do semantycznego i późnego, plus wbudowane fragmenty walidacyjne dla spójności i precyzji. Uruchamia się podczas budowania systemów RAG, baz danych wektorowych lub dzielenia dużych dokumentów do osadzania.

Raport z testu

Zlokalizowano SKILL.md w plugins/developer-kit-ai/skills/chunking-strategy; frontmatter parsowany z name+description i czystymi allowed-tools. Sprawdzono references/strategies.md, implementation.md, evaluation.md — wszystkie HTTP 200 i merytoryczne (strategies.md ma 422 linie z rzeczywistym kodem langchain i tabelą parametrów). Instalacja/dokumentacja obniżona o jeden punkt każda: treść mówi, aby uruchomić `evaluate_chunks.py --coherence`, ale taki skrypt nie istnieje w drzewie repozytorium (faktycznie przekierowuje do wbudowanych fragmentów python -c). Test wyjścia: podzielono dokument markdown na 4 sekcje na dwa sposoby. Bazowy naiwny podział na 220 znaków rozerwał słowa i zdania (fragment 2 zaczął się od „ooting” z podziału „Troubleshooting”; fragment 1 otworzył się z osieroconym fragmentem „reads it at startup...” bez nagłówka). Zgodnie z wytycznymi umiejętności Level-3 uwzględniającymi strukturę dla markdown, wygenerowano 4 czyste fragmenty sekcji (po 22-29 słów każdy), każdy fragment z własnym nagłówkiem i zerową liczbą podzielonych słów/zdań — bezpośrednio spełniając wymaganie umiejętności „chunks maintain standalone meaning”. Konkretna, mierzalna poprawa w stosunku do linii bazowej.

Testowano: 2026-07-31 · Claude Code 2.x (agent harness)

Instalacja

git clone --depth 1 https://github.com/giuseppe-trisciuoglio/developer-kit.git /tmp/chunking-strategy-src
mkdir -p ~/.claude/skills
cp -R /tmp/chunking-strategy-src/plugins/developer-kit-ai/skills/chunking-strategy ~/.claude/skills/chunking-strategy
# Pure-guidance skill: no runtime deps to install the skill itself.
# The optional inline validation snippets in SKILL.md need: pip install sentence-transformers numpy
# Note: SKILL.md says "run evaluate_chunks.py --coherence" but no such script is bundled;
#   the actual validation is the inline `python -c` snippets directly below that line.

Komendy i przykładowe prompty

  • /chunking-strategyWskazówki dotyczące dzielenia dokumentów w potokach RAG: rozmiar, nakładanie się i strategia granic

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Recommend a chunk size for this document set
  • Evaluate retrieval precision for my RAG pipeline
  • Choose an overlap percentage for semantic chunking