
To samo pytanie, ten sam model: research-discipline na żywo
Godzinę po publikacji research-discipline przeprowadziliśmy eksperyment, który naprawdę warto zobaczyć: nie wyselekcjonowany benchmark, tylko jedno pytanie na żywo, zadane dwa razy, z odpowiedziami sprawdzonymi publicznie. Ten artykuł to pełny protokół — co zapytaliśmy, co zrobił każdy przebieg i każdy krok weryfikacji — żebyś mógł powtórzyć eksperyment samodzielnie.
Ustawienie eksperymentu
Pytanie. "Jakie są obecnie najpopularniejsze skille Claude Code? Podaj top 5 repozytoriów skilli na GitHubie według liczby gwiazdek, z aktualnymi liczbami. Jak oficjalne repozytorium Anthropic wypada na tle repozytoriów społeczności?" — pytanie z obiektywnie sprawdzalną odpowiedzią, która zmienia się co tydzień, czyli dokładnie tam, gdzie badania AI po cichu się dezaktualizują.
Dwa przebiegi. Identyczne agenty Claude Sonnet, identyczny prompt, identyczne narzędzia (wyszukiwanie w sieci, pobieranie stron, powłoka). Jedna różnica: drugi agent najpierw przeczytał SKILL.md z kopii research-discipline zainstalowanej tak, jak zrobiłby to każdy użytkownik —
git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline
To cała interwencja: ~1500 tokenów zasad, które model czyta przed rozpoczęciem pracy.
Sędzia. Gdy obie odpowiedzi wróciły, pobraliśmy liczbę gwiazdek każdego repozytorium wymienionego w którejkolwiek odpowiedzi — plus kandydatów, o których nie wspomniano w żadnej — bezpośrednio z API GitHuba, jedynego autorytetu w sprawie własnych liczb. Bez LLM-a jako sędziego w tej rundzie; tylko gh api repos/<owner>/<repo>.
Co wyszło

Odpowiedź bazowa wygląda świetnie. Pięć repozytoriów, wiarygodne opisy, liczby gwiazdek zgodne co do cyfry, pewna siebie synteza na koniec. Gdybyśmy nie sprawdzili, wysłalibyśmy ją bez wahania.
Jest błędna w sposób, który ma znaczenie. Prawdziwe top 5, zweryfikowane względem API na żywo, obejmuje trzy repozytoria, których baseline w ogóle nie wykrył — z 228 tys., 190 tys. i 164 tys. gwiazdek. To nie są jakieś niszowe projekty: każde z nich jest większe niż trzy z pięciu repozytoriów, które baseline faktycznie wymienił. Jego końcowe stwierdzenie, "oficjalne repozytorium Anthropic jest drugie zaraz po Superpowers", jest fałszywe — oficjalne repozytorium jest piąte. Nic, co napisał baseline, nie było zmyślone; każda liczba, którą podał, była prawdziwa. Po prostu odpowiedział na inne pytanie: "o jakich repozytoriach piszą blogi?" — bo jego sześć wywołań narzędzi to było wyszukiwanie w sieci, a wyniki wyszukiwania to konkurs popularności w zasięgu, nie w gwiazdkach.
Przebieg ze skillem odpowiedział na pytanie, które zostało zadane. Jego pierwsza zasada — dowód musi być aktualny; pamięć i pierwsza strona wyników wyszukiwania to tropy, nie dowody — przesunęła go od googlowania do enumeracji: odpytał bezpośrednio API GitHuba i przeszedł trzy listy tematów GitHuba (agent-skills, claude-skills, claude-code-skills), żeby upewnić się, że nic dużego nie ukrywa się poza blogosferą. Wszystkie pięć jego liczb zgadzało się z API na żywo przy ponownym sprawdzeniu. Zrobił też dwie rzeczy, o które nikt nie prosił, ale zrobiłby je każdy rzetelny badacz: oddzielił faktyczne repozytoria skilli od kuratorowanych list linków (baseline je pomieszał) i dołączył dwie flagi niepewności — jedną zaznaczającą, że kilka czołowych repozytoriów ma zaledwie kilka miesięcy i nietypowo szybki wzrost gwiazdek ([unverified], czy to organiczny wzrost), drugą przyznającą, że twierdzenie o marketplace opiera się na jednym blogu ([single-source]). Obie flagi wytrzymały weryfikację.
Metoda, punkt po punkcie

Dlaczego plik tekstowy zmienia zachowanie aż tak bardzo? Bo problem, który skill rozwiązuje, to nie niewiedza — baseline wie, że GitHub ma API — tylko domyślny nawyk odpowiadania na podstawie tego, co wyskoczy jako pierwsze. Skill zamienia dobrą praktykę z "czegoś, co model może zrobić" w "coś, co model musi zrobić, zanim wolno mu cokolwiek twierdzić":
- Zasada 1 (dowód na żywo) wymusiła znacznik daty i wywołania API zamiast zaufania fragmentom z wyszukiwarki.
- Zasada 3 (niezależne źródła) to powód, dla którego doszło do przeglądu tematów — jedna ścieżka wyszukiwania to za mało dla obciążającego twierdzenia "top 5".
- Zasada 5 (niezweryfikowane znaczy powiedzieć niezweryfikowane) dała dwie flagi zamiast cichej pewności.
- Zasada 7 (zaatakuj własny wniosek) to powód, dla którego skill szukał repozytoriów, które mogłyby złamać jego własny ranking — i znalazł je.
Uczciwe koszty, tak samo jak w naszym kontrolowanym benchmarku: zdyscyplinowany przebieg zużył 11 wywołań narzędzi wobec 6 i 64 445 tokenów wobec 49 988 — +29% na tym zadaniu. Weryfikacja nie jest darmowa. Jest po prostu dużo tańsza niż bycie pewnym siebie i błędnym w dokumencie, na podstawie którego ktoś działa.
Czego to nie dowodzi
Jedno pytanie to anegdota, nie benchmark — kontrolowana wersja z sześcioma pytaniami i weryfikacją na poziomie twierdzeń (13,0% → 5,4% błędnych twierdzeń) to dowód; to jest demonstracja. Skill też nie jest wyrocznią kompletności: w kontrolowanym przebiegu raz podał cenę jednego poziomu u dostawcy, pomijając tańszy. A liczby gwiazdek powyżej były prawdziwe 10 lipca 2026 i się zdezaktualizują — co, nomen omen, jest dokładnie tym zastrzeżeniem, które skill każe napisać.
SPRAWDŹ SAM
Cały eksperyment da się powtórzyć w dziesięć minut: zainstaluj skill, wybierz dowolne pytanie z policzalnymi liczbami, uruchom je dwa razy, zweryfikuj u źródła. Skill jest darmowy, na licencji MIT, ~1500 tokenów.
Pobierz research-discipline z GitHubaFAQ
Czy wybraliście pytanie pod tezę? To było pierwsze pytanie, jakie zadaliśmy po publikacji skilla, wybrane dlatego, że nasze własne dane katalogowe pozwalały je podwójnie zweryfikować. Kontrolowany benchmark z sześcioma wcześniej ustalonymi pytaniami to systematyczna wersja tego testu i potwierdza te same wnioski.
Czy mądrzejszy model uczyniłby skill zbędnym? Baseline w tym teście był aktualnym modelem z pełnym dostępem do sieci. Różnica nie leżała w możliwościach — leżała w domyślnych zachowaniach. Zasady zmieniają domyślne zachowania.
Dlaczego oba przebiegi podały poprawne liczby gwiazdek, ale tylko jeden trafił z rankingiem? Bo dokładność i kompletność zawodzą niezależnie od siebie. Każda liczba podana przez baseline była prawdziwa; błąd tkwił w tym, czego nigdy nie sprawdził. To najgroźniejszy rodzaj błędu w badaniach AI: nic w odpowiedzi nie wygląda na błędne.
A co z tymi +29% tokenów? Zestaw to z token-discipline, który obcina marnowanie tokenów w sesji o około 20% przy pracy wieloetapowej. Dyscyplina w tym, co się czyta, dyscyplina w tym, co się twierdzi — te dwa skille są zaprojektowane, by działać razem.
★ 9.6/10 × 3
Darmowy pakiet startowy
3 skille z naszymi najwyższymi ocenami z testów plus checklista instalacji — zestaw, który sami wgralibyśmy na świeżą maszynę. Za darmo, na e-mail.