To samo pytanie, ten sam model: research-discipline na żywo

To samo pytanie, ten sam model: research-discipline na żywo

Godzinę po publikacji research-discipline przeprowadziliśmy eksperyment, który naprawdę warto zobaczyć: nie wyselekcjonowany benchmark, tylko jedno pytanie na żywo, zadane dwa razy, z odpowiedziami sprawdzonymi publicznie. Ten artykuł to pełny protokół — co zapytaliśmy, co zrobił każdy przebieg i każdy krok weryfikacji — żebyś mógł powtórzyć eksperyment samodzielnie.

Ustawienie eksperymentu

Pytanie. "Jakie są obecnie najpopularniejsze skille Claude Code? Podaj top 5 repozytoriów skilli na GitHubie według liczby gwiazdek, z aktualnymi liczbami. Jak oficjalne repozytorium Anthropic wypada na tle repozytoriów społeczności?" — pytanie z obiektywnie sprawdzalną odpowiedzią, która zmienia się co tydzień, czyli dokładnie tam, gdzie badania AI po cichu się dezaktualizują.

Dwa przebiegi. Identyczne agenty Claude Sonnet, identyczny prompt, identyczne narzędzia (wyszukiwanie w sieci, pobieranie stron, powłoka). Jedna różnica: drugi agent najpierw przeczytał SKILL.md z kopii research-discipline zainstalowanej tak, jak zrobiłby to każdy użytkownik —

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

To cała interwencja: ~1500 tokenów zasad, które model czyta przed rozpoczęciem pracy.

Sędzia. Gdy obie odpowiedzi wróciły, pobraliśmy liczbę gwiazdek każdego repozytorium wymienionego w którejkolwiek odpowiedzi — plus kandydatów, o których nie wspomniano w żadnej — bezpośrednio z API GitHuba, jedynego autorytetu w sprawie własnych liczb. Bez LLM-a jako sędziego w tej rundzie; tylko gh api repos/<owner>/<repo>.

Co wyszło

Prawdziwy top-5 repozytoriów skilli według gwiazdek i które z nich pominęło badanie bazowe

Odpowiedź bazowa wygląda świetnie. Pięć repozytoriów, wiarygodne opisy, liczby gwiazdek zgodne co do cyfry, pewna siebie synteza na koniec. Gdybyśmy nie sprawdzili, wysłalibyśmy ją bez wahania.

Jest błędna w sposób, który ma znaczenie. Prawdziwe top 5, zweryfikowane względem API na żywo, obejmuje trzy repozytoria, których baseline w ogóle nie wykrył — z 228 tys., 190 tys. i 164 tys. gwiazdek. To nie są jakieś niszowe projekty: każde z nich jest większe niż trzy z pięciu repozytoriów, które baseline faktycznie wymienił. Jego końcowe stwierdzenie, "oficjalne repozytorium Anthropic jest drugie zaraz po Superpowers", jest fałszywe — oficjalne repozytorium jest piąte. Nic, co napisał baseline, nie było zmyślone; każda liczba, którą podał, była prawdziwa. Po prostu odpowiedział na inne pytanie: "o jakich repozytoriach piszą blogi?" — bo jego sześć wywołań narzędzi to było wyszukiwanie w sieci, a wyniki wyszukiwania to konkurs popularności w zasięgu, nie w gwiazdkach.

Przebieg ze skillem odpowiedział na pytanie, które zostało zadane. Jego pierwsza zasada — dowód musi być aktualny; pamięć i pierwsza strona wyników wyszukiwania to tropy, nie dowody — przesunęła go od googlowania do enumeracji: odpytał bezpośrednio API GitHuba i przeszedł trzy listy tematów GitHuba (agent-skills, claude-skills, claude-code-skills), żeby upewnić się, że nic dużego nie ukrywa się poza blogosferą. Wszystkie pięć jego liczb zgadzało się z API na żywo przy ponownym sprawdzeniu. Zrobił też dwie rzeczy, o które nikt nie prosił, ale zrobiłby je każdy rzetelny badacz: oddzielił faktyczne repozytoria skilli od kuratorowanych list linków (baseline je pomieszał) i dołączył dwie flagi niepewności — jedną zaznaczającą, że kilka czołowych repozytoriów ma zaledwie kilka miesięcy i nietypowo szybki wzrost gwiazdek ([unverified], czy to organiczny wzrost), drugą przyznającą, że twierdzenie o marketplace opiera się na jednym blogu ([single-source]). Obie flagi wytrzymały weryfikację.

Metoda, punkt po punkcie

Baseline kontra przebieg ze skillem: wywołania narzędzi, zachowanie i koszt tokenów

Dlaczego plik tekstowy zmienia zachowanie aż tak bardzo? Bo problem, który skill rozwiązuje, to nie niewiedza — baseline wie, że GitHub ma API — tylko domyślny nawyk odpowiadania na podstawie tego, co wyskoczy jako pierwsze. Skill zamienia dobrą praktykę z "czegoś, co model może zrobić" w "coś, co model musi zrobić, zanim wolno mu cokolwiek twierdzić":

  1. Zasada 1 (dowód na żywo) wymusiła znacznik daty i wywołania API zamiast zaufania fragmentom z wyszukiwarki.
  2. Zasada 3 (niezależne źródła) to powód, dla którego doszło do przeglądu tematów — jedna ścieżka wyszukiwania to za mało dla obciążającego twierdzenia "top 5".
  3. Zasada 5 (niezweryfikowane znaczy powiedzieć niezweryfikowane) dała dwie flagi zamiast cichej pewności.
  4. Zasada 7 (zaatakuj własny wniosek) to powód, dla którego skill szukał repozytoriów, które mogłyby złamać jego własny ranking — i znalazł je.

Uczciwe koszty, tak samo jak w naszym kontrolowanym benchmarku: zdyscyplinowany przebieg zużył 11 wywołań narzędzi wobec 6 i 64 445 tokenów wobec 49 988 — +29% na tym zadaniu. Weryfikacja nie jest darmowa. Jest po prostu dużo tańsza niż bycie pewnym siebie i błędnym w dokumencie, na podstawie którego ktoś działa.

Czego to nie dowodzi

Jedno pytanie to anegdota, nie benchmark — kontrolowana wersja z sześcioma pytaniami i weryfikacją na poziomie twierdzeń (13,0% → 5,4% błędnych twierdzeń) to dowód; to jest demonstracja. Skill też nie jest wyrocznią kompletności: w kontrolowanym przebiegu raz podał cenę jednego poziomu u dostawcy, pomijając tańszy. A liczby gwiazdek powyżej były prawdziwe 10 lipca 2026 i się zdezaktualizują — co, nomen omen, jest dokładnie tym zastrzeżeniem, które skill każe napisać.

SPRAWDŹ SAM

Cały eksperyment da się powtórzyć w dziesięć minut: zainstaluj skill, wybierz dowolne pytanie z policzalnymi liczbami, uruchom je dwa razy, zweryfikuj u źródła. Skill jest darmowy, na licencji MIT, ~1500 tokenów.

Pobierz research-discipline z GitHuba

FAQ

Czy wybraliście pytanie pod tezę? To było pierwsze pytanie, jakie zadaliśmy po publikacji skilla, wybrane dlatego, że nasze własne dane katalogowe pozwalały je podwójnie zweryfikować. Kontrolowany benchmark z sześcioma wcześniej ustalonymi pytaniami to systematyczna wersja tego testu i potwierdza te same wnioski.

Czy mądrzejszy model uczyniłby skill zbędnym? Baseline w tym teście był aktualnym modelem z pełnym dostępem do sieci. Różnica nie leżała w możliwościach — leżała w domyślnych zachowaniach. Zasady zmieniają domyślne zachowania.

Dlaczego oba przebiegi podały poprawne liczby gwiazdek, ale tylko jeden trafił z rankingiem? Bo dokładność i kompletność zawodzą niezależnie od siebie. Każda liczba podana przez baseline była prawdziwa; błąd tkwił w tym, czego nigdy nie sprawdził. To najgroźniejszy rodzaj błędu w badaniach AI: nic w odpowiedzi nie wygląda na błędne.

A co z tymi +29% tokenów? Zestaw to z token-discipline, który obcina marnowanie tokenów w sesji o około 20% przy pracy wieloetapowej. Dyscyplina w tym, co się czyta, dyscyplina w tym, co się twierdzi — te dwa skille są zaprojektowane, by działać razem.

★ 9.6/10 × 3

Darmowy pakiet startowy

3 skille z naszymi najwyższymi ocenami z testów plus checklista instalacji — zestaw, który sami wgralibyśmy na świeżą maszynę. Za darmo, na e-mail.

Jeden e-mail z pakietem + krótki cotygodniowy przegląd nowych wyników testów. Wypiszesz się, kiedy chcesz.