
Stessa domanda, stesso modello, una skill: prima e dopo
Un'ora dopo aver pubblicato research-discipline, abbiamo fatto l'esperimento che uno vorrebbe vedere davvero: non un benchmark confezionato, ma una singola domanda dal vivo, posta due volte, con le risposte verificate in pubblico. Questo articolo è il protocollo completo — cosa abbiamo chiesto, cosa ha fatto ciascun run, e ogni passaggio di verifica — così puoi rifarlo tu stesso.
Il setup
La domanda. "Quali sono le skill per Claude Code più popolari in questo momento? Indica i primi 5 repository di skill su GitHub per numero di stelle, con i conteggi attuali. Come si posiziona il repo ufficiale di Anthropic rispetto a quelli della community?" — una domanda con una risposta oggettivamente verificabile che cambia ogni settimana, esattamente il punto dove la ricerca fatta dall'IA marcisce in silenzio.
I due run. Agenti Claude Sonnet identici, stesso prompt, stessi strumenti (ricerca web, web fetch, shell). Un'unica differenza: il secondo agente ha prima letto SKILL.md da una copia di research-discipline installata come farebbe qualsiasi utente —
git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline
Questo è tutto l'intervento: circa ~1,500 token di regole che il modello legge prima di mettersi al lavoro.
L'arbitro. Dopo aver ricevuto entrambe le risposte, abbiamo estratto il numero di stelle di ogni repository citato da almeno una delle due risposte — più i candidati che nessuna delle due aveva menzionato — direttamente dalla GitHub API, l'unica autorità sui propri numeri. Stavolta nessun LLM come giudice nel ciclo: solo gh api repos/<owner>/<repo>.
Cosa è emerso

La risposta baseline sembra ottima. Cinque repository, descrizioni plausibili, conteggi delle stelle esatti alla cifra, una sintesi finale sicura di sé. Se non avessimo controllato, l'avremmo pubblicata così com'era.
Ed è sbagliata nel modo che conta davvero. La vera top-5, verificata sull'API dal vivo, include tre repository che la baseline non ha mai tirato fuori — a quota 228k, 190k e 164k stelle. Non sono oscuri: ognuno è più grande di tre dei cinque repo che la baseline ha nominato. La sua affermazione finale, "il repo ufficiale di Anthropic è secondo solo a Superpowers", è falsa — il repo ufficiale è quinto. Nulla di quello che la baseline ha scritto era inventato; ogni numero fornito era reale. Ha semplicemente risposto a una domanda diversa: "di quali repo parlano i blog post?" — perché le sue sei chiamate agli strumenti erano ricerche web, e i risultati di ricerca sono un concorso di popolarità sulla copertura mediatica, non sulle stelle.
Il run con la skill ha risposto alla domanda che era stata posta. La sua prima regola — le prove devono essere dal vivo; la memoria e i primi risultati di ricerca sono piste, non prove — l'ha spinto dal googlare all'enumerare: ha interrogato direttamente la GitHub API e ha spazzolato tre elenchi di topic GitHub (agent-skills, claude-skills, claude-code-skills) per assicurarsi che nulla di grosso si nascondesse fuori dalla blogosfera. Tutti e cinque i suoi conteggi corrispondevano all'API dal vivo quando li abbiamo riverificati. Ha anche fatto due cose che nessuno gli aveva chiesto ma che un ricercatore scrupoloso farebbe: ha separato i veri repository di skill dalle liste di link curate (la baseline le mescolava), e ha aggiunto due segnalazioni di incertezza — una che nota come diversi repo in cima siano vecchi di pochi mesi con una crescita di stelle insolitamente rapida ([unverified] se sia organica o no), un'altra che ammette che un'affermazione sul marketplace risale a un solo blog ([single-source]). Entrambe le segnalazioni hanno retto al controllo.
Il metodo, spiegato nel dettaglio

Perché un semplice file di testo cambia il comportamento così tanto? Perché il fallimento che colpisce non è ignoranza — il modello baseline sa che GitHub ha un'API — è l'abitudine di default di rispondere con qualunque cosa emerga per prima. La skill trasforma la buona pratica da "qualcosa che il modello potrebbe fare" a "qualcosa che il modello deve fare prima di poter affermare":
- Regola 1 (prove dal vivo) ha imposto il timestamp e le chiamate all'API invece di fidarsi degli snippet di ricerca.
- Regola 3 (fonti indipendenti) è il motivo per cui sono avvenute le scansioni dei topic — un solo percorso di ricerca non basta per un'affermazione portante come una "top 5".
- Regola 5 (non verificato significa dirlo) ha prodotto le due segnalazioni invece di una sicurezza silenziosa.
- Regola 7 (attacca la tua stessa conclusione) è il motivo per cui è andato a cercare repo che avrebbero smontato la sua classifica — e li ha trovati.
I costi onesti, in linea con quanto trovato dal nostro benchmark controllato: il run disciplinato ha usato 11 chiamate agli strumenti contro 6, e 64,445 token contro 49,988 — +29% su questo task. La verifica non è gratis. È solo molto più economica dell'essere sicuri di sé e sbagliati in un documento su cui qualcuno agirà.
Cosa questo non dimostra
Una domanda sola è un aneddoto, non un benchmark — la versione controllata a sei domande con verifica a livello di singola affermazione (13.0% → 5.4% di affermazioni sbagliate) è la prova; questo è solo la dimostrazione. La skill non è nemmeno un oracolo di completezza: nel run controllato una volta ha quotato il prezzo di un piano fornitore e si è persa uno più economico. E i conteggi di stelle qui sopra erano veri il 10 luglio 2026 e cambieranno — il che è, appropriatamente, esattamente il tipo di avvertenza che la skill ti obbliga a scrivere.
PROVALO TU STESSO
L'intero esperimento è riproducibile in dieci minuti: installa la skill, scegli una domanda qualsiasi con numeri verificabili, eseguila due volte, verifica con la fonte primaria. La skill è gratuita, licenza MIT, ~1,500 token.
Scarica research-discipline su GitHubFAQ
Avete scelto la domanda ad hoc? Era la prima domanda che abbiamo eseguito dopo aver pubblicato la skill, scelta perché i dati del nostro stesso catalogo permettevano di ricontrollarla. Il benchmark controllato con sei domande pre-registrate è la versione sistematica, e conferma.
Un modello più intelligente renderebbe la skill superflua? La baseline qui era già un modello attuale con pieno accesso al web. Il divario non era di capacità — era di default. Le regole cambiano i default.
Perché entrambi i run hanno azzeccato i conteggi delle stelle ma solo uno ha azzeccato la classifica? Perché accuratezza e completezza falliscono in modo indipendente. Ogni numero citato dalla baseline era reale; l'errore stava in ciò che non aveva mai cercato. È la modalità di fallimento più pericolosa nella ricerca fatta dall'IA: niente nella risposta sembra sbagliato.
E il +29% di token? Abbinala a token-discipline, che taglia lo spreco di sessione di circa il 20% sui lavori multi-step. Disciplina su cosa leggi, disciplina su cosa affermi — le due sono pensate per funzionare insieme.
★ 9.6/10 × 3
Lo starter pack gratuito
I 3 skill con i nostri punteggi di test più alti, più la checklist di installazione: il setup che metteremmo su una macchina appena formattata. Gratis, via email.