
Allucinazioni IA di Claude: -59% con una skill
Fai una domanda di ricerca a Claude e ottieni qualcosa di pericoloso: una risposta sicura di sé e scritta bene. Che sia vera è una proprietà del tutto separata, e non puoi capirlo solo leggendola. Gestiamo una directory che testa sul campo le skill di Claude, ed è il nostro lavoro — così abbiamo deciso di misurare la cosa sul serio: quante affermazioni fattuali in una tipica risposta di ricerca sono davvero sbagliate, e quante sopravvivono quando costringi il modello a seguire regole di verifica?
Il risultato è research-discipline, la nostra terza skill, e la prima nella sua nicchia a uscire con un benchmark prima/dopo misurato: il 13.0% delle affermazioni nel baseline era sbagliato o superato; con la skill, il 5.4%. Un taglio del 59%. È gratuita e con licenza MIT: github.com/Skillproofdev/research-discipline.
Il vuoto: le pipeline non verificano, i verificatori non fanno ricerca
Prima di scrivere una riga abbiamo passato in rassegna 15 skill pubblicate per ricerca e fact-checking, più il nostro indice di 16,682 skill scoperte. Il panorama si divide in modo netto in due campi che non si incontrano mai.
Le pipeline di deep-research — quelle popolari, fino a 1.6k star — orchestrano ricerche parallele e generano report lunghi. Leggi i loro ruleset e trovi ergonomia del workflow, non epistemologia: nessuna citazione per singola affermazione, nessuna regola sulla qualità delle fonti, nessun obbligo di controllare due volte. I fact-check auditor — perlopiù strumenti per giornalismo e accademia, due ordini di grandezza meno popolari — impongono davvero verdetti e citazioni, ma solo a posteriori, su una bozza finita che qualcuno gli consegna.
Nessuno propone la via di mezzo: una disciplina leggera che governa le affermazioni dell'agente mentre fa ricerca, che la risposta sia di tre paragrafi o di trenta. E, cosa degna di nota, in nessuno dei due campi qualcuno pubblica misurazioni. Il concorrente più rumoroso dichiara di "superare OpenAI, Gemini e Claude Desktop" senza un solo numero a supporto; un altro indica un "95%+ di accuratezza" come obiettivo mai testato. La nicchia va avanti a sensazioni.
Otto regole, tre delle quali inedite
La skill è composta da circa 1,500 token di regole vincolanti (SKILL.md completo). Le parti familiari: ogni affermazione fattuale porta una citazione inline che rimanda a un elenco di fonti datate; le affermazioni non supportate ricevono un flag esplicito [unverified] invece di un tono sicuro di sé; le fonti sono classificate per livello, con i content farm scartati a priori. Le parti che nessun altro impone:
- La memoria è un'ipotesi. Per tutto ciò che è volatile — versioni, prezzi, qualsiasi cosa "attuale" — il ricordo dai dati di training è una pista da verificare, mai una prova. Recupera la data, cerca, poi afferma.
- Due fonti indipendenti per i fatti portanti. L'indipendenza è definita con precisione: due articoli che riscrivono lo stesso comunicato stampa contano come una sola fonte. L'unica implementazione precedente di questo controllo che abbiamo trovato da qualche parte era un gist con una sola star.
- I numeri si citano, non si inventano. Valore, unità e data riportati alla lettera; quando le fonti sono in disaccordo, si riporta l'intervallo con entrambe le citazioni — mai un valore di compromesso silenzioso.
Più un passaggio avversariale con una forcing function presa in prestito dal miglior prior art che abbiamo trovato: cerca una volta il contrario della tua conclusione, trova almeno due debolezze nella tua stessa bozza, oppure riesamina le tue affermazioni più portanti.
Il benchmark: ogni affermazione giudicata su fonti live
Sei domande di ricerca con risposte verificabili in modo oggettivo, scelte prima di qualsiasi run: una ricerca di versione, un confronto di prezzi, un digest di fatti, una query su un repo GitHub, e due trappole. Ogni domanda è stata eseguita due volte — un agente Claude Sonnet nudo, uno che ha letto prima la skill, entrambi con accesso web completo. Poi agenti verificatori indipendenti hanno stabilito la ground truth da fonti primarie live e hanno giudicato una per una tutte le 110 affermazioni fattuali nelle 12 risposte.
| Domanda | Baseline sbagliate/superate | Con la skill |
|---|---|---|
| Catalogo modelli Claude (trappola di obsolescenza) | 3 | 0 |
| Produzione-readiness di Bun (trappola su evento reale) | 1 | 1 |
| Tabella di fatti su Deno | 1 | 0 |
| Fatti sul repo GitHub | 1 | 0 |
| Storia release di Astro | 1 | 1 |
| Confronto prezzi email | 0 | 1 |
| Totale | 7 su 54 (13.0%) | 3 su 56 (5.4%) |
Le due trappole sono dove la skill si è guadagnata da vivere.
La trappola dell'obsolescenza. Interrogato sul catalogo attuale dei modelli Claude, l'agente baseline ha risposto da un riferimento in cache senza un solo controllo live — tre cifre sulla context window sono uscite sbagliate. La Regola 1 dell'agente con la skill ha imposto il fetch della pagina di documentazione live; il verdetto del verificatore: "corrisponde alla documentazione live su ogni singola cifra." Stesso modello, stessa domanda, stessi tool disponibili. L'unica differenza era una regola che dice che la memoria non conta come prova.
La trappola dell'evento reale. Interrogato se Bun sia pronto per la produzione nel 2026, l'agente baseline si è imbattuto nel fatto che Anthropic ha acquisito Bun a dicembre 2025 — e lo ha liquidato come una voce SEO non verificata. Le sue fonti erano blog di terze parti; non ha mai aperto bun.com o anthropic.com, dove si trovano entrambi gli annunci primari. L'agente con la skill ha citato entrambi, e il verificatore li ha confermati live. Rileggi questa frase: l'unico flag di incertezza del baseline in tutto il benchmark era puntato su un evento vero. Lo scetticismo senza verifica è solo un altro modo di sbagliare.
Dove la skill ha perso — pubblicato comunque
La nostra metodologia richiede di mettere le sconfitte accanto alle vittorie, e ce ne sono state due.
Sulla domanda sui prezzi email, il baseline ha davvero battuto la skill: ha calcolato il prezzo di tutti e tre i piani Postmark e trovato il più economico, mentre l'agente con la skill ha calcolato il prezzo di un solo piano, lo ha chiamato "opzione più economica", ed era sbagliato di $2.50/mese. La disciplina delle citazioni non fa i tuoi calcoli al posto tuo — un'enumerazione incompleta è un fallimento di ricerca che le regole non intercettano. E sulla domanda su Bun, l'agente con la skill ha ripetuto il numero di versione sbagliato di una testata tech per una release reale invece di incrociarlo con le release notes del vendor — una fonte di livello 2 a cui si è dato un livello di fiducia di troppo.
Anche questo va detto onestamente: la disciplina costa circa +10% di token — i fetch live e il passaggio avversariale non sono gratis. E su tutte e dodici le risposte, gli ~8 flag proattivi [unverified]/[single-source] della skill sono stati giudicati tutti appropriati, il che è un risultato a sé: la skill non si limita a tagliare le affermazioni sbagliate, ti dice anche quali tra quelle sopravvissute vale la pena ricontrollare.
PACK SKILLPROOF
research-discipline è gratuita. Se vuoi tutto il setup di efficienza attorno ad essa — CLAUDE.md asciugato, audit MCP, e quattro skill testate preconfigurate — quello è l'Optimizer Pack.
Prendi l'Optimizer Pack — $10Installazione
git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline
Riavvia Claude Code. Si attiva su domande di ricerca, "qual è l'ultima versione", confronti e richieste di fact-check — e resta fuori dai piedi per coding, opinioni e lavoro creativo. Si affianca a token-discipline nella nostra serie sulla disciplina: quella taglia quanto costa la ricerca, questa taglia quanto sbaglia.
STARTER PACK GRATUITO
Vuoi le nostre skill con il punteggio più alto più la checklist di installazione che usiamo prima di ogni test? Te le mandiamo via email, gratis.
Ottieni lo starter pack gratuitoFAQ
Sostituisce la deep research integrata di Claude? No — la completa. Le funzioni di ricerca integrate sono generatori di report; questa è un layer di disciplina che si applica a ogni risposta a forma di ricerca, comprese quelle brevi, ed è ispezionabile: puoi leggere tutte e otto le regole in una sola schermata.
Claude non si rifiuterà semplicemente di rispondere quando non può verificare? La skill lo vieta esplicitamente: prove deboli significano rispondere con dei flag, non alzare le spalle. Un "non sono riuscito a confermarlo" attaccato a un'affermazione specifica è più utile sia della falsa sicurezza sia del rifiuto.
Perché solo sei domande? Perché ogni affermazione è stata verificata a mano contro fonti primarie live — 110 affermazioni in 12 risposte, ciascuna con un verdetto controllabile. Preferiamo un benchmark piccolo dove la ground truth è reale a uno grande valutato da un giudice non verificato. Il set di domande e i verdetti per singola affermazione sono nel README del repo.
5.4% è ancora troppo alto? Sì. La skill taglia le affermazioni sbagliate di più della metà; non rende Claude infallibile, e i due errori residui nel nostro stesso benchmark sono documentati sopra. Se sbagliare una decisione costa caro, verifica di persona i fatti portanti — le citazioni della skill fanno sì che ci vogliano minuti invece di ore.
★ 9.6/10 × 3
Lo starter pack gratuito
I 3 skill con i nostri punteggi di test più alti, più la checklist di installazione: il setup che metteremmo su una macchina appena formattata. Gratis, via email.