Claude per l'analisi dati: cosa delegare, cosa tenere

Claude per l'analisi dati: cosa delegare, cosa tenere

Consegna a Claude un CSV e chiedigli di "analizzare questo" e otterrai rapidamente qualcosa: alcune medie, un grafico, un paragrafo di osservazioni. Se tutto ciò sia sicuro da presentare a uno stakeholder è un'altra questione. Il comportamento predefinito è fiducioso indipendentemente dal fatto che l'aritmetica sottostante sia corretta, e un foglio di calcolo con 40.000 righe nasconde bene i suoi errori.

Gestiamo SkillProof, un catalogo dove ogni skill viene installata su una macchina pulita e testata su lavoro reale prima di pubblicare un verdetto. Questa guida copre la categoria dati: cosa gli analisti affidano effettivamente a Claude una volta installata la skill giusta, cosa rimane manuale indipendentemente da quanto gli strumenti migliorino, e un esempio completo di flusso di lavoro da un'esportazione disordinata a una narrazione su cui qualcuno può agire.

Cosa gli analisti delegano effettivamente

Tre compiti costituiscono la maggior parte del valore, e nessuno di essi è "fai l'analisi per me".

Pulizia. Le esportazioni reali arrivano con formati di data misti, ID cliente duplicati da una fusione CRM e unità che cambiano tra le righe perché qualcuno ha modificato manualmente il foglio sorgente. Questo è un lavoro meccanico, noioso, ed esattamente il tipo di lavoro in cui un analista stanco introduce nuovi errori mentre ne corregge di vecchi. È anche il più grande spreco di tempo prima che inizi qualsiasi analisi effettiva.

Scrittura di query. Tradurre "which customers churned after their second renewal but before their third" in una query con window-function corretta contro uno schema che ricordi a malapena. Claude è bravo con SQL. È meno bravo a conoscere le peculiarità del tuo schema a meno che tu non glielo dica, che è la vera competenza in questa categoria: far sì che il modello chieda informazioni su foreign keys e null conventions invece di indovinare.

Trasformare i numeri in una narrazione. Una dashboard ti dice che il numero si è mosso. Non ti dice perché, o se qualcuno dovrebbe preoccuparsene. Scrivere "signups dropped 12% this week, concentrated in the mobile funnel, coinciding with the App Store update on Tuesday" da un'esportazione di metriche è scrittura, non matematica, e la scrittura è ciò per cui sono costruiti i modelli linguistici.

Cosa non si sposta su Claude, anche con una buona skill installata: decidere quale metrica è importante, giudicare se un risultato è praticamente significativo rispetto a meramente statisticamente significativo, e qualsiasi inferenza che si basa su ipotesi su come i dati sono stati raccolti. Una skill può calcolare correttamente un p-value. Non può dirti se il tuo campione fosse effettivamente casuale, perché questo è un fatto sul tuo processo, non sul tuo dataset.

Lo stack dati testato

Ogni skill qui sotto è stata installata in modo pulito e testata su un file reale, non su un CSV demo costruito per far sembrare buona la skill. I punteggi sono su 10, ponderati in base ai criteri di installazione, trigger, output e documentazione. Metodo completo sulla nostra pagina di metodologia. Se non hai mai installato una skill prima, la nostra guida all'installazione copre la configurazione a due comandi per ogni interfaccia.

Data Cleaning (8.8/10, superato) è la skill da installare per prima se i tuoi dati provengono da qualsiasi fonte diversa da un database interno pulito. Il nostro test le ha sottoposto un'esportazione di 60.000 righe con formati di data misti, chiavi duplicate e incongruenze di unità tra colonne che avrebbero dovuto corrispondere. Ha risolto tutte e tre le categorie e, cosa più importante, ha prodotto un log delle modifiche che elenca ogni trasformazione effettuata. Quel log è la differenza tra fidarsi di un file pulito e sperare che vada bene. Senza di esso, "Claude cleaned your data" significa "un processo opaco ha alterato i tuoi numeri", cosa che non puoi difendere in una riunione quando qualcuno chiede perché un totale è cambiato.

SQL Query Writer (9.2/10, superato) è il punteggio più alto nella categoria. L'abbiamo testato su uno schema a 12 tabelle con il tipo di query che fa gemere gli analisti: cohort buckets con window functions e gestione corretta del fuso orario. Abbiamo verificato l'output riga per riga rispetto a un equivalente scritto a mano e corrispondeva. Il punteggio del trigger è un perfetto 5, il che significa che si attiva in modo affidabile su richieste naturali come "show me weekly cohort retention" senza che tu debba nominare la skill o ricordargli cos'è una window function.

Statistical Analysis (8.8/10, superato) ha eseguito test di significatività e una regressione su un dataset di marketing nel nostro test. Il risultato degno di nota: quando gli abbiamo chiesto di trarre una conclusione causale che i dati non potevano supportare, ha rifiutato e spiegato il perché, invece di produrre comunque un paragrafo dal tono fiducioso. Quel rifiuto è l'intero scopo dell'esistenza di questa skill. Uno strumento che ti dà sempre una risposta è peggiore di uno che a volte dice che la domanda è irrisolvibile con ciò che hai, perché il primo tipo ti abitua a smettere di controllare.

Dashboard Builder (8.0/10, superato) trasforma un CSV in una dashboard interattiva autonoma. Il nostro test ha utilizzato un CSV di ricavi e ha restituito tipi di grafici corretti senza elementi superflui, leggibili a colpo d'occhio. Ha ottenuto un punteggio inferiore rispetto agli altri principalmente sulla documentazione, un 3 su 5, perché il README sottovaluta ciò di cui ha bisogno da te prima della prima esecuzione: una riga di intestazione pulita e una decisione su quale colonna sia l'asse temporale.

Metrics Review (7.2/10, funziona con configurazione) è la base del caso d'uso della narrazione settimanale sopra menzionato, e la narrazione che ha prodotto, con anomalie evidenziate, è stata genuinamente utile nei test. L'inghippo: richiede prima l'esportazione delle tue metriche o una connessione MCP di analytics configurata, e quel passaggio di configurazione non è opzionale. Prevedi venti minuti prima della prima esecuzione reale e aspettati di rispondere a qualche domanda su quali metriche siano effettivamente importanti per il tuo team.

Chart Critic è ancora nella nostra coda di test. Lo stiamo eseguendo su un set di grafici deliberatamente fuorvianti per vedere cosa cattura effettivamente prima di pubblicare un verdetto. Vale la pena tenerlo d'occhio se l'onestà dei grafici è un problema ricorrente nel tuo team, ma non è ancora qualcosa per cui possiamo garantire.

STARTER PACK GRATUITO

Vuoi le tre skill dati con il punteggio più alto installate e configurate senza leggere prima cinque README? Ti invieremo il pack più la checklist di configurazione che usiamo prima di ogni test. Gratuito.

Ottieni lo starter pack gratuito

Un flusso di lavoro completo: dall'esportazione alla narrazione

Ecco come appare lo stack concatenato, usando come esempio una revisione settimanale dei ricavi.

1. Esportazione disordinata. Il reparto Finanza rilascia un CSV estratto da tre sistemi di fatturazione dopo un'acquisizione. Le date sono in due formati a seconda del sistema che ha esportato la riga, un sistema usa i centesimi e l'altro i dollari, e circa 200 ID cliente appaiono due volte a causa di una migrazione fallita.

2. Dataset pulito. Data Cleaning normalizza i formati di data, segnala la discrepanza di unità e chiede su quale convenzione di valuta standardizzare invece di indovinare, e de-duplica gli ID cliente usando la mappatura delle chiavi della migrazione stessa. Ottieni un file pulito e un log delle modifiche. Leggi il log prima di procedere. Questo è il punto di controllo in cui cogli un'ipotesi sbagliata prima che si propaghi in ogni numero a valle.

3. SQL. Con i dati puliti caricati, SQL Query Writer costruisce l'aggregazione effettiva: ricavi per coorte, per livello di piano, settimana su settimana, con gestione corretta degli upgrade a metà mese. Qui è dove "quali clienti hanno effettivamente rinnovato" ottiene una risposta precisa invece che approssimativa.

4. Narrazione settimanale. Metrics Review prende l'output della query e i numeri della settimana precedente e scrive il riepilogo: cosa è cambiato, di quanto, e cosa vi ha coinciso. "I ricavi del livello Enterprise sono rimasti stabili ma il numero di posti è diminuito dell'8%, coerentemente con la modifica dei prezzi entrata in vigore il 3."

Quattro passaggi, quattro diversi tipi di lavoro, e ognuno beneficia di una skill costruita specificamente per esso piuttosto che di una singola skill che cerca di fare tutti e quattro male. Questo è lo stesso motivo per cui non raccomandiamo una singola skill "fai analisi dati": pulizia, interrogazione, statistiche e scrittura narrativa sono discipline diverse che per caso condividono un foglio di calcolo.

Il problema della fiducia

Il fatto scomodo sui modelli linguistici e i numeri: un modello può produrre una cifra plausibile, ben formattata, ma completamente sbagliata, e nulla del suo tono ti dirà che tipo di risposta hai ottenuto. Questo non è un bug minore da aggirare. È una proprietà strutturale di come questi modelli generano testo, ed è la ragione per cui "Claude said the number is X" non dovrebbe mai essere l'ultima riga di verifica su qualsiasi cosa che finisca in una presentazione al consiglio.

Ciò che effettivamente mitiga questo, da quanto abbiamo visto nei test, non è un modello più intelligente. È una traccia di audit. Data Cleaning ha ottenuto il suo 8.8 in parte perché il suo log delle modifiche ti permette di controllare ogni trasformazione rispetto al file sorgente. Statistical Analysis ha guadagnato la sua fiducia allo stesso modo: non perché sia sempre corretto, ma perché quando non è sicuro, lo dice invece di riempire il vuoto con un numero dal suono plausibile.

La regola che suggeriamo, e quella che seguiamo noi stessi: non pubblicare mai una cifra non verificata. Se un numero sta per finire in un report, una presentazione o un'email a qualcuno che prenderà una decisione basata su di esso, traccialo fino alla query o al passaggio di pulizia che lo ha prodotto. Questo è un controllo di cinque minuti su un foglio di calcolo che puoi aprire tu stesso. È molto più economico della riunione in cui qualcuno chiede da dove provenga il numero e la risposta onesta è "Claude l'ha detto".

Dove Excel e i documenti si incontrano

Molta analisi reale non finisce in una dashboard. Finisce in un foglio di calcolo che qualcun altro apre, modifica e inoltra. Qui è dove la xlsx skill è importante, ottenendo un punteggio di 9.2/10 nei nostri test su un'esportazione di 40.000 righe con intestazioni malformate, colonne di formule e un foglio riepilogativo pivot.

Il dettaglio che conta davvero qui: scrive formule funzionanti, non valori congelati. Un numero incollato è morto nel momento in cui i dati sorgente cambiano. Un SUMIFS o una tabella pivot live si aggiornano quando le righe sottostanti lo fanno, che è l'intera ragione per cui i fogli di calcolo sopravvivono a differenza dei report markdown. Se Claude restituisce una colonna di numeri dove dovrebbe esserci una formula, hai ottenuto uno snapshot e perso un foglio di calcolo.

Copriamo l'intero set di skill per i documenti, incluso dove PDF e Word si inseriscono nel flusso di lavoro effettivo di un analista, nella nostra guida ai documenti.

SKILLPROOF PACK

Se sei un fondatore che legge i propri numeri invece di aspettare un analista, il Founder Pack raggruppa le skill testate che coprono l'intero ciclo: pulizia, SQL, fogli di calcolo e documenti, installate con un solo comando invece di un pomeriggio di tentativi ed errori.

Ottieni il Founder Pack — $10

Cosa non automatizzeremmo

Ecco la posizione: non lasciare che Claude esegua inferenze statistiche che non potresti controllare tu stesso. Non perché il modello sia scarso in matematica, i nostri test suggeriscono che di solito non lo è, ma perché nel momento in cui non puoi valutare se un'ipotesi è stata mantenuta (indipendenza, dimensione del campione, bias di selezione nel modo in cui i dati sono stati raccolti), hai perso la capacità di rilevarlo quando è sbagliato. Una regressione con un'ipotesi violata stampa comunque un coefficiente. Semplicemente non significa ciò che pensi che significhi, e se non hai compreso il metodo all'inizio, non noterai che l'output ti sta mentendo.

Questo non è un invito a evitare le statistiche. È un invito a mantenere il confine dove deve essere: usa la skill per fare l'aritmetica più velocemente, non per sostituire la comprensione di ciò che l'aritmetica sta affermando. Se un risultato cambiasse una decisione reale, o comprendi il metodo abbastanza bene da verificarlo, o trovi qualcuno che lo faccia prima che venga rilasciato.

FAQ

Claude può davvero analizzare un dataset reale, non solo un CSV demo?

Sì, con una precisazione. I nostri test hanno specificamente evitato file demo puliti: il test di Data Cleaning ha utilizzato un'esportazione autentica di 60.000 righe con il tipo di disordine che i sistemi reali producono, e ha retto. Claude generico senza una skill installata esegue una versione più grezza e meno affidabile dello stesso compito. Il valore della skill risiede principalmente nella traccia di audit, non nella capacità grezza che manca al modello base.

Claude sostituisce un analista dati?

No, e le parti che non tocca sono la vera sostanza del lavoro: decidere quale domanda vale la pena porre, giudicare se un risultato è importante per il business e cogliere un'ipotesi errata prima che diventi una conclusione sbagliata. Sostituisce la parte meccanica intermedia: pulizia, interrogazione, bozza di narrazione. Questo è tempo reale risparmiato, non l'intero lavoro.

Come verifico la pulizia dei dati di Claude prima di fidarmi?

Leggi il log delle modifiche. Una skill di pulizia degna di essere usata ne produce uno: ogni data riformattata, ogni duplicato unito, ogni conversione di unità applicata, elencata rispetto alle righe originali. Se una skill pulisce i tuoi dati silenziosamente senza log, tratta l'output come non verificato, indipendentemente da quanto sembri buono.

Quale skill dovrei installare per prima se ne scelgo solo una?

Data Cleaning. Quasi ogni compito a valle, SQL, statistiche, dashboard, dipende dall'affidabilità dell'input, e la pulizia è il passaggio che la maggior parte delle persone salta o esegue con noncuranza sotto la pressione delle scadenze. La nostra pagina migliori skill dati classifica lo stack completo se desideri la lista ristretta oltre questa.

Claude può scrivere formule in Excel, o si limita a incollare numeri?

Con la xlsx skill installata, scrive formule live: SUMIFS, tabelle pivot, lookup che ricalcolano quando le righe sorgente cambiano. Senza la skill, o con una richiesta generica, è più probabile che tu ottenga valori statici che sembrano corretti il giorno dell'esportazione e diventano obsoleti nel momento in cui i dati si aggiornano.

★ 9.6/10 × 3

Lo starter pack gratuito

I 3 skill con i nostri punteggi di test più alti, più la checklist di installazione: il setup che metteremmo su una macchina appena formattata. Gratis, via email.

Una email con il pack + un breve digest settimanale con i nuovi risultati dei test. Puoi disiscriverti quando vuoi.