Claude voor Data-analyse: Wat uitbesteden, wat behouden

Claude voor Data-analyse: Wat uitbesteden, wat behouden

Geef Claude een CSV en vraag het om "dit te analyseren" en je krijgt snel iets terug: een paar gemiddelden, een grafiek, een paragraaf met observaties. Of dit veilig is om aan een stakeholder te presenteren, is een andere vraag. Het standaardgedrag is zelfverzekerd, ongeacht of de onderliggende rekenkunde klopt, en een spreadsheet met 40.000 rijen verbergt zijn fouten goed.

Wij beheren SkillProof, een catalogus waar elke vaardigheid op een schone machine wordt geïnstalleerd en getest tegen echt werk voordat we een oordeel publiceren. Deze gids behandelt de data category: wat analisten daadwerkelijk aan Claude uitbesteden zodra de juiste vaardigheid is geïnstalleerd, wat handmatig blijft, hoe goed de tools ook worden, en een volledig uitgewerkt voorbeeld van een rommelige export naar een narratief waarop iemand kan handelen.

Wat analisten daadwerkelijk uitbesteden

Drie taken vormen het grootste deel van de waarde, en geen daarvan is "doe de analyse voor mij."

Opschonen. Echte exports komen aan met gemengde datumformaten, dubbele klant-ID's van een CRM-samenvoeging, en eenheden die tussen rijen wisselen omdat iemand het bronblad handmatig heeft bewerkt. Dit is mechanisch, vervelend en precies het soort werk waarbij een vermoeide analist nieuwe fouten introduceert terwijl oude worden opgelost. Het is ook de grootste tijdvreter voordat enige daadwerkelijke analyse begint.

Query's schrijven. Het vertalen van "welke klanten zijn gechurned na hun tweede verlenging, maar vóór hun derde" naar een correcte window-function query tegen een schema dat je je half herinnert. Claude is goed in SQL. Het is minder goed in het kennen van de eigenaardigheden van je schema, tenzij je het vertelt, wat de eigenlijke vaardigheid in deze categorie is: het model vragen naar foreign keys en null-conventies in plaats van te gokken.

Cijfers omzetten in een narratief. Een dashboard vertelt je dat het aantal is verschoven. Het vertelt je niet waarom, of waarom iemand zich erom zou moeten bekommeren. Het schrijven van "aanmeldingen zijn deze week met 12% gedaald, geconcentreerd in de mobiele funnel, samenvallend met de App Store-update van dinsdag" vanuit een metrics-export is schrijven, geen wiskunde, en schrijven is waar taalmodellen voor zijn gebouwd.

Wat niet naar Claude gaat, zelfs met een goede vaardigheid geïnstalleerd: beslissen welke metric belangrijk is, beoordelen of een resultaat praktisch significant is versus slechts statistisch significant, en elke inferentie die berust op aannames over hoe de data is verzameld. Een vaardigheid kan een p-waarde correct berekenen. Het kan je niet vertellen of je steekproef daadwerkelijk willekeurig was, want dat is een feit over je proces, niet over je dataset.

De geteste datastack

Elke onderstaande vaardigheid werd schoon geïnstalleerd en uitgevoerd op een echt bestand, niet op een demo-CSV die is gemaakt om de vaardigheid er goed uit te laten zien. Scores zijn uit 10, gewogen op basis van installatie-, trigger-, output- en documentatiecriteria. De volledige methode vind je op onze methodology page. Als je nog nooit een vaardigheid hebt geïnstalleerd, behandelt onze install guide de twee-commando-setup voor elk oppervlak.

Data Cleaning (8.8/10, pass) is degene die je als eerste moet installeren als je data ergens anders vandaan komt dan een schone interne database. Onze test gooide er een export van 60.000 rijen tegenaan met gemengde datumformaten, dubbele sleutels en eenheidsinconsistenties tussen kolommen die hadden moeten overeenkomen. Het loste alle drie de categorieën op en, belangrijker nog, produceerde een wijzigingslogboek met elke transformatie die het uitvoerde. Dat logboek is het verschil tussen een opgeschoond bestand vertrouwen en hopen dat het goed is. Zonder dat betekent "Claude heeft je data opgeschoond" "een ondoorzichtig proces heeft je cijfers gewijzigd", wat je niet kunt verdedigen in een vergadering wanneer iemand vraagt waarom een totaal is verschoven.

SQL Query Writer (9.2/10, pass) is de hoogste score in de categorie. We hebben het getest tegen een 12-tabel schema met het soort query dat analisten doet zuchten: cohort buckets met window functions en correcte tijdzone-afhandeling. We hebben de output rij voor rij geverifieerd tegen een handgeschreven equivalent en het kwam overeen. De trigger score is een perfecte 5, wat betekent dat het betrouwbaar reageert op natuurlijke verzoeken zoals "toon me wekelijkse cohortretentie" zonder dat je de vaardigheid hoeft te benoemen of eraan hoeft te herinneren wat een window function is.

Statistical Analysis (8.8/10, pass) voerde significantietests en een regressie uit op een marketingdataset in onze test. Het opmerkelijke resultaat: toen we het vroegen om een causale conclusie te trekken die de data niet kon ondersteunen, weigerde het en legde uit waarom, in plaats van toch een zelfverzekerd klinkende paragraaf te produceren. Die weigering is het hele punt van het bestaan van deze vaardigheid. Een tool die je altijd een antwoord geeft, is erger dan een die soms zegt dat de vraag onbeantwoordbaar is met wat je hebt, omdat het eerste type je traint om te stoppen met controleren.

Dashboard Builder (8.0/10, pass) verandert een CSV in een zelfstandig interactief dashboard. Onze test gebruikte een omzet-CSV en kreeg correcte grafiektypen terug zonder overbodige elementen, in één oogopslag leesbaar. Het scoorde lager dan de andere, voornamelijk op documentatie, een 3 uit 5, omdat de README onderschat wat het van je nodig heeft vóór de eerste uitvoering: een schone headerrij en een beslissing over welke kolom de tijdas is.

Metrics Review (7.2/10, works with setup) is waarop de wekelijkse narratieve use case hierboven is gebouwd, en het narratief dat het produceerde, met benoemde afwijkingen, was oprecht nuttig bij het testen. De vangst: het heeft eerst je metrics-export of een analytics MCP-verbinding nodig, en die setup-stap is niet optioneel. Reserveer twintig minuten vóór de eerste echte uitvoering, en verwacht een paar vragen te beantwoorden over welke metrics daadwerkelijk belangrijk zijn voor je team.

Chart Critic staat nog in onze testwachtrij. We testen het tegen een reeks opzettelijk misleidende grafieken om te zien wat het daadwerkelijk opmerkt voordat we een oordeel publiceren. De moeite waard om in de gaten te houden als grafiekeerlijkheid een terugkerend probleem is in je team, maar nog niet iets waar we voor kunnen instaan.

GRATIS STARTERSPAKKET

Wil je de drie hoogst scorende data-vaardigheden geïnstalleerd en geconfigureerd hebben zonder eerst vijf README's te lezen? We mailen je het pakket plus de setup-checklist die we gebruiken vóór elke test. Gratis.

Ontvang het gratis starterspakket

Een uitgewerkte workflow: export naar narratief

Zo ziet de stack eruit wanneer deze aan elkaar gekoppeld is, met een wekelijkse omzetoverzicht als voorbeeld.

1. Rommelige export. Finance levert een CSV aan, afkomstig van drie facturatiesystemen na een overname. Datums zijn in twee formaten, afhankelijk van welk systeem de rij exporteerde, het ene systeem gebruikt centen en het andere dollars, en ongeveer 200 klant-ID's verschijnen twee keer vanwege een mislukte migratie.

2. Opgeschoonde dataset. Data Cleaning normaliseert de datumformaten, markeert de eenheidsmismatch en vraagt welke valuta-conventie moet worden gestandaardiseerd in plaats van te gokken, en verwijdert dubbele klant-ID's met behulp van de eigen sleutelmapping van de migratie. Je krijgt een schoon bestand en een wijzigingslogboek. Lees het logboek voordat je verdergaat. Dit is het controlepunt waar je een verkeerde aanname opvangt voordat deze zich verspreidt naar elk cijfer stroomafwaarts.

3. SQL. Met de opgeschoonde data geladen, bouwt SQL Query Writer de daadwerkelijke aggregatie: omzet per cohort, per plan-tier, week op week, met correcte afhandeling van mid-maand upgrades. Dit is waar "welke klanten daadwerkelijk verlengden" precies wordt beantwoord in plaats van bij benadering.

4. Wekelijks narratief. Metrics Review neemt de query-output en de cijfers van de vorige week en schrijft de samenvatting: wat is er verschoven, met hoeveel, en wat viel ermee samen. "De omzet van de Enterprise-tier bleef stabiel, maar het aantal seats daalde met 8%, consistent met de prijswijziging die op de 3e van kracht werd."

Vier stappen, vier verschillende soorten werk, en elk profiteert van een vaardigheid die er specifiek voor is gebouwd, in plaats van één vaardigheid die alle vier slecht probeert te doen. Dit is dezelfde reden waarom we geen enkele "doe data-analyse" vaardigheid aanbevelen: opschonen, query's uitvoeren, statistieken en narratief schrijven zijn verschillende disciplines die toevallig een spreadsheet delen.

Het vertrouwensprobleem

Het ongemakkelijke feit over taalmodellen en cijfers: een model kan een plausibel, goed geformatteerd, volledig verkeerd cijfer produceren, en niets aan de toon zal je vertellen welk soort antwoord je hebt gekregen. Dit is geen kleine bug om te omzeilen. Het is een structurele eigenschap van hoe deze modellen tekst genereren, en het is de reden waarom "Claude zei dat het getal X is" nooit de laatste verificatielijn mag zijn voor iets dat in een board deck terechtkomt.

Wat dit daadwerkelijk verzacht, zo hebben we gezien bij het testen, is geen slimmer model. Het is een audittrail. Data Cleaning verdiende zijn 8.8 deels omdat het wijzigingslogboek je in staat stelt elke transformatie te controleren tegen het bronbestand. Statistical Analysis verdiende zijn vertrouwen op dezelfde manier: niet omdat het altijd gelijk heeft, maar omdat het, wanneer het niet zeker is, dit aangeeft in plaats van de leegte op te vullen met een plausibel klinkend cijfer.

De regel die we zouden suggereren, en degene die we zelf volgen: publiceer nooit een ongecontroleerd cijfer. Als een getal in een rapport, een presentatie of een e-mail terechtkomt aan iemand die er een beslissing op zal baseren, traceer het dan terug naar de query of de opschoonstap die het heeft geproduceerd. Dat is een controle van vijf minuten tegen een spreadsheet die je zelf kunt openen. Het is veel goedkoper dan de vergadering waarin iemand vraagt waar het getal vandaan kwam en het eerlijke antwoord is "Claude zei het."

Waar Excel en documenten elkaar kruisen

Veel echte analyse eindigt niet in een dashboard. Het eindigt in een spreadsheet die iemand anders opent, bewerkt en doorstuurt. Dit is waar de xlsx skill van belang is, met een score van 9.2/10 in onze tests op een export van 40.000 rijen met verkeerd gevormde headers, formulekolommen en een draaitabeloverzicht.

Het detail dat hier echt telt: het schrijft werkende formules, geen bevroren waarden. Een geplakt getal is dood zodra de brongegevens veranderen. Een live SUMIFS of een draaitabel wordt bijgewerkt wanneer de onderliggende rijen dat doen, wat de hele reden is dat spreadsheets overleven op een manier die markdown-rapporten niet doen. Als Claude een kolom met cijfers teruggeeft waar een formule zou moeten staan, heb je een momentopname gekregen en een spreadsheet verloren.

We behandelen de volledige documentvaardigheden, inclusief waar PDF en Word passen in de daadwerkelijke workflow van een analist, in our documents guide.

SKILLPROOF PAKKET

Als je een oprichter bent die zijn eigen cijfers leest in plaats van te wachten op een analist, bundelt het Founder Pack de geteste vaardigheden die de hele cyclus bestrijken: opschonen, SQL, spreadsheets en documenten, geïnstalleerd met één commando in plaats van een middag vol vallen en opstaan.

Ontvang het Founder Pack — $10

Wat we niet zouden automatiseren

Dit is ons standpunt: laat Claude geen statistische inferentie uitvoeren die je zelf niet zou kunnen controleren. Niet omdat het model slecht is in wiskunde – onze tests suggereren dat dit meestal niet het geval is – maar omdat op het moment dat je niet kunt evalueren of een aanname standhield (onafhankelijkheid, steekproefgrootte, selectiebias in hoe de data werd verzameld), je het vermogen verliest om een fout te ontdekken. Een regressie met een geschonden aanname print nog steeds een coëfficiënt. Het betekent alleen niet wat je denkt dat het betekent, en als je de methode vooraf niet begreep, zul je niet merken dat de output tegen je liegt.

Dit is geen oproep om statistieken te vermijden. Het is een oproep om de grens te bewaren waar deze hoort: gebruik de vaardigheid om de rekenkunde sneller uit te voeren, niet om het begrip te vervangen van wat de rekenkunde beweert. Als een resultaat een echte beslissing zou veranderen, dan moet je de methode goed genoeg begrijpen om deze te controleren, of je vindt iemand die dat doet voordat het wordt gepubliceerd.

Veelgestelde vragen

Kan Claude daadwerkelijk een echte dataset analyseren, niet alleen een demo-CSV?

Ja, met een kanttekening. Onze tests vermeden specifiek schone demo-bestanden: de Data Cleaning test gebruikte een echte export van 60.000 rijen met het soort rommel dat echte systemen produceren, en het hield stand. Algemene Claude zonder een geïnstalleerde vaardigheid doet een ruwere, minder verantwoorde versie van dezelfde taak. De waarde van de vaardigheid zit voornamelijk in de audittrail, niet in de ruwe capaciteit die het basismodel mist.

Vervangt Claude een data-analist?

Nee, en de delen die het niet aanraakt, zijn de daadwerkelijke inhoud van de functie: beslissen welke vraag het waard is om te stellen, beoordelen of een resultaat belangrijk is voor het bedrijf, en een gebrekkige aanname opvangen voordat deze een verkeerde conclusie wordt. Het vervangt het mechanische midden: opschonen, query's uitvoeren, eerste concept narratief. Dat is echte tijdsbesparing, niet de hele baan.

Hoe controleer ik de data-opschoning van Claude voordat ik het vertrouw?

Lees het wijzigingslogboek. Een opschoonvaardigheid die de moeite waard is, produceert er een: elke geherformatteerde datum, elke samengevoegde duplicaat, elke toegepaste eenheidsconversie, vermeld tegen de originele rijen. Als een vaardigheid je data stilzwijgend opschoont zonder logboek, behandel de output dan als ongeverifieerd, ongeacht hoe goed het eruitziet.

Welke vaardigheid moet ik als eerste installeren als ik er maar één kies?

Data Cleaning. Bijna elke downstream taak, SQL, statistieken, dashboards, hangt af van betrouwbare invoer, en opschonen is de stap die de meeste mensen overslaan of onzorgvuldig doen onder tijdsdruk. Onze best data skills pagina rangschikt de volledige stack als je de shortlist buiten deze wilt.

Kan Claude formules schrijven in Excel, of plakt het alleen cijfers?

Met de xlsx skill geïnstalleerd, schrijft het live formules: SUMIFS, draaitabellen, lookups die opnieuw berekenen wanneer bronrijen veranderen. Zonder de vaardigheid, of met een generiek verzoek, krijg je waarschijnlijk statische waarden die er op de exportdag goed uitzien en verouderd raken zodra de data wordt bijgewerkt.

★ 9.6/10 × 3

Het gratis starterspakket

De 3 skills met onze hoogste testscores plus de installatiechecklist — de setup die wij op een verse machine zouden zetten. Gratis, per e-mail.

Eén e-mail met het pakket + een korte wekelijkse digest met nieuwe testresultaten. Uitschrijven kan altijd.