Claude pour l'analyse de données : ce qu'il faut déléguer, ce qu'il faut garder

Claude pour l'analyse de données : ce qu'il faut déléguer, ce qu'il faut garder

Donnez un CSV à Claude et demandez-lui d'« analyser ceci », et vous obtiendrez rapidement quelque chose : quelques moyennes, un graphique, un paragraphe d'observations. Savoir si tout cela est sûr à présenter à un intervenant est une autre question. Le comportement par défaut est confiant, que l'arithmétique sous-jacente soit correcte ou non, et une feuille de calcul de 40 000 lignes masque bien ses erreurs.

Nous gérons SkillProof, un catalogue où chaque skill est installé sur une machine propre et testé sur des tâches réelles avant que nous ne publions un verdict. Ce guide couvre la catégorie de données : ce que les analystes délèguent réellement à Claude une fois le bon skill installé, ce qui reste manuel quelle que soit la qualité des outils, et un exemple complet d'un export désordonné à un récit exploitable.

Ce que les analystes délèguent réellement

Trois tâches constituent l'essentiel de la valeur, et aucune d'entre elles n'est « faites l'analyse pour moi ».

Nettoyage. Les exports réels arrivent avec des formats de date mixtes, des identifiants client en double suite à une fusion de CRM, et des unités qui changent entre les lignes parce que quelqu'un a modifié la feuille source manuellement. C'est mécanique, fastidieux, et exactement le genre de travail où un analyste fatigué introduit de nouvelles erreurs en corrigeant les anciennes. C'est aussi la plus grande perte de temps avant que toute analyse réelle ne commence.

Écriture de requêtes. Traduire « quels clients ont résilié après leur deuxième renouvellement mais avant leur troisième » en une requête window-function correcte contre un schéma dont vous vous souvenez à moitié. Claude est bon en SQL. Il est moins bon pour connaître les particularités de votre schéma à moins que vous ne les lui indiquiez, ce qui est la véritable compétence dans cette catégorie : amener le modèle à poser des questions sur les clés étrangères et les conventions de nullité au lieu de deviner.

Transformer les chiffres en récit. Un tableau de bord vous indique que le chiffre a bougé. Il ne vous dit pas pourquoi, ni si quelqu'un devrait s'en soucier. Écrire « les inscriptions ont chuté de 12 % cette semaine, concentrées dans le tunnel mobile, coïncidant avec la mise à jour de l'App Store mardi » à partir d'un export de métriques est de l'écriture, pas des mathématiques, et l'écriture est ce pour quoi les modèles de langage sont conçus.

Ce qui ne passe pas à Claude, même avec un bon skill installé : décider quelle métrique est importante, juger si un résultat est pratiquement significatif par rapport à simplement statistiquement significatif, et toute inférence qui repose sur des hypothèses concernant la manière dont les données ont été collectées. Un skill peut calculer correctement une p-value. Il ne peut pas vous dire si votre échantillon était réellement aléatoire, car c'est un fait concernant votre processus, pas votre jeu de données.

La pile de données testée

Chaque skill ci-dessous a été installé proprement et exécuté sur un fichier réel, pas un CSV de démonstration conçu pour embellir le skill. Les scores sont sur 10, pondérés selon les critères d'installation, de déclenchement, de sortie et de documentation. Méthode complète sur notre page de méthodologie. Si vous n'avez jamais installé de skill auparavant, notre guide d'installation couvre la configuration en deux commandes pour chaque surface.

Data Cleaning (8.8/10, pass) est celui à installer en premier si vos données proviennent d'ailleurs que d'une base de données interne propre. Notre test lui a soumis un export de 60 000 lignes avec des formats de date mixtes, des clés en double et des incohérences d'unités entre des colonnes qui auraient dû correspondre. Il a corrigé les trois catégories et, plus important encore, a produit un journal des modifications listant chaque transformation effectuée. Ce journal fait la différence entre faire confiance à un fichier nettoyé et espérer qu'il est correct. Sans lui, « Claude a nettoyé vos données » signifie « un processus opaque a modifié vos chiffres », ce qui n'est pas quelque chose que vous pouvez défendre en réunion lorsque quelqu'un demande pourquoi un total a changé.

SQL Query Writer (9.2/10, pass) est le score le plus élevé de la catégorie. Nous l'avons testé sur un schéma à 12 tables avec le genre de requête qui fait gémir les analystes : des cohort buckets avec des window functions et une gestion correcte des fuseaux horaires. Nous avons vérifié la sortie ligne par ligne par rapport à un équivalent écrit à la main et elle correspondait. Le score de déclenchement est un parfait 5, ce qui signifie qu'il se déclenche de manière fiable sur des requêtes naturelles comme "show me weekly cohort retention" sans que vous ayez à nommer le skill ou à lui rappeler ce qu'est une window function.

Statistical Analysis (8.8/10, pass) a effectué des tests de signification et une régression sur un jeu de données marketing lors de notre test. Le résultat à noter : lorsque nous lui avons demandé de tirer une conclusion causale que les données ne pouvaient pas étayer, il a refusé et expliqué pourquoi, plutôt que de produire un paragraphe au ton confiant. Ce refus est la raison d'être de ce skill. Un outil qui vous donne toujours une réponse est pire qu'un outil qui dit parfois que la question est sans réponse avec ce que vous avez, car le premier type vous habitue à ne plus vérifier.

Dashboard Builder (8.0/10, pass) transforme un CSV en un tableau de bord interactif autonome. Notre test a utilisé un CSV de revenus et a obtenu des types de graphiques corrects sans chartjunk, lisibles en un coup d'œil. Il a obtenu un score inférieur aux autres principalement sur la documentation, un 3 sur 5, car le README sous-estime ce dont il a besoin de votre part avant la première exécution : une ligne d'en-tête propre et une décision sur la colonne qui est l'axe temporel.

Metrics Review (7.2/10, works with setup) est ce sur quoi repose le cas d'utilisation du récit hebdomadaire ci-dessus, et le récit qu'il a produit, avec les anomalies signalées, a été réellement utile lors des tests. L'inconvénient : il a besoin de votre export de métriques ou d'une connexion MCP d'analyse configurée au préalable, et cette étape de configuration n'est pas facultative. Prévoyez vingt minutes avant la première exécution réelle, et attendez-vous à répondre à quelques questions sur les métriques qui comptent réellement pour votre équipe.

Chart Critic est toujours dans notre file d'attente de tests. Nous l'exécutons sur un ensemble de graphiques délibérément trompeurs pour voir ce qu'il détecte réellement avant de publier un verdict. À surveiller si l'honnêteté des graphiques est un problème récurrent dans votre équipe, mais ce n'est pas encore quelque chose que nous pouvons garantir.

PACK DE DÉMARRAGE GRATUIT

Vous voulez les trois skills de données les mieux notés installés et configurés sans lire cinq READMEs au préalable ? Nous vous enverrons le pack ainsi que la checklist de configuration que nous utilisons avant chaque test. Gratuit.

Obtenez le pack de démarrage gratuit

Un flux de travail détaillé : de l'export au récit

Voici à quoi ressemble la pile enchaînée, en utilisant une revue hebdomadaire des revenus comme exemple.

1. Export désordonné. Le service financier dépose un CSV extrait de trois systèmes de facturation après une acquisition. Les dates sont dans deux formats différents selon le système qui a exporté la ligne, un système utilise des cents et l'autre des dollars, et environ 200 identifiants client apparaissent deux fois à cause d'une migration bâclée.

2. Jeu de données nettoyé. Data Cleaning normalise les formats de date, signale l'incohérence des unités et demande quelle convention monétaire standardiser plutôt que de deviner, et dédoublonne les identifiants client en utilisant le mappage de clés propre à la migration. Vous obtenez un fichier propre et un journal des modifications. Lisez le journal avant de continuer. C'est le point de contrôle où vous détectez une mauvaise hypothèse avant qu'elle ne se propage à chaque chiffre en aval.

3. SQL. Une fois les données nettoyées chargées, SQL Query Writer construit l'agrégation réelle : revenus par cohorte, par niveau de plan, semaine après semaine, avec une gestion correcte des mises à niveau en milieu de mois. C'est là que la question « quels clients ont réellement renouvelé » reçoit une réponse précise au lieu d'une approximation.

4. Récit hebdomadaire. Metrics Review prend la sortie de la requête et les chiffres de la semaine précédente et rédige le résumé : ce qui a bougé, de combien, et ce qui a coïncidé avec cela. « Les revenus du niveau Enterprise sont restés stables, mais le nombre de sièges a chuté de 8 %, ce qui est cohérent avec le changement de prix entré en vigueur le 3. »

Quatre étapes, quatre types de travail différents, et chacune bénéficie d'un skill conçu spécifiquement pour elle plutôt que d'un seul skill essayant de faire les quatre mal. C'est la même raison pour laquelle nous ne recommandons pas un seul skill « faire de l'analyse de données » : le nettoyage, l'interrogation, les statistiques et la rédaction de récits sont des disciplines différentes qui partagent une feuille de calcul.

Le problème de la confiance

Le fait inconfortable concernant les modèles de langage et les chiffres : un modèle peut produire un chiffre plausible, bien formaté, mais entièrement faux, et rien dans son ton ne vous dira quel type de réponse vous avez obtenu. Ce n'est pas un bug mineur à contourner. C'est une propriété structurelle de la façon dont ces modèles génèrent du texte, et c'est la raison pour laquelle « Claude a dit que le chiffre est X » ne devrait jamais être la dernière ligne de vérification pour tout ce qui figure dans une présentation au conseil d'administration.

Ce qui atténue réellement cela, d'après ce que nous avons vu lors des tests, n'est pas un modèle plus intelligent. C'est une piste d'audit. Data Cleaning a obtenu son 8.8 en partie parce que son journal des modifications vous permet de vérifier chaque transformation par rapport au fichier source. Statistical Analysis a gagné sa confiance de la même manière : non pas parce qu'il a toujours raison, mais parce que lorsqu'il n'est pas confiant, il le dit au lieu de combler le vide avec un chiffre plausible.

La règle que nous suggérons, et celle que nous suivons nous-mêmes : ne jamais publier un chiffre non vérifié. Si un chiffre est destiné à un rapport, une présentation ou un e-mail à quelqu'un qui prendra une décision basée sur celui-ci, retracez-le jusqu'à la requête ou l'étape de nettoyage qui l'a produit. C'est une vérification de cinq minutes sur une feuille de calcul que vous pouvez ouvrir vous-même. C'est beaucoup moins cher que la réunion où quelqu'un demande d'où vient le chiffre et que la réponse honnête est « Claude l'a dit ».

Là où Excel et les documents se rencontrent

Beaucoup d'analyses réelles ne se terminent pas par un tableau de bord. Elles se terminent par une feuille de calcul que quelqu'un d'autre ouvre, modifie et transmet. C'est là que le skill xlsx est important, obtenant un score de 9.2/10 lors de nos tests sur un export de 40 000 lignes avec des en-têtes mal formés, des colonnes de formules et une feuille de résumé de tableau croisé dynamique.

Le détail qui compte réellement ici : il écrit des formules fonctionnelles, pas des valeurs figées. Un nombre collé est mort dès que les données source changent. Un SUMIFS ou un tableau croisé dynamique en direct se met à jour lorsque les lignes sous-jacentes le font, ce qui est la raison pour laquelle les feuilles de calcul survivent, contrairement aux rapports markdown. Si Claude vous rend une colonne de chiffres là où une formule devrait être, vous avez gagné un instantané et perdu une feuille de calcul.

Nous couvrons l'ensemble complet des skills de documents, y compris la place des PDF et Word dans le flux de travail réel d'un analyste, dans notre guide des documents.

PACK SKILLPROOF

Si vous êtes un fondateur qui lit ses propres chiffres au lieu d'attendre un analyste, le Founder Pack regroupe les skills testés qui couvrent la boucle complète : nettoyage, SQL, feuilles de calcul et documents, installés en une seule commande au lieu d'un après-midi d'essais et d'erreurs.

Obtenez le Founder Pack — $10

Ce que nous n'automatiserions pas

Voici notre position : ne laissez pas Claude effectuer des inférences statistiques que vous ne pourriez pas vérifier vous-même. Non pas parce que le modèle est mauvais en mathématiques, nos tests suggèrent que ce n'est généralement pas le cas, mais parce qu'au moment où vous ne pouvez pas évaluer si une hypothèse a été respectée (indépendance, taille de l'échantillon, biais de sélection dans la manière dont les données ont été collectées), vous avez perdu la capacité de détecter l'erreur. Une régression avec une hypothèse violée affiche toujours un coefficient. Cela ne signifie simplement pas ce que vous pensez que cela signifie, et si vous n'avez pas compris la méthode au départ, vous ne remarquerez pas que la sortie vous ment.

Ce n'est pas un appel à éviter les statistiques. C'est un appel à maintenir la limite là où elle doit être : utilisez le skill pour effectuer les calculs plus rapidement, non pour remplacer la compréhension de ce que les calculs affirment. Si un résultat devait changer une décision réelle, soit vous comprenez suffisamment bien la méthode pour la vérifier, soit vous trouvez quelqu'un qui le fait avant de la publier.

FAQ

Claude peut-il réellement analyser un jeu de données réel, et pas seulement un CSV de démonstration ?

Oui, avec une mise en garde. Nos tests ont spécifiquement évité les fichiers de démonstration propres : le test Data Cleaning a utilisé un véritable export de 60 000 lignes avec le genre de désordre que produisent les systèmes réels, et il a tenu bon. Claude à usage général sans skill installé effectue une version plus rudimentaire et moins responsable de la même tâche. La valeur du skill réside principalement dans la piste d'audit, et non dans la capacité brute que le modèle de base n'a pas.

Claude remplace-t-il un analyste de données ?

Non, et les parties qu'il ne touche pas sont la substance réelle du travail : décider quelle question mérite d'être posée, juger si un résultat est important pour l'entreprise, et détecter une hypothèse erronée avant qu'elle ne devienne une mauvaise conclusion. Il remplace le travail mécanique intermédiaire : nettoyage, interrogation, rédaction de premier jet. C'est un gain de temps réel, pas l'intégralité du travail.

Comment vérifier le nettoyage de données de Claude avant de lui faire confiance ?

Lisez le journal des modifications. Un skill de nettoyage digne d'être utilisé en produit un : chaque date reformatée, chaque doublon fusionné, chaque conversion d'unité appliquée, listé par rapport aux lignes originales. Si un skill nettoie vos données silencieusement sans journal, traitez la sortie comme non vérifiée, quelle que soit son apparence.

Quel skill devrais-je installer en premier si je n'en choisis qu'un ?

Data Cleaning. Presque toutes les tâches en aval, SQL, statistiques, tableaux de bord, dépendent de la fiabilité des données d'entrée, et le nettoyage est l'étape que la plupart des gens sautent ou effectuent négligemment sous la pression des délais. Notre page meilleurs skills de données classe la pile complète si vous voulez la liste restreinte au-delà de celle-ci.

Claude peut-il écrire des formules dans Excel, ou se contente-t-il de coller des chiffres ?

Avec le skill xlsx installé, il écrit des formules actives : SUMIFS, tableaux croisés dynamiques, recherches qui se recalculent lorsque les lignes source changent. Sans le skill, ou avec une requête générique, vous êtes plus susceptible d'obtenir des valeurs statiques qui semblent correctes le jour de l'exportation et deviennent obsolètes dès que les données sont mises à jour.

★ 9.6/10 × 3

Le pack de démarrage gratuit

Les 3 skills avec nos meilleurs scores de test, plus la checklist d'installation — le setup qu'on mettrait sur une machine neuve. Gratuit, par e-mail.

Un e-mail avec le pack + un court digest hebdomadaire des nouveaux résultats de test. Désinscription à tout moment.