Apache Spark (Learning Spark 2nd Ed.)
Anti-sèche Spark optimisé pour l'examen de 'Learning Spark 2nd Ed.' qui signale sa propre coupure de connaissances de 2020.
Testé · Fonctionne
Ce que fait
Une base de connaissances indexée par chapitre distillée de 'Learning Spark, 2nd Edition' couvrant l'architecture Spark, les API DataFrame/Dataset, Spark SQL, le réglage et le streaming structuré, optimisée pour la préparation à l'examen Databricks Associate Developer. Se déclenche sur les questions Apache Spark / PySpark, la préparation à l'examen, ou les frameworks du livre ; signale explicitement ce qu'il NE couvre PAS (Spark Connect, pandas-on-Spark, les valeurs par défaut AQE post-2020) car le livre source les précède.
Rapport de test
Sur une question broadcast vs shuffle join, le tableau de stratégies de jointure de la compétence couvrait les 5 stratégies réelles (BHJ/SMJ/SHJ/BNLJ/Cartesian) par rapport à une base de référence qui n'en nommait que 2, et elle a proactivement divulgué sa propre lacune ('ce livre a été publié en 2020... Spark Connect, Pandas API on Spark, AQE activé par défaut ne sont pas couverts') plutôt que de deviner silencieusement le matériel post-2020.
Testé le: 2026-07-16 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Galius5136/databricks-spark-3.5-cert-prep cd databricks-spark-3.5-cert-prep mkdir -p ~/.claude/skills cp -r skills/apache-spark ~/.claude/skills/apache-spark
Commandes et exemples de prompts
/apache-sparkAnti-sèche Spark optimisé pour l'examen de 'Learning Spark 2nd Ed.' qui signale sa propre coupure de connaissances de 2020.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
should I use a broadcast join or shuffle join for this dataset?explain Structured Streaming windowing for the Databricks examhow does Spark's DataFrame API differ from the Dataset API?