Apache Spark (Learning Spark 2nd Ed.)

Anti-sèche Spark optimisé pour l'examen de 'Learning Spark 2nd Ed.' qui signale sa propre coupure de connaissances de 2020.

par Galius5136 · Galius5136/databricks-spark-3.5-cert-prep

Testé · Fonctionne ★ 8.8/10

Apache Spark (Learning Spark 2nd Ed.) — Anti-sèche Spark optimisé pour l'examen de 'Learning Spark 2nd Ed.' qui signale sa propre coupure de connaissances de 2020.

Ce que fait

Une base de connaissances indexée par chapitre distillée de 'Learning Spark, 2nd Edition' couvrant l'architecture Spark, les API DataFrame/Dataset, Spark SQL, le réglage et le streaming structuré, optimisée pour la préparation à l'examen Databricks Associate Developer. Se déclenche sur les questions Apache Spark / PySpark, la préparation à l'examen, ou les frameworks du livre ; signale explicitement ce qu'il NE couvre PAS (Spark Connect, pandas-on-Spark, les valeurs par défaut AQE post-2020) car le livre source les précède.

Rapport de test

Sur une question broadcast vs shuffle join, le tableau de stratégies de jointure de la compétence couvrait les 5 stratégies réelles (BHJ/SMJ/SHJ/BNLJ/Cartesian) par rapport à une base de référence qui n'en nommait que 2, et elle a proactivement divulgué sa propre lacune ('ce livre a été publié en 2020... Spark Connect, Pandas API on Spark, AQE activé par défaut ne sont pas couverts') plutôt que de deviner silencieusement le matériel post-2020.

Testé le: 2026-07-16 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Galius5136/databricks-spark-3.5-cert-prep
cd databricks-spark-3.5-cert-prep
mkdir -p ~/.claude/skills
cp -r skills/apache-spark ~/.claude/skills/apache-spark

Commandes et exemples de prompts

  • /apache-sparkAnti-sèche Spark optimisé pour l'examen de 'Learning Spark 2nd Ed.' qui signale sa propre coupure de connaissances de 2020.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • should I use a broadcast join or shuffle join for this dataset?
  • explain Structured Streaming windowing for the Databricks exam
  • how does Spark's DataFrame API differ from the Dataset API?