Apache Spark (Learning Spark 2nd Ed.)

Exam-getunede Spark cheat-sheet uit 'Learning Spark 2nd Ed.' dat zijn eigen kennisafsluiting van 2020 markeert.

Door Galius5136 · Galius5136/databricks-spark-3.5-cert-prep

Getest · Werkt ★ 8.8/10

Apache Spark (Learning Spark 2nd Ed.) — Exam-getunede Spark cheat-sheet uit 'Learning Spark 2nd Ed.' dat zijn eigen kennisafsluiting van 2020 markeert.

Wat het doet

Een hoofdstuk-geïndexeerde kennisbank gedistilleerd uit 'Learning Spark, 2nd Edition' die Spark architectuur, DataFrame/Dataset API's, Spark SQL, tuning, en Structured Streaming behandelt, afgestemd op Databricks Associate Developer examenvoorbereiding. Triggert op Apache Spark / PySpark vragen, examenvoorbereiding, of de frameworks van het boek; markeert expliciet wat het NIET behandelt (Spark Connect, pandas-on-Spark, post-2020 AQE defaults) aangezien het bronboek daaraan voorafgaat.

Testrapport

Op een broadcast-vs-shuffle-join vraag dekte de join-strategie tabel van de skill alle 5 echte strategieën (BHJ/SMJ/SHJ/BNLJ/Cartesian) af tegen een generieke baseline die er slechts 2 benoemde, en het onthulde proactief zijn eigen blinde vlek ('dit boek werd gepubliceerd in 2020... Spark Connect, Pandas API on Spark, AQE-on-by-default worden niet behandeld') in plaats van stilzwijgend te gokken naar materiaal na 2020.

Getest op: 2026-07-16 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/Galius5136/databricks-spark-3.5-cert-prep
cd databricks-spark-3.5-cert-prep
mkdir -p ~/.claude/skills
cp -r skills/apache-spark ~/.claude/skills/apache-spark

Commando's en voorbeeldprompts

  • /apache-sparkExam-getunede Spark cheat-sheet uit 'Learning Spark 2nd Ed.' dat zijn eigen kennisafsluiting van 2020 markeert.

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • should I use a broadcast join or shuffle join for this dataset?
  • explain Structured Streaming windowing for the Databricks exam
  • how does Spark's DataFrame API differ from the Dataset API?