Apache Spark (Learning Spark 2nd Ed.)

Prüfungs-optimierter Spark-Cheat-Sheet aus 'Learning Spark 2nd Ed.', das seinen eigenen Wissensstichtag 2020 kennzeichnet.

von Galius5136 · Galius5136/databricks-spark-3.5-cert-prep

Getestet · Funktioniert ★ 8.8/10

Apache Spark (Learning Spark 2nd Ed.) — Prüfungs-optimierter Spark-Cheat-Sheet aus 'Learning Spark 2nd Ed.', das seinen eigenen Wissensstichtag 2020 kennzeichnet.

Was es kann

Eine kapitelindexierte Wissensbasis, destilliert aus 'Learning Spark, 2nd Edition', die Spark-Architektur, DataFrame/Dataset-APIs, Spark SQL, Tuning und Structured Streaming abdeckt, optimiert für die Vorbereitung auf die Databricks Associate Developer-Prüfung. Löst bei Apache Spark / PySpark-Fragen, Prüfungsvorbereitung oder den Frameworks des Buches aus; kennzeichnet explizit, was es NICHT abdeckt (Spark Connect, pandas-on-Spark, Post-2020 AQE-Defaults), da das Quellbuch diesen vorausgeht.

Testbericht

Bei einer Frage zu Broadcast vs. Shuffle Join deckte die Join-Strategie-Tabelle des Skills alle 5 echten Strategien (BHJ/SMJ/SHJ/BNLJ/Cartesian) ab, während eine generische Baseline nur 2 nannte, und es offenbarte proaktiv seine eigene blinde Stelle ('dieses Buch wurde 2020 veröffentlicht... Spark Connect, Pandas API on Spark, AQE-on-by-default werden nicht abgedeckt'), anstatt stillschweigend nach Materialien nach 2020 zu raten.

Getestet am: 2026-07-16 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Galius5136/databricks-spark-3.5-cert-prep
cd databricks-spark-3.5-cert-prep
mkdir -p ~/.claude/skills
cp -r skills/apache-spark ~/.claude/skills/apache-spark

Befehle & Beispiel-Prompts

  • /apache-sparkPrüfungs-optimierter Spark-Cheat-Sheet aus 'Learning Spark 2nd Ed.', das seinen eigenen Wissensstichtag 2020 kennzeichnet.

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • should I use a broadcast join or shuffle join for this dataset?
  • explain Structured Streaming windowing for the Databricks exam
  • how does Spark's DataFrame API differ from the Dataset API?