Apache Spark (Learning Spark 2nd Ed.)

Cheat-sheet Spark ottimizzato per l'esame da 'Learning Spark 2nd Ed.' che segnala il suo cutoff di conoscenza del 2020.

di Galius5136 · Galius5136/databricks-spark-3.5-cert-prep

Promosso ★ 8.8/10

Apache Spark (Learning Spark 2nd Ed.) — Cheat-sheet Spark ottimizzato per l'esame da 'Learning Spark 2nd Ed.' che segnala il suo cutoff di conoscenza del 2020.

Cosa fa

Una base di conoscenza indicizzata per capitoli distillata da 'Learning Spark, 2nd Edition' che copre architettura Spark, API DataFrame/Dataset, Spark SQL, tuning e Structured Streaming, ottimizzata per la preparazione all'esame Databricks Associate Developer. Si attiva con domande su Apache Spark / PySpark, preparazione all'esame o i framework del libro; segnala esplicitamente ciò che NON copre (Spark Connect, pandas-on-Spark, default AQE post-2020) poiché il libro sorgente li precede.

Rapporto di test

Su una domanda broadcast vs shuffle join, la tabella delle strategie di join della skill copriva tutte le 5 strategie reali (BHJ/SMJ/SHJ/BNLJ/Cartesian) rispetto a una baseline generica che ne nominava solo 2, e ha proattivamente rivelato il suo punto cieco ('questo libro è stato pubblicato nel 2020... Spark Connect, Pandas API on Spark, AQE-on-by-default non sono coperti') piuttosto che indovinare silenziosamente materiale post-2020.

Testato il: 2026-07-16 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/Galius5136/databricks-spark-3.5-cert-prep
cd databricks-spark-3.5-cert-prep
mkdir -p ~/.claude/skills
cp -r skills/apache-spark ~/.claude/skills/apache-spark

Comandi e prompt di esempio

  • /apache-sparkCheat-sheet Spark ottimizzato per l'esame da 'Learning Spark 2nd Ed.' che segnala il suo cutoff di conoscenza del 2020.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • should I use a broadcast join or shuffle join for this dataset?
  • explain Structured Streaming windowing for the Databricks exam
  • how does Spark's DataFrame API differ from the Dataset API?