Apache Spark (Learning Spark 2nd Ed.)

Arkusz ściągawki Spark przygotowany pod egzamin z "Learning Spark 2nd Ed.", który oznacza własne odcięcie wiedzy z 2020 roku.

Autor: Galius5136 · Galius5136/databricks-spark-3.5-cert-prep

Testowano · Działa ★ 8.8/10

Apache Spark (Learning Spark 2nd Ed.) — Arkusz ściągawki Spark przygotowany pod egzamin z "Learning Spark 2nd Ed.", który oznacza własne odcięcie wiedzy z 2020 roku.

Co robi ten skill

Baza wiedzy indeksowana rozdziałami, wyekstrahowana z "Learning Spark, 2nd Edition", obejmująca architekturę Spark, API DataFrame/Dataset, Spark SQL, strojenie i Structured Streaming, przygotowana pod egzamin Databricks Associate Developer. Aktywowany przez pytania dotyczące Apache Spark / PySpark, przygotowania do egzaminu lub frameworków książki; wyraźnie oznacza, czego NIE obejmuje (Spark Connect, pandas-on-Spark, domyślne ustawienia AQE po 2020 r.), ponieważ książka źródłowa je poprzedza.

Raport z testu

W przypadku pytania o broadcast vs shuffle join, tabela strategii łączenia umiejętności obejmowała wszystkie 5 rzeczywistych strategii (BHJ/SMJ/SHJ/BNLJ/Cartesian) w porównaniu do generycznego punktu odniesienia, który nazwał tylko 2, i proaktywnie ujawniła własną ślepą plamkę ("ta książka została opublikowana w 2020 roku... Spark Connect, Pandas API on Spark, AQE domyślnie nie są objęte") zamiast milcząco zgadywać materiał po 2020 roku.

Testowano: 2026-07-16 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/Galius5136/databricks-spark-3.5-cert-prep
cd databricks-spark-3.5-cert-prep
mkdir -p ~/.claude/skills
cp -r skills/apache-spark ~/.claude/skills/apache-spark

Komendy i przykładowe prompty

  • /apache-sparkArkusz ściągawki Spark przygotowany pod egzamin z "Learning Spark 2nd Ed.", który oznacza własne odcięcie wiedzy z 2020 roku.

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • should I use a broadcast join or shuffle join for this dataset?
  • explain Structured Streaming windowing for the Databricks exam
  • how does Spark's DataFrame API differ from the Dataset API?