Apache Spark (Learning Spark 2nd Ed.)

Zkouškově laděný Spark cheat-sheet z 'Learning Spark 2nd Ed.', který upozorňuje na své vlastní znalostní omezení z roku 2020.

od Galius5136 · Galius5136/databricks-spark-3.5-cert-prep

Otestováno · Funguje ★ 8.8/10

Apache Spark (Learning Spark 2nd Ed.) — Zkouškově laděný Spark cheat-sheet z 'Learning Spark 2nd Ed.', který upozorňuje na své vlastní znalostní omezení z roku 2020.

Co umí

Znalostní báze indexovaná podle kapitol, destilovaná z knihy 'Learning Spark, 2nd Edition', pokrývající architekturu Sparku, API DataFrame/Dataset, Spark SQL, ladění a Structured Streaming, laděná pro přípravu na zkoušku Databricks Associate Developer. Spouští se na otázky týkající se Apache Spark / PySpark, přípravu na zkoušku nebo rámce knihy; explicitně označuje, co NEPOKRÝVÁ (Spark Connect, pandas-on-Spark, výchozí nastavení AQE po roce 2020), protože zdrojová kniha jim předchází.

Testovací report

Na otázku broadcast vs. shuffle join tabulka dovednosti pokryla všech 5 skutečných strategií (BHJ/SMJ/SHJ/BNLJ/Cartesian) oproti obecnému základu, který pojmenoval pouze 2, a proaktivně odhalila svou vlastní slepou skvrnu ("tato kniha byla vydána v roce 2020... Spark Connect, Pandas API on Spark, AQE-on-by-default nejsou pokryty") místo tichého hádání o materiálu po roce 2020.

Testováno: 2026-07-16 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/Galius5136/databricks-spark-3.5-cert-prep
cd databricks-spark-3.5-cert-prep
mkdir -p ~/.claude/skills
cp -r skills/apache-spark ~/.claude/skills/apache-spark

Příkazy a ukázkové prompty

  • /apache-sparkZkouškově laděný Spark cheat-sheet z 'Learning Spark 2nd Ed.', který upozorňuje na své vlastní znalostní omezení z roku 2020.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • should I use a broadcast join or shuffle join for this dataset?
  • explain Structured Streaming windowing for the Databricks exam
  • how does Spark's DataFrame API differ from the Dataset API?