Menu

Studied, Practised, Revised, Mock and a confidence score (1–5) for each topic, as in the planner spreadsheet. A topic counts as complete once it is marked studied.

Saved in this browser only. Back it up from the study planner page.

PySpark tracker
#TopicCategoryLevelStudiedPractisedRevisedMockConfidence
1Spark architecture (driver/executor)Core SparkBeginner
2Cluster managers (YARN/K8s/Standalone)Core SparkIntermediate
3SparkSession & SparkContextCore SparkBeginner
4RDD fundamentalsCore SparkBeginner
5RDD transformations vs actionsCore SparkBeginner
6map vs flatMapCore SparkIntermediate
7reduceByKey vs groupByKeyCore SparkAdvanced
8mapPartitionsCore SparkAdvanced
9Closures & serializationCore SparkExpert
10Lazy evaluation & DAGCore SparkBeginner
11Narrow vs wide transformationsCore SparkIntermediate
12Job/stage/task hierarchyCore SparkExpert
13Spark UI & stages/tasksCore SparkExpert
14Partitions & parallelismCore SparkIntermediate
15Shuffle internalsCore SparkIntermediate
16Understanding shuffle costPerformanceBeginner
17Repartition vs coalesceCore SparkExpert
18Spark partitioning strategyPerformanceBeginner
19spark.sql.shuffle.partitions tuningPerformanceExpert
20Detecting data skewPerformanceAdvanced
21Salting for skewPerformanceAdvanced
22Skew join optimizationOptimizationExpert
23Persistence & caching levelsCore SparkAdvanced
24Caching strategyPerformanceIntermediate
25Caching vs recompute trade-offOptimizationAdvanced
26CheckpointingCore SparkAdvanced
27Broadcast variablesCore SparkExpert
28AccumulatorsCore SparkAdvanced
29Catalyst optimizerSpark SQLIntermediate
30Tungsten execution engineSpark SQLIntermediate
31Whole-stage code generationDeployment & TuningAdvanced
32Cost-based optimizationOptimizationExpert
33Predicate & projection pushdownPerformanceIntermediate
34Column pruningOptimizationAdvanced
35SQL vs DataFrame performanceSpark SQLExpert
36AQE (Adaptive Query Execution)PerformanceBeginner
37Dynamic partition pruningPerformanceIntermediate
38Memory management (unified)PerformanceExpert
39Executor sizingPerformanceExpert
40Cores & memory configPerformanceExpert
41GC tuningPerformanceExpert
42Spill to disk diagnosisPerformanceExpert
43Dynamic allocationDeployment & TuningBeginner
44Speculative executionDeployment & TuningBeginner
45Spark on KubernetesDeployment & TuningBeginner
46Monitoring with Spark History ServerDeployment & TuningExpert
47DataFrame API basicsSpark SQLBeginner
48Dataset vs DataFrameSpark SQLBeginner
49Schema definition (StructType)Spark SQLBeginner
50select / withColumn / filterSpark SQLBeginner
51Column expressionsSpark SQLExpert
52Handling nulls (na.fill/drop)Spark SQLExpert
53Type casting & schema evolutionSpark SQLExpert
54groupBy & aggregationsSpark SQLBeginner
55pivot in SparkSpark SQLAdvanced
56Temp views & global viewsSpark SQLExpert
57Joins in Spark SQLSpark SQLIntermediate
58Broadcast hash joinOptimizationBeginner
59Sort-merge join tuningOptimizationBeginner
60Join strategy selectionOptimizationBeginner
61Bucketing in SparkPerformanceAdvanced
62Bucketed joinsDeployment & TuningExpert
63Window functions in SparkSpark SQLIntermediate
64UDFs and pandas UDFsSpark SQLIntermediate
65Pandas API on SparkDeployment & TuningIntermediate
66Handling nested/complex typesSpark SQLAdvanced
67explode & posexplodeSpark SQLAdvanced
68Reading/writing ParquetSpark SQLAdvanced
69Reading/writing JSON & CSVSpark SQLAdvanced
70ORC & Avro formatsDeployment & TuningAdvanced
71Handling corrupt records (badRecordsPath)Deployment & TuningIntermediate
72Reading from JDBC sourcesDeployment & TuningIntermediate
73Partition discoveryDeployment & TuningAdvanced
74Repartition before writeOptimizationIntermediate
75Coalesce on outputOptimizationExpert
76File size optimizationOptimizationIntermediate
77Small files problemOptimizationAdvanced
78Avoiding wide transformationsOptimizationIntermediate
79Custom partitionersDeployment & TuningExpert
80Structured Streaming modelStreamingBeginner
81Input sources (Kafka/files)StreamingBeginner
82Output sinks & modesStreamingBeginner
83Triggers & micro-batchStreamingIntermediate
84Checkpointing in streamingStreamingExpert
85Foreach & foreachBatchStreamingExpert
86Backpressure & rate limitingStreamingExpert
87Event-time vs processing-timeStreamingIntermediate
88WatermarkingStreamingIntermediate
89Handling late dataStreamingExpert
90Stateful aggregationsStreamingAdvanced
91Stream-stream joinsStreamingAdvanced
92Stream-static joinsStreamingAdvanced
93Exactly-once in streamingStreamingExpert
94Delta Lake architectureDelta LakeBeginner
95ACID transactions on DeltaDelta LakeBeginner
96Transaction log (_delta_log)Delta LakeBeginner
97Time travel & versioningDelta LakeIntermediate
98Schema enforcementDelta LakeIntermediate
99Schema evolutionDelta LakeAdvanced
100MERGE / upsertDelta LakeIntermediate
101Change Data FeedDelta LakeExpert
102Streaming with DeltaDelta LakeExpert
103OPTIMIZE & compactionDelta LakeAdvanced
104Z-OrderingDelta LakeAdvanced
105VACUUM & retentionDelta LakeExpert
106Liquid clusteringDelta LakeExpert

Other trackers

Search
Filter by type