Skip to main content
PYSPARK • LESSON 164

Writing Partitioned Parquet Directories

How do we write Parquet data partitioned into hierarchical year and month subdirectories on disk?

Expert2 Minutes900 XP
🤔 THE QUESTION

How do we write Parquet data partitioned into hierarchical year and month subdirectories on disk?

💡 WHAT IS IT?

partitionBy('year', 'month') writes data into directory paths like year=2026/month=08/ to enable partition pruning.

🎯 WHAT IS IT USED FOR?

Enabling downstream query engines to skip entire directories when querying specific time ranges.

💻 EXAMPLE
df.write \
  .mode("overwrite") \
  .partitionBy("year", "month") \
  .parquet("output/partitioned_sales")

🎯 Mission Objectives

Practice typing production-grade PySpark code for Writing Partitioned Parquet Directories.

  • Apply partitionBy on write
  • Create year/month directory hierarchy
  • Enable partition pruning for downstream engines