How do we derive partition keys and write compressed Snappy Parquet files to cloud object storage?
A production pipeline deriving year/month keys, enabling Snappy compression, and writing partitioned Parquet.
Enterprise Lakehouse gold-layer publication to AWS S3, Google Cloud Storage, or Azure ADLS Gen2.
from pyspark.sql.functions import col, month, year
gold_df = silver_df \
.withColumn("year", year(col("transaction_date"))) \
.withColumn("month", month(col("transaction_date")))
gold_df.write \
.mode("overwrite") \
.partitionBy("year", "month") \
.option("compression", "snappy") \
.parquet("s3://lakehouse/gold/fact_transactions")Practice typing production-grade PySpark code for Production Gold Layer Partitioned Storage Pipeline.