How do we aggregate enriched sales by region and category to compute transaction count, unique products, and sales totals?
Multi-dimensional dimensional aggregation computing transaction volume, unique SKU counts, total sales, and averages.
Executive sales scorecards, regional merchandise performance, and quarterly business reviews.
from pyspark.sql.functions import avg, col, count, countDistinct, round, sum
regional_kpis = enriched_sales.groupBy("region", "category") \
.agg(
count("transaction_id").alias("total_txns"),
countDistinct("product_name").alias("unique_products_sold"),
round(sum("revenue"), 2).alias("total_revenue"),
round(avg("revenue"), 2).alias("avg_txn_value")
)Practice typing production-grade PySpark code for Multi-Level Regional KPI Aggregation.