How do we aggregate headcount and annualized budget per department and filter for established teams?
A complete dimensional aggregation pipeline grouping by department, computing annual budgets, and filtering.
Enterprise financial planning, departmental cost allocation, and resource governance.
from pyspark.sql.functions import col, countDistinct, round, sum
dept_metrics_df = df.groupBy("department_id") \
.agg(
countDistinct(col("employee_id")).alias("headcount"),
round(sum(col("monthly_salary")) * 12, 2).alias("annual_budget")
) \
.filter(col("headcount") >= 5)
dept_metrics_df.show()Practice typing production-grade PySpark code for Business Dimension Summary Pipeline.