Skip to main content
Production Incident Simulation

Support Arena

Investigate real-world production incidents inspired by enterprise Databricks, Snowflake, and PySpark workflows. Diagnose failures, analyze logs, and resolve engineering incidents under pressure.

High

Bad / Invalid Records

Production ingestion pipeline detected invalid negative values and null records violating business validation rules.

DifficultyBeginner
Start Investigation
Critical

Schema Mismatch Incident

Source file schema changed unexpectedly causing downstream Databricks ingestion failure.

DifficultyBeginner
Start Investigation
Critical

Missing Source File

Daily partition file was not delivered on time causing SLA delays in reporting pipelines.

DifficultyIntermediate
Start Investigation
Critical

Duplicate Data Load

Retry mechanism triggered duplicate ingestion causing duplicate reporting metrics in Snowflake.

DifficultyIntermediate
Start Investigation
Critical

Failed Upsert / Merge

Merge operation failed due to conflicting keys and transactional inconsistencies.

DifficultyIntermediate
Start Investigation
High

Data Skew Investigation

Spark job suffering severe skew causing executor memory failures and long runtimes.

DifficultyAdvanced
Start Investigation
High

Dependency Conflict

Runtime upgrade introduced incompatible package dependencies breaking ETL jobs.

DifficultyAdvanced
Start Investigation
Critical◆ PREMIUM

Job Timeout Incident

Large production ETL pipeline exceeded SLA due to poor optimization and cluster bottlenecks.

DifficultyAdvanced
Medium

Incorrect Configuration

Wrong process date parameter caused incorrect historical partition loading.

DifficultyIntermediate
Start Investigation