Skip to content
LakeBench
ProblemsCommunityPricing
Sign inStart practicing
Back
  1. Home
  2. Interview prep
  3. Volume and distribution checks

Data quality · Building Quality In

Volume and distribution checks

Mediumdata-quality-24
volume-checksanomaly-detectiondistribution-driftdata-observability

Question

How do you detect that today's load is "too small" or "weird" without hardcoding numbers?

Solution

Instead of hardcoding fixed row counts, pipelines detect abnormal loads by comparing incoming batches against dynamic rolling baselines. This statistical approach flags unexpected volume drops, null rate spikes, and distribution drift while naturally accommodating organic business growth and weekly seasonality.

Statistical baselines versus static limits

Hardcoded row count assertions break constantly because business volumes fluctuate between weekdays, weekends, and holidays. Production platforms calculate dynamic tolerance bands using historical operational data:

  • Rolling weekday baselines: Compare today incoming volume against the same day of the week over the previous four weeks. Comparing a Sunday batch against the prior four Sundays prevents false alarms caused by normal weekend traffic dips.
  • Z-scores and confidence intervals: Compute the mean and standard deviation of historical volumes. If today load deviates by more than three standard deviations from the rolling mean, trigger an alert.
  • Percentage tolerance bands: For metrics with low variance, define bounded percentage thresholds, such as requiring total rows to remain within fifteen percent of the trailing seven-day moving average.
Baseline Model: Trailing 4-week same-weekday mean (mu) and standard deviation (sigma)
Valid Volume Range: [mu - 3*sigma, mu + 3*sigma]
Column Metric Checks: Null percentage <= 0.5%, distinct count within expected band

Column-level distributions require automated profiling alongside raw volume tracking:

  • Monitor null rates and distinct value counts across critical columns on every load. A sudden jump in null values or a collapse in distinct categories indicates an upstream serialization bug.
  • Apply statistical tests like Kolmogorov-Smirnov for continuous numerical values or chi-square tests for categorical fields to spot distribution drift before machine learning models degrade.

Automated observability frameworks

Modern data engineering stacks rely on purpose-built tooling to automate dynamic thresholds:

  • Elementary runs dbt-native anomaly detection models directly inside your data warehouse.
  • Soda Core evaluates statistical metrics using declarative SodaCL YAML configurations.
  • Great Expectations profiles datasets and tracks column distributions across scheduled runs.
  • Monte Carlo monitors data lakes and warehouses using statistical models to detect volume anomalies automatically.
PreviousNext