Task — event_classification_global

benchmark version 1.1.0 · held_out results v1.0.0 · splits v1.0/held_out, v1.1/multi_grid
updated 2026-09-29 13:18 UTC · git 7243f310ddbc

tier 3 · event_classification · global view · 23 classes · all cells measured

What this task is. The hard frontier: one 23-class decision naming the exact event in the window — fault types, switching kinds, and steady state in one vocabulary. High class count and imbalance make the analytic floor very low; macro-F1 accompanies balanced accuracy. Global view: every cubicle in the grid at once (width differs per grid), the wide-area upper bound on observability.

How it's scored

Headline metric balanced_accuracy (↑ higher is better); full metric set: balanced_accuracy · macro_f1 · accuracy. Metrics are a frozen contract (src/evemtbench/evaluation/metrics.py); label derivation: src/evemtbench/tasks/labels.

Example window

example waveform window

event switch_inrush_hv · grid double_line (adapt_grid/test split) · sample 51, window #1173, cubicle 3 (max-RMS) · 50 ms / 480 samples @ 9.6 kHz · top: 3-phase current, bottom: 3-phase voltage · figure provenance in assets/manifest.json

Results (held_out)

event_classification_global — every grid × baseline; click headers to sort
taskgridbaselineheadlinetestbenchmarkparamsfit/seedtrace
event_classification_globalcigre_mvmajoritybalanced_accuracy ↑0.045 ± 0.000 (n=5)0.045 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
event_classification_globalcigre_mvrandom_forestbalanced_accuracy ↑0.455 ± 0.005 (n=5)0.520 ± 0.006 (n=5)—6.1mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globalcigre_mvmlpbalanced_accuracy ↑0.521 ± 0.002 (n=5)0.542 ± 0.006 (n=5)42.9M43.0mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globalcigre_mvgrubalanced_accuracy ↑0.640 ± 0.009 (n=5)0.698 ± 0.031 (n=5)120k40.6mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globalcigre_mvcnnbalanced_accuracy ↑0.632 ± 0.011 (n=5)0.702 ± 0.011 (n=5)127k37.9mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globalcigre_mvresnetbalanced_accuracy ↑0.613 ± 0.091 (n=5)0.670 ± 0.092 (n=5)605k15.6mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaldouble_linemajoritybalanced_accuracy ↑0.062 ± 0.000 (n=5)0.062 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
event_classification_globaldouble_linerandom_forestbalanced_accuracy ↑0.568 ± 0.002 (n=5)0.220 ± 0.009 (n=5)—1.3mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaldouble_linemlpbalanced_accuracy ↑0.536 ± 0.004 (n=5)0.573 ± 0.013 (n=5)12.0M9.7mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaldouble_linegrubalanced_accuracy ↑0.676 ± 0.014 (n=5)0.751 ± 0.042 (n=5)71k10.0mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaldouble_linecnnbalanced_accuracy ↑0.630 ± 0.033 (n=5)0.669 ± 0.063 (n=5)70k9.4mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaldouble_lineresnetbalanced_accuracy ↑0.761 ± 0.006 (n=5)0.833 ± 0.016 (n=5)533k20.5mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaltestgrid_110kvmajoritybalanced_accuracy ↑0.059 ± 0.000 (n=5)0.059 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
event_classification_globaltestgrid_110kvrandom_forestbalanced_accuracy ↑0.523 ± 0.002 (n=5)0.227 ± 0.006 (n=5)—2.5mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaltestgrid_110kvmlpbalanced_accuracy ↑0.556 ± 0.002 (n=5)0.584 ± 0.020 (n=5)26.7M20.4mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaltestgrid_110kvgrubalanced_accuracy ↑0.675 ± 0.013 (n=5)0.730 ± 0.030 (n=5)94k19.6mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaltestgrid_110kvcnnbalanced_accuracy ↑0.654 ± 0.011 (n=5)0.706 ± 0.015 (n=5)97k20.3mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globaltestgrid_110kvresnetbalanced_accuracy ↑0.782 ± 0.006 (n=5)0.831 ± 0.025 (n=5)567k20.3mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globalieee39majoritybalanced_accuracy ↑0.062 ± 0.000 (n=5)0.062 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
event_classification_globalieee39random_forestbalanced_accuracy ↑0.762 ± 0.002 (n=5)0.553 ± 0.018 (n=5)—9.5mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globalieee39mlpbalanced_accuracy ↑0.616 ± 0.003 (n=5)0.262 ± 0.007 (n=5)103.4M1.8htrace: output · eval-code · log · train-code · config · W&B
event_classification_globalieee39grubalanced_accuracy ↑0.592 ± 0.037 (n=5)0.219 ± 0.016 (n=5)214k1.3htrace: output · eval-code · log · train-code · config · W&B
event_classification_globalieee39cnnbalanced_accuracy ↑0.582 ± 0.017 (n=5)0.226 ± 0.011 (n=5)237k46.2mtrace: output · eval-code · log · train-code · config · W&B
event_classification_globalieee39resnetbalanced_accuracy ↑0.640 ± 0.024 (n=5)0.283 ± 0.045 (n=5)747k39.2mtrace: output · eval-code · log · train-code · config · W&B

Metric definitions

headline & reported metrics for this view — the metric set is a frozen contract; each links to the exact function that computes it

metricdefinitionentry
balanced_accuracymean of per-class recall — the majority class cannot buy a good scoreevaluate()
macro_f1unweighted mean of per-class F1 (zero_division=0)evaluate()
accuracyfraction of exact-match predictionsevaluate()

Reproduce one cell

PYTHONPATH=src python -m evemtbench.baselines.runner --task event_classification_global --protocol held_out \
    --grid <grid> --baseline <baseline> --seeds 0 1 2 3 4