Task — event_state_global

benchmark version 1.1.0 · held_out results v1.0.0 · splits v1.0/held_out, v1.1/multi_grid
updated 2026-09-29 13:18 UTC · git 7243f310ddbc

tier 2 · event_state · global view · 3 classes · all cells measured

What this task is. Classify the operating state of the window — steady state, fault, or switching transient. This is the coarse triage that upstream automation uses to route a window to the right specialist model. Global view: every cubicle in the grid at once (width differs per grid), the wide-area upper bound on observability.

How it's scored

Headline metric balanced_accuracy (↑ higher is better); full metric set: balanced_accuracy · macro_f1 · accuracy. Metrics are a frozen contract (src/evemtbench/evaluation/metrics.py); label derivation: src/evemtbench/tasks/labels.

Example window

example waveform window

event switch_cap_off · grid double_line (adapt_grid/test split) · sample 64, window #1472, cubicle 3 (max-RMS) · 50 ms / 480 samples @ 9.6 kHz · top: 3-phase current, bottom: 3-phase voltage · figure provenance in assets/manifest.json

Results (held_out)

event_state_global — every grid × baseline; click headers to sort
taskgridbaselineheadlinetestbenchmarkparamsfit/seedtrace
event_state_globalcigre_mvmajoritybalanced_accuracy ↑0.333 ± 0.000 (n=5)0.333 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
event_state_globalcigre_mvrandom_forestbalanced_accuracy ↑0.724 ± 0.001 (n=5)0.866 ± 0.002 (n=5)—7.8mtrace: output · eval-code · log · train-code · config · W&B
event_state_globalcigre_mvmlpbalanced_accuracy ↑0.659 ± 0.001 (n=5)0.798 ± 0.002 (n=5)42.9M38.6mtrace: output · eval-code · log · train-code · config · W&B
event_state_globalcigre_mvgrubalanced_accuracy ↑0.740 ± 0.030 (n=5)0.848 ± 0.025 (n=5)117k39.2mtrace: output · eval-code · log · train-code · config · W&B
event_state_globalcigre_mvcnnbalanced_accuracy ↑0.733 ± 0.027 (n=5)0.865 ± 0.024 (n=5)124k38.5mtrace: output · eval-code · log · train-code · config · W&B
event_state_globalcigre_mvresnetbalanced_accuracy ↑0.696 ± 0.111 (n=5)0.845 ± 0.069 (n=5)603k20.1mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaldouble_linemajoritybalanced_accuracy ↑0.333 ± 0.000 (n=5)0.333 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
event_state_globaldouble_linerandom_forestbalanced_accuracy ↑0.723 ± 0.001 (n=5)0.703 ± 0.008 (n=5)—1.9mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaldouble_linemlpbalanced_accuracy ↑0.702 ± 0.001 (n=5)0.808 ± 0.000 (n=5)12.0M8.8mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaldouble_linegrubalanced_accuracy ↑0.743 ± 0.023 (n=5)0.833 ± 0.024 (n=5)69k8.9mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaldouble_linecnnbalanced_accuracy ↑0.695 ± 0.004 (n=5)0.798 ± 0.009 (n=5)68k8.9mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaldouble_lineresnetbalanced_accuracy ↑0.777 ± 0.011 (n=5)0.870 ± 0.016 (n=5)530k19.8mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaltestgrid_110kvmajoritybalanced_accuracy ↑0.333 ± 0.000 (n=5)0.333 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
event_state_globaltestgrid_110kvrandom_forestbalanced_accuracy ↑0.705 ± 0.001 (n=5)0.652 ± 0.006 (n=5)—3.1mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaltestgrid_110kvmlpbalanced_accuracy ↑0.706 ± 0.001 (n=5)0.805 ± 0.001 (n=5)26.7M19.1mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaltestgrid_110kvgrubalanced_accuracy ↑0.689 ± 0.060 (n=5)0.801 ± 0.042 (n=5)92k17.1mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaltestgrid_110kvcnnbalanced_accuracy ↑0.662 ± 0.021 (n=5)0.789 ± 0.030 (n=5)95k20.0mtrace: output · eval-code · log · train-code · config · W&B
event_state_globaltestgrid_110kvresnetbalanced_accuracy ↑0.839 ± 0.013 (n=5)0.868 ± 0.076 (n=5)565k28.2mtrace: output · eval-code · log · train-code · config · W&B
event_state_globalieee39majoritybalanced_accuracy ↑0.333 ± 0.000 (n=5)0.333 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
event_state_globalieee39random_forestbalanced_accuracy ↑0.911 ± 0.001 (n=5)0.643 ± 0.021 (n=5)—16.2mtrace: output · eval-code · log · train-code · config · W&B
event_state_globalieee39mlpbalanced_accuracy ↑0.787 ± 0.001 (n=5)0.749 ± 0.026 (n=5)103.4M2.0htrace: output · eval-code · log · train-code · config · W&B
event_state_globalieee39grubalanced_accuracy ↑0.637 ± 0.037 (n=5)0.636 ± 0.009 (n=5)212k1.5htrace: output · eval-code · log · train-code · config · W&B
event_state_globalieee39cnnbalanced_accuracy ↑0.707 ± 0.016 (n=5)0.681 ± 0.144 (n=5)234k1.7htrace: output · eval-code · log · train-code · config · W&B
event_state_globalieee39resnetbalanced_accuracy ↑0.729 ± 0.034 (n=5)0.656 ± 0.224 (n=5)744k1.3htrace: output · eval-code · log · train-code · config · W&B

Metric definitions

headline & reported metrics for this view — the metric set is a frozen contract; each links to the exact function that computes it

metricdefinitionentry
balanced_accuracymean of per-class recall — the majority class cannot buy a good scoreevaluate()
macro_f1unweighted mean of per-class F1 (zero_division=0)evaluate()
accuracyfraction of exact-match predictionsevaluate()

Reproduce one cell

PYTHONPATH=src python -m evemtbench.baselines.runner --task event_state_global --protocol held_out \
    --grid <grid> --baseline <baseline> --seeds 0 1 2 3 4