Task — fault_category_global

benchmark version 1.1.0 · held_out results v1.0.0 · splits v1.0/held_out, v1.1/multi_grid
updated 2026-09-29 13:18 UTC · git 7243f310ddbc

tier 2 · fault_category · global view · 3 classes · all cells measured

What this task is. Group the fault into its coarse category (e.g. single-phase-to-ground vs multi-phase) — the level of typing many protection schemes actually act on, between binary detection and the full nine-class vocabulary. Global view: every cubicle in the grid at once (width differs per grid), the wide-area upper bound on observability.

How it's scored

Headline metric balanced_accuracy (↑ higher is better); full metric set: balanced_accuracy · macro_f1 · accuracy. Metrics are a frozen contract (src/evemtbench/evaluation/metrics.py); label derivation: src/evemtbench/tasks/labels.

Example window

example waveform window

event flt_2phg_shc · grid double_line (adapt_grid/test split) · sample 84, window #1932, cubicle 3 (max-RMS) · 50 ms / 480 samples @ 9.6 kHz · top: 3-phase current, bottom: 3-phase voltage · figure provenance in assets/manifest.json

Results (held_out)

fault_category_global — every grid × baseline; click headers to sort
taskgridbaselineheadlinetestbenchmarkparamsfit/seedtrace
fault_category_globalcigre_mvmajoritybalanced_accuracy ↑0.333 ± 0.000 (n=5)0.333 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
fault_category_globalcigre_mvrandom_forestbalanced_accuracy ↑0.569 ± 0.007 (n=5)0.665 ± 0.001 (n=5)—59strace: output · eval-code · log · train-code · config · W&B
fault_category_globalcigre_mvmlpbalanced_accuracy ↑0.634 ± 0.009 (n=5)0.668 ± 0.043 (n=5)42.9M10.1mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globalcigre_mvgrubalanced_accuracy ↑0.638 ± 0.024 (n=5)0.674 ± 0.032 (n=5)117k5.5mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globalcigre_mvcnnbalanced_accuracy ↑0.654 ± 0.022 (n=5)0.656 ± 0.007 (n=5)124k5.3mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globalcigre_mvresnetbalanced_accuracy ↑0.635 ± 0.017 (n=5)0.657 ± 0.003 (n=5)603k6.3mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globaldouble_linemajoritybalanced_accuracy ↑0.500 ± 0.000 (n=5)0.500 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
fault_category_globaldouble_linerandom_forestbalanced_accuracy ↑0.884 ± 0.004 (n=5)0.500 ± 0.000 (n=5)—29strace: output · eval-code · log · train-code · config · W&B
fault_category_globaldouble_linemlpbalanced_accuracy ↑0.962 ± 0.001 (n=5)0.995 ± 0.001 (n=5)12.0M3.3mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globaldouble_linegrubalanced_accuracy ↑0.965 ± 0.003 (n=5)0.998 ± 0.001 (n=5)69k2.1mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globaldouble_linecnnbalanced_accuracy ↑0.960 ± 0.001 (n=5)0.995 ± 0.002 (n=5)68k1.0mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globaldouble_lineresnetbalanced_accuracy ↑0.958 ± 0.006 (n=5)0.996 ± 0.004 (n=5)530k3.6mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globaltestgrid_110kvmajoritybalanced_accuracy ↑0.500 ± 0.000 (n=5)0.500 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
fault_category_globaltestgrid_110kvrandom_forestbalanced_accuracy ↑0.829 ± 0.005 (n=5)0.500 ± 0.000 (n=5)—41strace: output · eval-code · log · train-code · config · W&B
fault_category_globaltestgrid_110kvmlpbalanced_accuracy ↑0.956 ± 0.007 (n=5)0.993 ± 0.003 (n=5)26.7M5.0mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globaltestgrid_110kvgrubalanced_accuracy ↑0.963 ± 0.004 (n=5)0.997 ± 0.004 (n=5)92k3.9mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globaltestgrid_110kvcnnbalanced_accuracy ↑0.957 ± 0.003 (n=5)0.989 ± 0.005 (n=5)95k14.4mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globaltestgrid_110kvresnetbalanced_accuracy ↑0.953 ± 0.005 (n=5)0.990 ± 0.007 (n=5)565k11.2mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globalieee39majoritybalanced_accuracy ↑0.500 ± 0.000 (n=5)0.500 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
fault_category_globalieee39random_forestbalanced_accuracy ↑0.941 ± 0.000 (n=5)0.667 ± 0.016 (n=5)—2.8mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globalieee39mlpbalanced_accuracy ↑0.962 ± 0.001 (n=5)0.536 ± 0.088 (n=5)103.4M31.4mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globalieee39grubalanced_accuracy ↑0.962 ± 0.002 (n=5)0.910 ± 0.055 (n=5)212k18.4mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globalieee39cnnbalanced_accuracy ↑0.955 ± 0.002 (n=5)0.693 ± 0.332 (n=5)234k19.0mtrace: output · eval-code · log · train-code · config · W&B
fault_category_globalieee39resnetbalanced_accuracy ↑0.957 ± 0.004 (n=5)0.794 ± 0.334 (n=5)744k14.4mtrace: output · eval-code · log · train-code · config · W&B

Metric definitions

headline & reported metrics for this view — the metric set is a frozen contract; each links to the exact function that computes it

metricdefinitionentry
balanced_accuracymean of per-class recall — the majority class cannot buy a good scoreevaluate()
macro_f1unweighted mean of per-class F1 (zero_division=0)evaluate()
accuracyfraction of exact-match predictionsevaluate()

Reproduce one cell

PYTHONPATH=src python -m evemtbench.baselines.runner --task fault_category_global --protocol held_out \
    --grid <grid> --baseline <baseline> --seeds 0 1 2 3 4