Task — fault_grounded_global

benchmark version 1.1.0 · held_out results v1.0.0 · splits v1.0/held_out, v1.1/multi_grid
updated 2026-09-29 13:18 UTC · git 7243f310ddbc

tier 1 · fault_grounded · global view · 2 classes · all cells measured

What this task is. Given a faulted window, decide whether the fault involves ground. Ground faults dominate real statistics and their detection interacts with the grid's earthing concept, which differs across the four reference grids. Global view: every cubicle in the grid at once (width differs per grid), the wide-area upper bound on observability.

How it's scored

Headline metric balanced_accuracy (↑ higher is better); full metric set: balanced_accuracy · macro_f1 · accuracy. Metrics are a frozen contract (src/evemtbench/evaluation/metrics.py); label derivation: src/evemtbench/tasks/labels.

Example window

example waveform window

event flt_1phg_shc_w_arc · grid double_line (adapt_grid/test split) · sample 29, window #667, cubicle 3 (max-RMS) · 50 ms / 480 samples @ 9.6 kHz · top: 3-phase current, bottom: 3-phase voltage · figure provenance in assets/manifest.json

Results (held_out)

fault_grounded_global — every grid × baseline; click headers to sort
taskgridbaselineheadlinetestbenchmarkparamsfit/seedtrace
fault_grounded_globalcigre_mvmajoritybalanced_accuracy ↑0.500 ± 0.000 (n=5)0.500 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalcigre_mvrandom_forestbalanced_accuracy ↑0.935 ± 0.002 (n=5)0.989 ± 0.001 (n=5)—1.1mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalcigre_mvmlpbalanced_accuracy ↑0.928 ± 0.013 (n=5)0.975 ± 0.008 (n=5)42.9M7.0mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalcigre_mvgrubalanced_accuracy ↑0.944 ± 0.012 (n=5)0.986 ± 0.005 (n=5)117k5.9mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalcigre_mvcnnbalanced_accuracy ↑0.946 ± 0.007 (n=5)0.988 ± 0.005 (n=5)124k6.8mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalcigre_mvresnetbalanced_accuracy ↑0.953 ± 0.008 (n=5)0.994 ± 0.002 (n=5)602k6.7mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaldouble_linemajoritybalanced_accuracy ↑0.500 ± 0.000 (n=5)0.500 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaldouble_linerandom_forestbalanced_accuracy ↑0.955 ± 0.000 (n=5)0.653 ± 0.007 (n=5)—21strace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaldouble_linemlpbalanced_accuracy ↑0.969 ± 0.000 (n=5)0.998 ± 0.001 (n=5)12.0M3.3mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaldouble_linegrubalanced_accuracy ↑0.970 ± 0.000 (n=5)0.999 ± 0.001 (n=5)69k2.5mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaldouble_linecnnbalanced_accuracy ↑0.971 ± 0.000 (n=5)1.000 ± 0.001 (n=5)68k3.2mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaldouble_lineresnetbalanced_accuracy ↑0.970 ± 0.000 (n=5)0.999 ± 0.001 (n=5)530k6.1mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaltestgrid_110kvmajoritybalanced_accuracy ↑0.500 ± 0.000 (n=5)0.500 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaltestgrid_110kvrandom_forestbalanced_accuracy ↑0.960 ± 0.001 (n=5)0.680 ± 0.008 (n=5)—36strace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaltestgrid_110kvmlpbalanced_accuracy ↑0.969 ± 0.000 (n=5)0.995 ± 0.000 (n=5)26.7M6.3mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaltestgrid_110kvgrubalanced_accuracy ↑0.970 ± 0.000 (n=5)0.996 ± 0.002 (n=5)92k4.4mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaltestgrid_110kvcnnbalanced_accuracy ↑0.969 ± 0.001 (n=5)0.999 ± 0.001 (n=5)94k5.0mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globaltestgrid_110kvresnetbalanced_accuracy ↑0.969 ± 0.001 (n=5)0.998 ± 0.002 (n=5)564k4.4mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalieee39majoritybalanced_accuracy ↑0.500 ± 0.000 (n=5)0.500 ± 0.000 (n=5)—0strace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalieee39random_forestbalanced_accuracy ↑0.955 ± 0.001 (n=5)0.870 ± 0.009 (n=5)—2.8mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalieee39mlpbalanced_accuracy ↑0.950 ± 0.003 (n=5)0.926 ± 0.006 (n=5)103.4M33.0mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalieee39grubalanced_accuracy ↑0.936 ± 0.021 (n=5)0.902 ± 0.057 (n=5)211k22.9mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalieee39cnnbalanced_accuracy ↑0.967 ± 0.001 (n=5)0.961 ± 0.027 (n=5)234k30.0mtrace: output · eval-code · log · train-code · config · W&B
fault_grounded_globalieee39resnetbalanced_accuracy ↑0.967 ± 0.003 (n=5)0.967 ± 0.006 (n=5)744k27.2mtrace: output · eval-code · log · train-code · config · W&B

Metric definitions

headline & reported metrics for this view — the metric set is a frozen contract; each links to the exact function that computes it

metricdefinitionentry
balanced_accuracymean of per-class recall — the majority class cannot buy a good scoreevaluate()
macro_f1unweighted mean of per-class F1 (zero_division=0)evaluate()
accuracyfraction of exact-match predictionsevaluate()

Reproduce one cell

PYTHONPATH=src python -m evemtbench.baselines.runner --task fault_grounded_global --protocol held_out \
    --grid <grid> --baseline <baseline> --seeds 0 1 2 3 4