tier 1 · event_detection · global view · 2 classes · all cells measured
Headline metric balanced_accuracy (↑ higher is better); full metric set: balanced_accuracy · macro_f1 · missed_event_rate · false_event_trip_rate · accuracy. Metrics are a frozen contract (src/evemtbench/evaluation/metrics.py); label derivation: src/evemtbench/tasks/labels.
event flt_1phg_incipient · grid double_line (adapt_grid/test split) · sample 2, window #46, cubicle 3 (max-RMS) · 50 ms / 480 samples @ 9.6 kHz · top: 3-phase current, bottom: 3-phase voltage · figure provenance in assets/manifest.json
| task | grid | baseline | headline | test | benchmark | params | fit/seed | trace |
|---|---|---|---|---|---|---|---|---|
| event_detection_global | cigre_mv | majority | balanced_accuracy ↑ | 0.500 ± 0.000 (n=5) | 0.500 ± 0.000 (n=5) | — | 0s | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | cigre_mv | random_forest | balanced_accuracy ↑ | 0.810 ± 0.000 (n=5) | 0.984 ± 0.000 (n=5) | — | 7.9m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | cigre_mv | mlp | balanced_accuracy ↑ | 0.748 ± 0.002 (n=5) | 0.957 ± 0.000 (n=5) | 42.9M | 36.5m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | cigre_mv | gru | balanced_accuracy ↑ | 0.785 ± 0.083 (n=5) | 0.966 ± 0.015 (n=5) | 117k | 38.3m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | cigre_mv | cnn | balanced_accuracy ↑ | 0.752 ± 0.015 (n=5) | 0.966 ± 0.006 (n=5) | 124k | 36.8m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | cigre_mv | resnet | balanced_accuracy ↑ | 0.884 ± 0.019 (n=5) | 0.989 ± 0.007 (n=5) | 602k | 36.9m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | double_line | majority | balanced_accuracy ↑ | 0.500 ± 0.000 (n=5) | 0.500 ± 0.000 (n=5) | — | 0s | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | double_line | random_forest | balanced_accuracy ↑ | 0.804 ± 0.000 (n=5) | 0.947 ± 0.004 (n=5) | — | 1.8m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | double_line | mlp | balanced_accuracy ↑ | 0.786 ± 0.001 (n=5) | 0.984 ± 0.000 (n=5) | 12.0M | 8.9m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | double_line | gru | balanced_accuracy ↑ | 0.911 ± 0.012 (n=5) | 0.990 ± 0.003 (n=5) | 69k | 8.9m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | double_line | cnn | balanced_accuracy ↑ | 0.797 ± 0.007 (n=5) | 0.983 ± 0.000 (n=5) | 68k | 9.0m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | double_line | resnet | balanced_accuracy ↑ | 0.866 ± 0.033 (n=5) | 0.952 ± 0.111 (n=5) | 530k | 24.0m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | testgrid_110kv | majority | balanced_accuracy ↑ | 0.500 ± 0.000 (n=5) | 0.500 ± 0.000 (n=5) | — | 0s | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | testgrid_110kv | random_forest | balanced_accuracy ↑ | 0.784 ± 0.001 (n=5) | 0.949 ± 0.001 (n=5) | — | 3.1m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | testgrid_110kv | mlp | balanced_accuracy ↑ | 0.790 ± 0.003 (n=5) | 0.984 ± 0.000 (n=5) | 26.7M | 20.6m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | testgrid_110kv | gru | balanced_accuracy ↑ | 0.881 ± 0.045 (n=5) | 0.994 ± 0.004 (n=5) | 92k | 21.4m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | testgrid_110kv | cnn | balanced_accuracy ↑ | 0.761 ± 0.009 (n=5) | 0.982 ± 0.001 (n=5) | 94k | 21.1m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | testgrid_110kv | resnet | balanced_accuracy ↑ | 0.873 ± 0.027 (n=5) | 0.994 ± 0.003 (n=5) | 564k | 26.6m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | ieee39 | majority | balanced_accuracy ↑ | 0.500 ± 0.000 (n=5) | 0.500 ± 0.000 (n=5) | — | 0s | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | ieee39 | random_forest | balanced_accuracy ↑ | 0.930 ± 0.000 (n=5) | 0.506 ± 0.000 (n=5) | — | 18.3m | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | ieee39 | mlp | balanced_accuracy ↑ | 0.843 ± 0.001 (n=5) | 0.981 ± 0.001 (n=5) | 103.4M | 1.6h | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | ieee39 | gru | balanced_accuracy ↑ | 0.770 ± 0.051 (n=5) | 0.867 ± 0.128 (n=5) | 211k | 1.5h | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | ieee39 | cnn | balanced_accuracy ↑ | 0.786 ± 0.005 (n=5) | 0.706 ± 0.313 (n=5) | 234k | 1.7h | trace: output · eval-code · log · train-code · config · W&B |
| event_detection_global | ieee39 | resnet | balanced_accuracy ↑ | 0.832 ± 0.058 (n=5) | 0.775 ± 0.314 (n=5) | 744k | 1.6h | trace: output · eval-code · log · train-code · config · W&B |
headline & reported metrics for this view — the metric set is a frozen contract; each links to the exact function that computes it
| metric | definition | entry |
|---|---|---|
balanced_accuracy | mean of per-class recall — the majority class cannot buy a good score | evaluate() |
macro_f1 | unweighted mean of per-class F1 (zero_division=0) | evaluate() |
missed_event_rate | FN-rate among positives (missed events) | evaluate() |
false_event_trip_rate | FP-rate among negatives (tripping on a benign event) | evaluate() |
accuracy | fraction of exact-match predictions | evaluate() |
PYTHONPATH=src python -m evemtbench.baselines.runner --task event_detection_global --protocol held_out \
--grid <grid> --baseline <baseline> --seeds 0 1 2 3 4