tier 3 · event_classification · global view · 23 classes · all cells measured
Headline metric balanced_accuracy (↑ higher is better); full metric set: balanced_accuracy · macro_f1 · accuracy. Metrics are a frozen contract (src/evemtbench/evaluation/metrics.py); label derivation: src/evemtbench/tasks/labels.
event switch_inrush_hv · grid double_line (adapt_grid/test split) · sample 51, window #1173, cubicle 3 (max-RMS) · 50 ms / 480 samples @ 9.6 kHz · top: 3-phase current, bottom: 3-phase voltage · figure provenance in assets/manifest.json
| task | grid | baseline | headline | test | benchmark | params | fit/seed | trace |
|---|---|---|---|---|---|---|---|---|
| event_classification_global | cigre_mv | majority | balanced_accuracy ↑ | 0.045 ± 0.000 (n=5) | 0.045 ± 0.000 (n=5) | — | 0s | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | cigre_mv | random_forest | balanced_accuracy ↑ | 0.455 ± 0.005 (n=5) | 0.520 ± 0.006 (n=5) | — | 6.1m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | cigre_mv | mlp | balanced_accuracy ↑ | 0.521 ± 0.002 (n=5) | 0.542 ± 0.006 (n=5) | 42.9M | 43.0m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | cigre_mv | gru | balanced_accuracy ↑ | 0.640 ± 0.009 (n=5) | 0.698 ± 0.031 (n=5) | 120k | 40.6m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | cigre_mv | cnn | balanced_accuracy ↑ | 0.632 ± 0.011 (n=5) | 0.702 ± 0.011 (n=5) | 127k | 37.9m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | cigre_mv | resnet | balanced_accuracy ↑ | 0.613 ± 0.091 (n=5) | 0.670 ± 0.092 (n=5) | 605k | 15.6m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | double_line | majority | balanced_accuracy ↑ | 0.062 ± 0.000 (n=5) | 0.062 ± 0.000 (n=5) | — | 0s | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | double_line | random_forest | balanced_accuracy ↑ | 0.568 ± 0.002 (n=5) | 0.220 ± 0.009 (n=5) | — | 1.3m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | double_line | mlp | balanced_accuracy ↑ | 0.536 ± 0.004 (n=5) | 0.573 ± 0.013 (n=5) | 12.0M | 9.7m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | double_line | gru | balanced_accuracy ↑ | 0.676 ± 0.014 (n=5) | 0.751 ± 0.042 (n=5) | 71k | 10.0m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | double_line | cnn | balanced_accuracy ↑ | 0.630 ± 0.033 (n=5) | 0.669 ± 0.063 (n=5) | 70k | 9.4m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | double_line | resnet | balanced_accuracy ↑ | 0.761 ± 0.006 (n=5) | 0.833 ± 0.016 (n=5) | 533k | 20.5m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | testgrid_110kv | majority | balanced_accuracy ↑ | 0.059 ± 0.000 (n=5) | 0.059 ± 0.000 (n=5) | — | 0s | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | testgrid_110kv | random_forest | balanced_accuracy ↑ | 0.523 ± 0.002 (n=5) | 0.227 ± 0.006 (n=5) | — | 2.5m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | testgrid_110kv | mlp | balanced_accuracy ↑ | 0.556 ± 0.002 (n=5) | 0.584 ± 0.020 (n=5) | 26.7M | 20.4m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | testgrid_110kv | gru | balanced_accuracy ↑ | 0.675 ± 0.013 (n=5) | 0.730 ± 0.030 (n=5) | 94k | 19.6m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | testgrid_110kv | cnn | balanced_accuracy ↑ | 0.654 ± 0.011 (n=5) | 0.706 ± 0.015 (n=5) | 97k | 20.3m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | testgrid_110kv | resnet | balanced_accuracy ↑ | 0.782 ± 0.006 (n=5) | 0.831 ± 0.025 (n=5) | 567k | 20.3m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | ieee39 | majority | balanced_accuracy ↑ | 0.062 ± 0.000 (n=5) | 0.062 ± 0.000 (n=5) | — | 0s | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | ieee39 | random_forest | balanced_accuracy ↑ | 0.762 ± 0.002 (n=5) | 0.553 ± 0.018 (n=5) | — | 9.5m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | ieee39 | mlp | balanced_accuracy ↑ | 0.616 ± 0.003 (n=5) | 0.262 ± 0.007 (n=5) | 103.4M | 1.8h | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | ieee39 | gru | balanced_accuracy ↑ | 0.592 ± 0.037 (n=5) | 0.219 ± 0.016 (n=5) | 214k | 1.3h | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | ieee39 | cnn | balanced_accuracy ↑ | 0.582 ± 0.017 (n=5) | 0.226 ± 0.011 (n=5) | 237k | 46.2m | trace: output · eval-code · log · train-code · config · W&B |
| event_classification_global | ieee39 | resnet | balanced_accuracy ↑ | 0.640 ± 0.024 (n=5) | 0.283 ± 0.045 (n=5) | 747k | 39.2m | trace: output · eval-code · log · train-code · config · W&B |
headline & reported metrics for this view — the metric set is a frozen contract; each links to the exact function that computes it
| metric | definition | entry |
|---|---|---|
balanced_accuracy | mean of per-class recall — the majority class cannot buy a good score | evaluate() |
macro_f1 | unweighted mean of per-class F1 (zero_division=0) | evaluate() |
accuracy | fraction of exact-match predictions | evaluate() |
PYTHONPATH=src python -m evemtbench.baselines.runner --task event_classification_global --protocol held_out \
--grid <grid> --baseline <baseline> --seeds 0 1 2 3 4