Paper numbers — traced

benchmark version 1.1.0 · held_out results v1.0.0 · splits v1.0/held_out, v1.1/multi_grid
updated 2026-09-29 13:18 UTC · git 7243f310ddbc

Every result number in the manuscript lives only in auto-generated tables, published in the committed results bundle results/1.1.0/tables/*.tex (hpc/make_results_bundle.py; built from the same code as hpc/make_paper_tables.py + hpc/make_supplement_tables.py) — never hand-typed in prose, and reproducible from the aggregated data in the same bundle (results/1.1.0/aggregated_results.csv). Each is the best learned baseline for one (task, grid, observability view, held_out test set), chosen by the same code and the same result.json the dashboard reads. So every paper number is on this page, and every number carries the five links a reviewer needs — output file, aggregation/eval code, training log, training code, config — plus its W&B run and (on hover of the winning baseline) its exact reproduce command. The committed backing store is the provenance index (index.json); the paper↔dashboard agreement is a test gate.

headline result tables (88 traced numbers). Full per-baseline numbers are on the per-baseline pages (linked from each grid/task page); the Supplementary tables draw from the same cells.

Fault detection (FD) · headline balanced_accuracy ↑

paper table tab:res_fd · table results/1.1.0/tables/tab_res_fd.tex · best learned baseline per grid × view × test set

gridlocal
in-distribution (test)
line
in-distribution (test)
global
in-distribution (test)
local
never-trained (benchmark)
line
never-trained (benchmark)
global
never-trained (benchmark)
cigre_mv0.836 ± 0.002 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.838 ± 0.002 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.827 ± 0.003 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.983 ± 0.001 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.980 ± 0.003 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.985 ± 0.001 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
double_line0.881 ± 0.001 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.906 ± 0.051 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.890 ± 0.001 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.499 ± 0.000 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.991 ± 0.008 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.500 ± 0.000 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
testgrid_110kv0.949 ± 0.016 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.914 ± 0.026 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.878 ± 0.010 (n=5)
[cnn]
trace: output · eval-code · log · train-code · config · W&B
0.995 ± 0.004 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.990 ± 0.003 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.987 ± 0.003 (n=5)
[cnn]
trace: output · eval-code · log · train-code · config · W&B
ieee390.931 ± 0.001 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.935 ± 0.000 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.934 ± 0.001 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.886 ± 0.000 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.868 ± 0.004 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.500 ± 0.000 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B

Fault-type classification (FC, 9-class) · headline balanced_accuracy ↑

paper table tab:res_fc · table results/1.1.0/tables/tab_res_fc.tex · best learned baseline per grid × view × test set

gridlocal
in-distribution (test)
line
in-distribution (test)
global
in-distribution (test)
local
never-trained (benchmark)
line
never-trained (benchmark)
global
never-trained (benchmark)
cigre_mv0.656 ± 0.011 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.665 ± 0.010 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.520 ± 0.024 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.701 ± 0.011 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.700 ± 0.010 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.548 ± 0.007 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
double_line0.855 ± 0.007 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.863 ± 0.007 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.818 ± 0.087 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.896 ± 0.045 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.873 ± 0.023 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.854 ± 0.097 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
testgrid_110kv0.825 ± 0.006 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.805 ± 0.036 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.773 ± 0.107 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.848 ± 0.007 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.834 ± 0.015 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.772 ± 0.070 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
ieee390.678 ± 0.010 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
0.682 ± 0.006 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.684 ± 0.008 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
0.703 ± 0.003 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
0.716 ± 0.003 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
0.683 ± 0.002 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B

Fault localisation (FL) · headline mae ↓

paper table tab:res_fl · table results/1.1.0/tables/tab_res_fl.tex · best learned baseline per grid × view × test set

gridlocal
in-distribution (test)
line
in-distribution (test)
global
in-distribution (test)
local
never-trained (benchmark)
line
never-trained (benchmark)
global
never-trained (benchmark)
cigre_mv23.934 ± 0.024 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
23.005 ± 0.552 (n=5)
[cnn]
trace: output · eval-code · log · train-code · config · W&B
22.196 ± 0.031 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
30.485 ± 0.049 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
24.522 ± 4.373 (n=5)
[cnn]
trace: output · eval-code · log · train-code · config · W&B
18.868 ± 0.943 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
double_line18.600 ± 0.213 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
16.095 ± 0.030 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
15.869 ± 0.359 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
11.695 ± 0.530 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
5.179 ± 0.243 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
5.102 ± 0.715 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
testgrid_110kv18.768 ± 0.171 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
17.141 ± 0.065 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
16.994 ± 0.043 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
10.855 ± 0.572 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
6.545 ± 0.540 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
6.538 ± 0.115 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
ieee3922.484 ± 0.027 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
18.681 ± 0.137 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
20.697 ± 0.115 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
21.403 ± 0.013 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
9.396 ± 0.257 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B
20.389 ± 0.724 (n=5)
[mlp]
trace: output · eval-code · log · train-code · config · W&B

Event detection (ED) · headline balanced_accuracy ↑

paper table tab:res_ed · table results/1.1.0/tables/tab_res_ed.tex · best learned baseline per grid × view × test set

gridlocal
in-distribution (test)
line
in-distribution (test)
global
in-distribution (test)
local
never-trained (benchmark)
line
never-trained (benchmark)
global
never-trained (benchmark)
cigre_mv——0.884 ± 0.019 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
——0.989 ± 0.007 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
double_line——0.911 ± 0.012 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
——0.990 ± 0.003 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
testgrid_110kv——0.881 ± 0.045 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
——0.994 ± 0.004 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
ieee39——0.930 ± 0.000 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
——0.506 ± 0.000 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B

Event classification (EC) · headline balanced_accuracy ↑

paper table tab:res_ec · table results/1.1.0/tables/tab_res_ec.tex · best learned baseline per grid × view × test set

gridlocal
in-distribution (test)
line
in-distribution (test)
global
in-distribution (test)
local
never-trained (benchmark)
line
never-trained (benchmark)
global
never-trained (benchmark)
cigre_mv——0.640 ± 0.009 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
——0.698 ± 0.031 (n=5)
[gru]
trace: output · eval-code · log · train-code · config · W&B
double_line——0.761 ± 0.006 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
——0.833 ± 0.016 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
testgrid_110kv——0.782 ± 0.006 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
——0.831 ± 0.025 (n=5)
[resnet]
trace: output · eval-code · log · train-code · config · W&B
ieee39——0.762 ± 0.002 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B
——0.553 ± 0.018 (n=5)
[random_forest]
trace: output · eval-code · log · train-code · config · W&B

Metric definitions

headline & reported metrics for this view — the metric set is a frozen contract; each links to the exact function that computes it

metricdefinitionentry
balanced_accuracymean of per-class recall — the majority class cannot buy a good scoreevaluate()
maemean absolute error, in the grid's own distance unitsevaluate()