Every result number in the manuscript lives only in auto-generated tables, published in the committed results bundle results/1.1.0/tables/*.tex (hpc/make_results_bundle.py; built from the same code as hpc/make_paper_tables.py + hpc/make_supplement_tables.py) — never hand-typed in prose, and reproducible from the aggregated data in the same bundle (results/1.1.0/aggregated_results.csv). Each is the best learned baseline for one (task, grid, observability view, held_out test set), chosen by the same code and the same result.json the dashboard reads. So every paper number is on this page, and every number carries the five links a reviewer needs — output file, aggregation/eval code, training log, training code, config — plus its W&B run and (on hover of the winning baseline) its exact reproduce command. The committed backing store is the provenance index (index.json); the paper↔dashboard agreement is a test gate.
headline result tables (88 traced numbers). Full per-baseline numbers are on the per-baseline pages (linked from each grid/task page); the Supplementary tables draw from the same cells.
balanced_accuracy ↑paper table tab:res_fd · table results/1.1.0/tables/tab_res_fd.tex · best learned baseline per grid × view × test set
| grid | local in-distribution (test) | line in-distribution (test) | global in-distribution (test) | local never-trained (benchmark) | line never-trained (benchmark) | global never-trained (benchmark) |
|---|---|---|---|---|---|---|
| cigre_mv | 0.836 ± 0.002 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.838 ± 0.002 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.827 ± 0.003 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.983 ± 0.001 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.980 ± 0.003 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.985 ± 0.001 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B |
| double_line | 0.881 ± 0.001 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.906 ± 0.051 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.890 ± 0.001 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.499 ± 0.000 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.991 ± 0.008 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.500 ± 0.000 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B |
| testgrid_110kv | 0.949 ± 0.016 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.914 ± 0.026 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.878 ± 0.010 (n=5) [cnn] trace: output · eval-code · log · train-code · config · W&B | 0.995 ± 0.004 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.990 ± 0.003 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.987 ± 0.003 (n=5) [cnn] trace: output · eval-code · log · train-code · config · W&B |
| ieee39 | 0.931 ± 0.001 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.935 ± 0.000 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.934 ± 0.001 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.886 ± 0.000 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.868 ± 0.004 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.500 ± 0.000 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B |
balanced_accuracy ↑paper table tab:res_fc · table results/1.1.0/tables/tab_res_fc.tex · best learned baseline per grid × view × test set
| grid | local in-distribution (test) | line in-distribution (test) | global in-distribution (test) | local never-trained (benchmark) | line never-trained (benchmark) | global never-trained (benchmark) |
|---|---|---|---|---|---|---|
| cigre_mv | 0.656 ± 0.011 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.665 ± 0.010 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.520 ± 0.024 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.701 ± 0.011 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.700 ± 0.010 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.548 ± 0.007 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B |
| double_line | 0.855 ± 0.007 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.863 ± 0.007 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.818 ± 0.087 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.896 ± 0.045 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.873 ± 0.023 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.854 ± 0.097 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B |
| testgrid_110kv | 0.825 ± 0.006 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.805 ± 0.036 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.773 ± 0.107 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.848 ± 0.007 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.834 ± 0.015 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.772 ± 0.070 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B |
| ieee39 | 0.678 ± 0.010 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | 0.682 ± 0.006 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.684 ± 0.008 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | 0.703 ± 0.003 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | 0.716 ± 0.003 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | 0.683 ± 0.002 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B |
mae ↓paper table tab:res_fl · table results/1.1.0/tables/tab_res_fl.tex · best learned baseline per grid × view × test set
| grid | local in-distribution (test) | line in-distribution (test) | global in-distribution (test) | local never-trained (benchmark) | line never-trained (benchmark) | global never-trained (benchmark) |
|---|---|---|---|---|---|---|
| cigre_mv | 23.934 ± 0.024 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | 23.005 ± 0.552 (n=5) [cnn] trace: output · eval-code · log · train-code · config · W&B | 22.196 ± 0.031 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 30.485 ± 0.049 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | 24.522 ± 4.373 (n=5) [cnn] trace: output · eval-code · log · train-code · config · W&B | 18.868 ± 0.943 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B |
| double_line | 18.600 ± 0.213 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | 16.095 ± 0.030 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 15.869 ± 0.359 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | 11.695 ± 0.530 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | 5.179 ± 0.243 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 5.102 ± 0.715 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B |
| testgrid_110kv | 18.768 ± 0.171 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | 17.141 ± 0.065 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 16.994 ± 0.043 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 10.855 ± 0.572 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | 6.545 ± 0.540 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 6.538 ± 0.115 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B |
| ieee39 | 22.484 ± 0.027 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 18.681 ± 0.137 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 20.697 ± 0.115 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 21.403 ± 0.013 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 9.396 ± 0.257 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B | 20.389 ± 0.724 (n=5) [mlp] trace: output · eval-code · log · train-code · config · W&B |
balanced_accuracy ↑paper table tab:res_ed · table results/1.1.0/tables/tab_res_ed.tex · best learned baseline per grid × view × test set
| grid | local in-distribution (test) | line in-distribution (test) | global in-distribution (test) | local never-trained (benchmark) | line never-trained (benchmark) | global never-trained (benchmark) |
|---|---|---|---|---|---|---|
| cigre_mv | — | — | 0.884 ± 0.019 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | — | — | 0.989 ± 0.007 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B |
| double_line | — | — | 0.911 ± 0.012 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | — | — | 0.990 ± 0.003 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B |
| testgrid_110kv | — | — | 0.881 ± 0.045 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | — | — | 0.994 ± 0.004 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B |
| ieee39 | — | — | 0.930 ± 0.000 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | — | — | 0.506 ± 0.000 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B |
balanced_accuracy ↑paper table tab:res_ec · table results/1.1.0/tables/tab_res_ec.tex · best learned baseline per grid × view × test set
| grid | local in-distribution (test) | line in-distribution (test) | global in-distribution (test) | local never-trained (benchmark) | line never-trained (benchmark) | global never-trained (benchmark) |
|---|---|---|---|---|---|---|
| cigre_mv | — | — | 0.640 ± 0.009 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B | — | — | 0.698 ± 0.031 (n=5) [gru] trace: output · eval-code · log · train-code · config · W&B |
| double_line | — | — | 0.761 ± 0.006 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | — | — | 0.833 ± 0.016 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B |
| testgrid_110kv | — | — | 0.782 ± 0.006 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B | — | — | 0.831 ± 0.025 (n=5) [resnet] trace: output · eval-code · log · train-code · config · W&B |
| ieee39 | — | — | 0.762 ± 0.002 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B | — | — | 0.553 ± 0.018 (n=5) [random_forest] trace: output · eval-code · log · train-code · config · W&B |
headline & reported metrics for this view — the metric set is a frozen contract; each links to the exact function that computes it
| metric | definition | entry |
|---|---|---|
balanced_accuracy | mean of per-class recall — the majority class cannot buy a good score | evaluate() |
mae | mean absolute error, in the grid's own distance units | evaluate() |