The same committed numbers, never re-measured — every value below is re-aggregated from the per-seed vectors already in result.json, under defensible alternative schemes (equal-weight-by-grid mean, median, leave-one-grid-out, seeded percentile bootstrap). A headline that survives all of them is robust to the aggregation choice; a rank-sensitive one is flagged, not hidden.
13 of 24 scored task headlines rank-stable under every scheme
event_detection_global · balanced_accuracy ↑ (test set) rank-sensitive: winners ['gru', 'resnet'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.774 ± 0.009 0.786 0.766 … 0.781 [0.765, 0.783] 4 grids · 20 seed-values gru 0.837 ± 0.034 0.881 0.812 … 0.859 [0.804, 0.867] 4 grids · 20 seed-values mlp 0.792 ± 0.016 0.790 0.775 … 0.806 [0.777, 0.806] 4 grids · 20 seed-values random_forest 0.832 ± 0.028 0.810 0.799 … 0.848 [0.808, 0.858] 4 grids · 20 seed-values resnet 0.864 ± 0.016 0.873 0.857 … 0.874 [0.849, 0.878] 4 grids · 20 seed-values
fault_detection_global · balanced_accuracy ↑ (test set) rank-stable: random_forest wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.853 ± 0.016 0.867 0.844 … 0.870 [0.837, 0.866] 4 grids · 20 seed-values gru 0.839 ± 0.016 0.857 0.832 … 0.856 [0.823, 0.852] 4 grids · 20 seed-values mlp 0.829 ± 0.018 0.849 0.820 … 0.851 [0.811, 0.842] 4 grids · 20 seed-values random_forest 0.879 ± 0.019 0.890 0.861 … 0.897 [0.862, 0.895] 4 grids · 20 seed-values resnet 0.849 ± 0.016 0.864 0.842 … 0.866 [0.834, 0.862] 4 grids · 20 seed-values
fault_detection_line · balanced_accuracy ↑ (test set) rank-sensitive: winners ['random_forest', 'resnet'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.864 ± 0.017 0.877 0.853 … 0.882 [0.847, 0.878] 4 grids · 20 seed-values gru 0.855 ± 0.019 0.871 0.844 … 0.876 [0.837, 0.871] 4 grids · 20 seed-values mlp 0.836 ± 0.017 0.854 0.826 … 0.856 [0.820, 0.850] 4 grids · 20 seed-values random_forest 0.884 ± 0.017 0.884 0.867 … 0.899 [0.869, 0.898] 4 grids · 20 seed-values resnet 0.878 ± 0.026 0.906 0.867 … 0.906 [0.854, 0.900] 4 grids · 20 seed-values
fault_detection_local · balanced_accuracy ↑ (test set) rank-stable: resnet wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.868 ± 0.013 0.875 0.858 … 0.882 [0.855, 0.879] 4 grids · 20 seed-values gru 0.853 ± 0.018 0.864 0.845 … 0.863 [0.836, 0.869] 4 grids · 20 seed-values mlp 0.833 ± 0.017 0.850 0.823 … 0.854 [0.817, 0.847] 4 grids · 20 seed-values random_forest 0.883 ± 0.016 0.882 0.867 … 0.898 [0.869, 0.897] 4 grids · 20 seed-values resnet 0.891 ± 0.022 0.902 0.872 … 0.911 [0.871, 0.911] 4 grids · 20 seed-values
fault_grounded_global · balanced_accuracy ↑ (test set) rank-sensitive: winners ['cnn', 'gru', 'resnet'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.963 ± 0.005 0.969 0.961 … 0.969 [0.958, 0.967] 4 grids · 20 seed-values gru 0.955 ± 0.009 0.970 0.950 … 0.961 [0.946, 0.962] 4 grids · 20 seed-values mlp 0.954 ± 0.008 0.969 0.949 … 0.963 [0.946, 0.961] 4 grids · 20 seed-values random_forest 0.951 ± 0.005 0.955 0.948 … 0.956 [0.947, 0.955] 4 grids · 20 seed-values resnet 0.965 ± 0.004 0.969 0.963 … 0.969 [0.962, 0.968] 4 grids · 20 seed-values
fault_grounded_line · balanced_accuracy ↑ (test set) rank-stable: resnet wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.967 ± 0.002 0.970 0.966 … 0.970 [0.965, 0.969] 4 grids · 20 seed-values gru 0.963 ± 0.005 0.969 0.961 … 0.969 [0.958, 0.967] 4 grids · 20 seed-values mlp 0.964 ± 0.005 0.970 0.961 … 0.969 [0.959, 0.967] 4 grids · 20 seed-values random_forest 0.944 ± 0.003 0.945 0.941 … 0.945 [0.941, 0.946] 4 grids · 20 seed-values resnet 0.968 ± 0.002 0.970 0.967 … 0.970 [0.966, 0.970] 4 grids · 20 seed-values
fault_grounded_local · balanced_accuracy ↑ (test set) rank-sensitive: winners ['cnn', 'resnet'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.966 ± 0.003 0.969 0.965 … 0.970 [0.963, 0.969] 4 grids · 20 seed-values gru 0.953 ± 0.010 0.967 0.948 … 0.958 [0.943, 0.961] 4 grids · 20 seed-values mlp 0.960 ± 0.004 0.968 0.957 … 0.964 [0.957, 0.964] 4 grids · 20 seed-values random_forest 0.931 ± 0.004 0.936 0.927 … 0.934 [0.927, 0.935] 4 grids · 20 seed-values resnet 0.968 ± 0.001 0.969 0.967 … 0.968 [0.967, 0.969] 4 grids · 20 seed-values
switch_detection_global · balanced_accuracy ↑ (test set) rank-stable: resnet wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.747 ± 0.019 0.781 0.735 … 0.764 [0.730, 0.764] 4 grids · 20 seed-values gru 0.733 ± 0.027 0.725 0.721 … 0.738 [0.706, 0.757] 4 grids · 20 seed-values mlp 0.714 ± 0.012 0.711 0.700 … 0.722 [0.703, 0.725] 4 grids · 20 seed-values random_forest 0.770 ± 0.044 0.754 0.719 … 0.799 [0.731, 0.811] 4 grids · 20 seed-values resnet 0.830 ± 0.023 0.865 0.810 … 0.846 [0.809, 0.851] 4 grids · 20 seed-values
event_state_global · balanced_accuracy ↑ (test set) rank-sensitive: winners ['random_forest', 'resnet'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.699 ± 0.014 0.707 0.688 … 0.712 [0.687, 0.712] 4 grids · 20 seed-values gru 0.702 ± 0.025 0.740 0.689 … 0.724 [0.679, 0.725] 4 grids · 20 seed-values mlp 0.713 ± 0.022 0.706 0.689 … 0.731 [0.694, 0.733] 4 grids · 20 seed-values random_forest 0.766 ± 0.040 0.724 0.717 … 0.786 [0.732, 0.805] 4 grids · 20 seed-values resnet 0.760 ± 0.033 0.777 0.734 … 0.782 [0.729, 0.789] 4 grids · 20 seed-values
fault_category_global · balanced_accuracy ↑ (test set) rank-sensitive: winners ['cnn', 'gru'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.882 ± 0.063 0.957 0.855 … 0.957 [0.821, 0.929] 4 grids · 20 seed-values gru 0.882 ± 0.068 0.963 0.854 … 0.963 [0.817, 0.933] 4 grids · 20 seed-values mlp 0.879 ± 0.068 0.962 0.851 … 0.960 [0.814, 0.929] 4 grids · 20 seed-values random_forest 0.806 ± 0.068 0.884 0.761 … 0.885 [0.743, 0.863] 4 grids · 20 seed-values resnet 0.876 ± 0.067 0.957 0.848 … 0.956 [0.811, 0.925] 4 grids · 20 seed-values
fault_category_line · balanced_accuracy ↑ (test set) rank-sensitive: winners ['cnn', 'gru'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.890 ± 0.061 0.964 0.865 … 0.963 [0.831, 0.934] 4 grids · 20 seed-values gru 0.888 ± 0.064 0.964 0.861 … 0.965 [0.826, 0.935] 4 grids · 20 seed-values mlp 0.883 ± 0.065 0.963 0.856 … 0.961 [0.821, 0.931] 4 grids · 20 seed-values random_forest 0.799 ± 0.062 0.827 0.749 … 0.867 [0.741, 0.852] 4 grids · 20 seed-values resnet 0.886 ± 0.064 0.962 0.860 … 0.963 [0.825, 0.934] 4 grids · 20 seed-values
fault_category_local · balanced_accuracy ↑ (test set) rank-sensitive: winners ['gru', 'resnet'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.880 ± 0.065 0.958 0.853 … 0.959 [0.818, 0.929] 4 grids · 20 seed-values gru 0.881 ± 0.065 0.960 0.855 … 0.960 [0.818, 0.929] 4 grids · 20 seed-values mlp 0.873 ± 0.066 0.951 0.844 … 0.952 [0.810, 0.922] 4 grids · 20 seed-values random_forest 0.782 ± 0.060 0.807 0.725 … 0.843 [0.726, 0.833] 4 grids · 20 seed-values resnet 0.881 ± 0.064 0.955 0.853 … 0.958 [0.819, 0.929] 4 grids · 20 seed-values
fault_classification_global · balanced_accuracy ↑ (test set) rank-stable: resnet wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.622 ± 0.032 0.670 0.605 … 0.660 [0.590, 0.649] 4 grids · 20 seed-values gru 0.622 ± 0.031 0.669 0.602 … 0.656 [0.592, 0.648] 4 grids · 20 seed-values mlp 0.630 ± 0.030 0.676 0.615 … 0.666 [0.601, 0.655] 4 grids · 20 seed-values random_forest 0.637 ± 0.032 0.679 0.621 … 0.674 [0.607, 0.662] 4 grids · 20 seed-values resnet 0.692 ± 0.061 0.773 0.650 … 0.749 [0.637, 0.746] 4 grids · 20 seed-values
fault_classification_line · balanced_accuracy ↑ (test set) rank-stable: resnet wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.685 ± 0.038 0.706 0.649 … 0.721 [0.651, 0.717] 4 grids · 20 seed-values gru 0.645 ± 0.032 0.681 0.628 … 0.683 [0.615, 0.671] 4 grids · 20 seed-values mlp 0.645 ± 0.034 0.679 0.625 … 0.686 [0.612, 0.673] 4 grids · 20 seed-values random_forest 0.613 ± 0.032 0.661 0.597 … 0.651 [0.583, 0.639] 4 grids · 20 seed-values resnet 0.754 ± 0.041 0.805 0.717 … 0.783 [0.717, 0.790] 4 grids · 20 seed-values
fault_classification_local · balanced_accuracy ↑ (test set) rank-stable: resnet wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.681 ± 0.039 0.685 0.643 … 0.719 [0.646, 0.715] 4 grids · 20 seed-values gru 0.636 ± 0.033 0.678 0.621 … 0.674 [0.605, 0.661] 4 grids · 20 seed-values mlp 0.634 ± 0.030 0.675 0.619 … 0.670 [0.606, 0.659] 4 grids · 20 seed-values random_forest 0.594 ± 0.034 0.628 0.570 … 0.633 [0.562, 0.623] 4 grids · 20 seed-values resnet 0.754 ± 0.042 0.825 0.721 … 0.787 [0.716, 0.792] 4 grids · 20 seed-values
fault_origin_global · balanced_accuracy ↑ (test set) rank-stable: cnn wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.856 ± 0.014 0.867 0.846 … 0.871 [0.843, 0.868] 4 grids · 20 seed-values gru 0.850 ± 0.015 0.863 0.841 … 0.865 [0.835, 0.862] 4 grids · 20 seed-values mlp 0.841 ± 0.019 0.865 0.831 … 0.863 [0.822, 0.856] 4 grids · 20 seed-values random_forest 0.682 ± 0.059 0.759 0.629 … 0.727 [0.629, 0.736] 4 grids · 20 seed-values resnet 0.846 ± 0.020 0.866 0.834 … 0.869 [0.827, 0.863] 4 grids · 20 seed-values
fault_phase_global · balanced_accuracy ↑ (test set) rank-sensitive: winners ['cnn', 'random_forest', 'resnet'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.853 ± 0.008 0.865 0.846 … 0.859 [0.846, 0.861] 4 grids · 20 seed-values gru 0.844 ± 0.010 0.857 0.836 … 0.850 [0.834, 0.853] 4 grids · 20 seed-values mlp 0.839 ± 0.009 0.849 0.835 … 0.849 [0.830, 0.846] 4 grids · 20 seed-values random_forest 0.847 ± 0.023 0.839 0.822 … 0.865 [0.827, 0.867] 4 grids · 20 seed-values resnet 0.847 ± 0.017 0.867 0.836 … 0.862 [0.832, 0.862] 4 grids · 20 seed-values
fault_phase_line · balanced_accuracy ↑ (test set) rank-stable: resnet wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.877 ± 0.008 0.886 0.871 … 0.886 [0.869, 0.883] 4 grids · 20 seed-values gru 0.856 ± 0.015 0.874 0.850 … 0.872 [0.842, 0.869] 4 grids · 20 seed-values mlp 0.841 ± 0.010 0.854 0.836 … 0.853 [0.831, 0.849] 4 grids · 20 seed-values random_forest 0.848 ± 0.023 0.839 0.822 … 0.865 [0.827, 0.868] 4 grids · 20 seed-values resnet 0.891 ± 0.013 0.895 0.882 … 0.901 [0.878, 0.901] 4 grids · 20 seed-values
fault_phase_local · balanced_accuracy ↑ (test set) rank-stable: resnet wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.879 ± 0.008 0.883 0.873 … 0.887 [0.871, 0.886] 4 grids · 20 seed-values gru 0.841 ± 0.012 0.851 0.833 … 0.851 [0.830, 0.851] 4 grids · 20 seed-values mlp 0.840 ± 0.009 0.850 0.834 … 0.850 [0.832, 0.847] 4 grids · 20 seed-values random_forest 0.834 ± 0.024 0.839 0.807 … 0.851 [0.812, 0.855] 4 grids · 20 seed-values resnet 0.886 ± 0.015 0.898 0.879 … 0.900 [0.871, 0.898] 4 grids · 20 seed-values
switch_type_global · balanced_accuracy ↑ (test set) rank-sensitive: winners ['cnn', 'resnet'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.712 ± 0.009 0.726 0.706 … 0.722 [0.704, 0.720] 4 grids · 20 seed-values gru 0.713 ± 0.016 0.739 0.701 … 0.727 [0.698, 0.727] 4 grids · 20 seed-values mlp 0.677 ± 0.024 0.705 0.664 … 0.706 [0.655, 0.697] 4 grids · 20 seed-values random_forest 0.716 ± 0.048 0.729 0.664 … 0.753 [0.673, 0.759] 4 grids · 20 seed-values resnet 0.736 ± 0.043 0.791 0.703 … 0.772 [0.696, 0.775] 4 grids · 20 seed-values
event_classification_global · balanced_accuracy ↑ (test set) rank-stable: resnet wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 0.624 ± 0.014 0.632 0.615 … 0.639 [0.611, 0.638] 4 grids · 20 seed-values gru 0.645 ± 0.018 0.675 0.635 … 0.663 [0.628, 0.661] 4 grids · 20 seed-values mlp 0.557 ± 0.017 0.556 0.538 … 0.569 [0.542, 0.573] 4 grids · 20 seed-values random_forest 0.577 ± 0.055 0.568 0.515 … 0.618 [0.529, 0.626] 4 grids · 20 seed-values resnet 0.699 ± 0.039 0.761 0.671 … 0.727 [0.662, 0.732] 4 grids · 20 seed-values
fault_location_global · mae ↓ (test set) rank-stable: mlp wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 20.038 ± 0.920 21.447 19.270 … 20.794 [19.251, 20.874] 4 grids · 20 seed-values gru 19.770 ± 1.543 22.648 18.626 … 21.070 [18.352, 21.209] 4 grids · 20 seed-values mlp 19.056 ± 1.181 20.697 18.010 … 19.962 [18.029, 20.129] 4 grids · 20 seed-values random_forest 22.599 ± 0.935 24.131 21.912 … 23.540 [21.751, 23.451] 4 grids · 20 seed-values resnet 20.228 ± 1.065 21.816 19.352 … 21.156 [19.277, 21.176] 4 grids · 20 seed-values
fault_location_line · mae ↓ (test set) rank-stable: mlp wins under every scheme baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 19.655 ± 1.045 20.081 18.538 … 20.309 [18.765, 20.634] 4 grids · 20 seed-values gru 19.144 ± 1.378 18.887 17.563 … 20.010 [18.026, 20.476] 4 grids · 20 seed-values mlp 18.958 ± 1.444 18.681 17.306 … 19.912 [17.764, 20.331] 4 grids · 20 seed-values random_forest 22.182 ± 0.985 23.590 21.429 … 23.203 [21.321, 23.046] 4 grids · 20 seed-values resnet 19.863 ± 1.269 20.500 18.521 … 20.751 [18.789, 21.084] 4 grids · 20 seed-values
fault_location_local · mae ↓ (test set) rank-sensitive: winners ['gru', 'mlp'] baseline mean over grids ± t-CI median over grids leave-one-grid-out range seed-bootstrap 95% CI n cnn 21.499 ± 0.973 22.981 20.671 … 22.232 [20.653, 22.382] 4 grids · 20 seed-values gru 21.004 ± 1.135 22.716 20.028 … 21.806 [20.010, 22.050] 4 grids · 20 seed-values mlp 21.638 ± 0.806 22.484 20.870 … 22.288 [20.936, 22.378] 4 grids · 20 seed-values random_forest 23.846 ± 0.439 24.497 23.531 … 24.314 [23.462, 24.225] 4 grids · 20 seed-values resnet 21.567 ± 0.952 23.077 20.779 … 22.304 [20.727, 22.457] 4 grids · 20 seed-values
EvEMTBench results audit · every number on this site is read from committed artifacts at build time · regenerate: PYTHONPATH=src python hpc/make_audit.py · gate: hpc/check_results_fresh.py · repository