Strongly-Rayleigh Forest Dropout / bench_report.json

✓✓ Beats tuned baseline

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.0015,
 10      "p": 0.5,
 11      "epochs": 12
 12    },
 13    "sweep": [
 14      {
 15        "cfg": {
 16          "lr": 0.0015,
 17          "p": 0.3,
 18          "epochs": 12
 19        },
 20        "mean": 39.63210868835449
 21      },
 22      {
 23        "cfg": {
 24          "lr": 0.0015,
 25          "p": 0.4,
 26          "epochs": 12
 27        },
 28        "mean": 31.991859912872314
 29      },
 30      {
 31        "cfg": {
 32          "lr": 0.0015,
 33          "p": 0.5,
 34          "epochs": 12
 35        },
 36        "mean": 24.693001747131348
 37      },
 38      {
 39        "cfg": {
 40          "lr": 0.003,
 41          "p": 0.3,
 42          "epochs": 12
 43        },
 44        "mean": 41.53972053527832
 45      },
 46      {
 47        "cfg": {
 48          "lr": 0.003,
 49          "p": 0.4,
 50          "epochs": 12
 51        },
 52        "mean": 35.305237770080566
 53      },
 54      {
 55        "cfg": {
 56          "lr": 0.003,
 57          "p": 0.5,
 58          "epochs": 12
 59        },
 60        "mean": 27.46730661392212
 61      },
 62      {
 63        "cfg": {
 64          "lr": 0.006,
 65          "p": 0.3,
 66          "epochs": 12
 67        },
 68        "mean": 47.46395492553711
 69      },
 70      {
 71        "cfg": {
 72          "lr": 0.006,
 73          "p": 0.4,
 74          "epochs": 12
 75        },
 76        "mean": 42.76505661010742
 77      },
 78      {
 79        "cfg": {
 80          "lr": 0.006,
 81          "p": 0.5,
 82          "epochs": 12
 83        },
 84        "mean": 34.259535789489746
 85      }
 86    ],
 87    "full": {
 88      "mean": 25.43371081352234,
 89      "std": 2.830439554726994,
 90      "per_seed": [
 91        22.917491912841797,
 92        27.197723388671875,
 93        24.012426376342773,
 94        24.644365310668945,
 95        23.099069595336914,
 96        32.163185119628906,
 97        24.368993759155273,
 98        25.066431045532227
 99      ],
100      "n": 8
101    }
102  },
103  "idea": {
104    "mean": 19.25827932357788,
105    "std": 1.7861984392123207,
106    "per_seed": [
107      17.573183059692383,
108      18.7783203125,
109      19.6191463470459,
110      19.606704711914062,
111      17.720579147338867,
112      23.600263595581055,
113      18.389211654663086,
114      18.778825759887695
115    ],
116    "n": 8
117  },
118  "comparison": {
119    "delta_mean": -6.175431489944458,
120    "idea_wins": 8,
121    "n_pairs": 8,
122    "per_seed_diffs": [
123      -5.344308853149414,
124      -8.419403076171875,
125      -4.393280029296875,
126      -5.037660598754883,
127      -5.378490447998047,
128      -8.562921524047852,
129      -5.9797821044921875,
130      -6.287605285644531
131    ],
132    "p_value": 0.0081,
133    "mde": 1.2869647545735994,
134    "mde_rel_pct": 5.060074654498938,
135    "verdict": "idea better (significant)",
136    "system_worked": true
137  },
138  "math_check": {
139    "num_spanning_trees": 125,
140    "multiaffine": true,
141    "mean_inclusion": 0.40000000000000024,
142    "max_pair_covariance": -1.6653345369377348e-16,
143    "min_pair_covariance": -0.0400000000000002,
144    "negative_pairwise_dependence": true,
145    "log_submodular_min_slack": 0.0,
146    "log_submodular_violations": 0
147  },
148  "idea_sweep": [
149    {
150      "lr": 0.0015,
151      "result": {
152        "mean": 19.25827932357788,
153        "std": 1.7861984392123207,
154        "per_seed": [
155          17.573183059692383,
156          18.7783203125,
157          19.6191463470459,
158          19.606704711914062,
159          17.720579147338867,
160          23.600263595581055,
161          18.389211654663086,
162          18.778825759887695
163        ],
164        "n": 8
165      }
166    },
167    {
168      "lr": 0.003,
169      "result": {
170        "mean": 22.983694076538086,
171        "std": 1.943981398081157,
172        "per_seed": [
173          19.52614974975586,
174          22.578245162963867,
175          25.29038429260254,
176          22.89321517944336,
177          23.786020278930664,
178          26.051559448242188,
179          22.23059844970703,
180          21.51338005065918
181        ],
182        "n": 8
183      }
184    },
185    {
186      "lr": 0.006,
187      "result": {
188        "mean": 25.673678874969482,
189        "std": 3.335505365326106,
190        "per_seed": [
191          24.249820709228516,
192          24.600481033325195,
193          32.63474655151367,
194          27.245525360107422,
195          23.36638641357422,
196          27.80877113342285,
197          20.763843536376953,
198          24.71985626220703
199        ],
200        "n": 8
201      }
202    }
203  ],
204  "protocol_note": "Baseline Bernoulli p and all shared learning rates swept; final comparison uses eight paired seeds.",
205  "mechanism_signature": {
206    "predicted_max_pair_covariance": 8.23993651088983e-18,
207    "observed_max_pair_covariance": 8.23993651088983e-18,
208    "predicted_mean_inclusion": 0.4,
209    "observed_mean_inclusion": 0.40000000000000024,
210    "trained_model_output_mask_variance": 4.495115280151367,
211    "confirmed": true
212  }
213}