Learning-Rate-Scaled Weight Decay / bench_report.json

✓✓ Beats tuned baseline

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "weight_decay": 0.001
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.0015,
 16          "weight_decay": 0.001
 17        },
 18        "mean": 16.25991463661194
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.0015,
 23          "weight_decay": 0.01
 24        },
 25        "mean": 16.260149240493774
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.003,
 30          "weight_decay": 0.001
 31        },
 32        "mean": 13.776280879974365
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.003,
 37          "weight_decay": 0.01
 38        },
 39        "mean": 13.777657508850098
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.006,
 44          "weight_decay": 0.001
 45        },
 46        "mean": 11.124481439590454
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.006,
 51          "weight_decay": 0.01
 52        },
 53        "mean": 11.131932497024536
 54      }
 55    ],
 56    "full": {
 57      "mean": 11.662253737449646,
 58      "std": 1.1646783408667203,
 59      "per_seed": [
 60        11.829092979431152,
 61        10.211130142211914,
 62        11.012014389038086,
 63        11.445688247680664,
 64        10.679678916931152,
 65        11.089096069335938,
 66        13.720934867858887,
 67        13.310394287109375
 68      ],
 69      "n": 8
 70    }
 71  },
 72  "idea": {
 73    "mean": 11.662033557891846,
 74    "std": 1.16472778990251,
 75    "per_seed": [
 76      11.828662872314453,
 77      10.210942268371582,
 78      11.011709213256836,
 79      11.445385932922363,
 80      10.679506301879883,
 81      11.088908195495605,
 82      13.720953941345215,
 83      13.310199737548828
 84    ],
 85    "n": 8,
 86    "selected_cfg": {
 87      "lr": 0.006,
 88      "weight_decay": 0.001
 89    },
 90    "sweep": [
 91      {
 92        "cfg": {
 93          "lr": 0.0015,
 94          "weight_decay": 0.001
 95        },
 96        "mean": 16.26001787185669
 97      },
 98      {
 99        "cfg": {
100          "lr": 0.0015,
101          "weight_decay": 0.01
102        },
103        "mean": 16.261214017868042
104      },
105      {
106        "cfg": {
107          "lr": 0.003,
108          "weight_decay": 0.001
109        },
110        "mean": 13.776211261749268
111      },
112      {
113        "cfg": {
114          "lr": 0.003,
115          "weight_decay": 0.01
116        },
117        "mean": 13.776825904846191
118      },
119      {
120        "cfg": {
121          "lr": 0.006,
122          "weight_decay": 0.001
123        },
124        "mean": 11.124175071716309
125      },
126      {
127        "cfg": {
128          "lr": 0.006,
129          "weight_decay": 0.01
130        },
131        "mean": 11.128536701202393
132      }
133    ]
134  },
135  "comparison": {
136    "delta_mean": -0.00022017955780029297,
137    "idea_wins": 7,
138    "n_pairs": 8,
139    "per_seed_diffs": [
140      -0.00043010711669921875,
141      -0.00018787384033203125,
142      -0.00030517578125,
143      -0.00030231475830078125,
144      -0.00017261505126953125,
145      -0.00018787384033203125,
146      1.9073486328125e-05,
147      -0.000194549560546875
148    ],
149    "p_value": 0.0169,
150    "mde": 0.0001096098618612078,
151    "mde_rel_pct": 0.0009398686079795221,
152    "verdict": "idea better (significant)",
153    "system_worked": true
154  },
155  "mechanism_signature": {
156    "source": "trained mlp_tiny models on Friedman#1; decay boundaries instrumented during full paired runs",
157    "predicted_mean_decay_multiplier": 0.9999976694444446,
158    "observed_mean_decay_multiplier": 0.9999976609459289,
159    "multiplier_abs_error": 8.498515668975415e-09,
160    "cooldown_predicted_log_ratio": 0.2521996381548064,
161    "cooldown_observed_log_ratio": 1.2277044265333381,
162    "cooldown_ratio_abs_error": 0.9755047883785317,
163    "confirmed": false
164  },
165  "protocol_notes": {
166    "epochs": 30,
167    "batch": 128,
168    "grid_union": [
169      {
170        "lr": 0.0015,
171        "weight_decay": 0.001
172      },
173      {
174        "lr": 0.0015,
175        "weight_decay": 0.01
176      },
177      {
178        "lr": 0.003,
179        "weight_decay": 0.001
180      },
181      {
182        "lr": 0.003,
183        "weight_decay": 0.01
184      },
185      {
186        "lr": 0.006,
187        "weight_decay": 0.001
188      },
189      {
190        "lr": 0.006,
191        "weight_decay": 0.01
192      }
193    ],
194    "selection_seeds": [
195      0,
196      1,
197      2,
198      3
199    ],
200    "paired_seeds": [
201      0,
202      1,
203      2,
204      3,
205      4,
206      5,
207      6,
208      7
209    ],
210    "structural_match": "tabular is the built-in optimizer/regularizer track"
211  }
212}