Semiglobal-PL Phase Scheduler / bench_report.json

✓✓ Beats tuned baseline

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.009
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.003
 15        },
 16        "mean": 225.13445281982422
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.006
 21        },
 22        "mean": 214.2943878173828
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.009
 27        },
 28        "mean": 201.62980270385742
 29      }
 30    ],
 31    "full": {
 32      "mean": 200.0606346130371,
 33      "std": 11.077029829348923,
 34      "per_seed": [
 35        212.36439514160156,
 36        200.49159240722656,
 37        205.28561401367188,
 38        188.3776092529297,
 39        203.29046630859375,
 40        185.93289184570312,
 41        187.44577026367188,
 42        217.29673767089844
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 185.36586952209473,
 49    "std": 11.095241493609498,
 50    "per_seed": [
 51      195.4981231689453,
 52      187.09390258789062,
 53      192.18927001953125,
 54      175.18148803710938,
 55      185.1798553466797,
 56      171.63917541503906,
 57      171.85842895507812,
 58      204.28671264648438
 59    ],
 60    "n": 8,
 61    "cfg": {
 62      "lr": 0.009
 63    },
 64    "runs": [
 65      {
 66        "metric": 195.4981231689453,
 67        "switched": true,
 68        "switch_step": 23,
 69        "lr_final": 0.013499999999999998,
 70        "clip_steps": 72,
 71        "observed_log_gap_slope": -0.01804690866414924,
 72        "predicted_minus_q2": -382299857278.8767,
 73        "q_tail_mean": 604388.9543802879,
 74        "device": "cuda"
 75      },
 76      {
 77        "metric": 187.09390258789062,
 78        "switched": true,
 79        "switch_step": 30,
 80        "lr_final": 0.013499999999999998,
 81        "clip_steps": 72,
 82        "observed_log_gap_slope": -0.009911357660239538,
 83        "predicted_minus_q2": -298791806484.8164,
 84        "q_tail_mean": 499215.2766124988,
 85        "device": "cuda"
 86      },
 87      {
 88        "metric": 192.18927001953125,
 89        "switched": true,
 90        "switch_step": 30,
 91        "lr_final": 0.013499999999999998,
 92        "clip_steps": 72,
 93        "observed_log_gap_slope": -0.06313450122089037,
 94        "predicted_minus_q2": -307170570800.53937,
 95        "q_tail_mean": 521645.67662283836,
 96        "device": "cuda"
 97      },
 98      {
 99        "metric": 175.18148803710938,
100        "switched": true,
101        "switch_step": 24,
102        "lr_final": 0.013499999999999998,
103        "clip_steps": 72,
104        "observed_log_gap_slope": 0.0313864532309592,
105        "predicted_minus_q2": -277706767948.9584,
106        "q_tail_mean": 508872.9958189457,
107        "device": "cuda"
108      },
109      {
110        "metric": 185.1798553466797,
111        "switched": true,
112        "switch_step": 25,
113        "lr_final": 0.013499999999999998,
114        "clip_steps": 72,
115        "observed_log_gap_slope": -0.08906700192000473,
116        "predicted_minus_q2": -469862343448.6883,
117        "q_tail_mean": 618141.8733281547,
118        "device": "cuda"
119      },
120      {
121        "metric": 171.63917541503906,
122        "switched": true,
123        "switch_step": 23,
124        "lr_final": 0.013499999999999998,
125        "clip_steps": 72,
126        "observed_log_gap_slope": -0.07050379253268516,
127        "predicted_minus_q2": -322708159123.9784,
128        "q_tail_mean": 542024.741677214,
129        "device": "cuda"
130      },
131      {
132        "metric": 171.85842895507812,
133        "switched": true,
134        "switch_step": 28,
135        "lr_final": 0.013499999999999998,
136        "clip_steps": 72,
137        "observed_log_gap_slope": -0.05052109490887936,
138        "predicted_minus_q2": -508205333696.0094,
139        "q_tail_mean": 697474.1491504112,
140        "device": "cuda"
141      },
142      {
143        "metric": 204.28671264648438,
144        "switched": true,
145        "switch_step": 28,
146        "lr_final": 0.013499999999999998,
147        "clip_steps": 72,
148        "observed_log_gap_slope": -0.04710672958307441,
149        "predicted_minus_q2": -307426876057.59827,
150        "q_tail_mean": 536556.6369037025,
151        "device": "cuda"
152      }
153    ],
154    "sweep": [
155      {
156        "cfg": {
157          "lr": 0.003
158        },
159        "mean": 222.8292999267578
160      },
161      {
162        "cfg": {
163          "lr": 0.006
164        },
165        "mean": 206.63719177246094
166      },
167      {
168        "cfg": {
169          "lr": 0.009
170        },
171        "mean": 187.49069595336914
172      }
173    ]
174  },
175  "comparison": {
176    "delta_mean": -14.694765090942383,
177    "idea_wins": 8,
178    "n_pairs": 8,
179    "per_seed_diffs": [
180      -16.86627197265625,
181      -13.397689819335938,
182      -13.096343994140625,
183      -13.196121215820312,
184      -18.110610961914062,
185      -14.293716430664062,
186      -15.58734130859375,
187      -13.010025024414062
188    ],
189    "p_value": 0.0081,
190    "mde": 1.6318810404189403,
191    "mde_rel_pct": 0.8156932239945007,
192    "verdict": "idea better (significant)",
193    "system_worked": true
194  },
195  "mechanism_signature": {
196    "quantity": "tail log(training loss gap) slope versus -mean(q^2), measured during trained NN runs",
197    "observed_mean": -0.039613116657370454,
198    "predicted_mean": -359271464354.93317,
199    "relative_error_mean": 0.9999999999998959,
200    "tolerance": 0.2,
201    "confirmed": false,
202    "switch_fraction": 1.0
203  },
204  "audit": {
205    "baseline_lr_grid": [
206      0.003,
207      0.006,
208      0.009
209    ],
210    "idea_lr_grid": [
211      0.003,
212      0.006,
213      0.009
214    ],
215    "baseline_selected_lr": 0.009,
216    "idea_selected_lr": 0.009,
217    "epochs": 18,
218    "batch": 128,
219    "clip_norm": 1.0,
220    "domain_rationale": "tabular is the prescribed structural track for optimizer and learning-rate schedule ideas"
221  }
222}