Semiglobal-PL Phase Scheduler / bench_report.json
Beats tuned baseline
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.009
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.003
15 },
16 "mean": 225.13445281982422
17 },
18 {
19 "cfg": {
20 "lr": 0.006
21 },
22 "mean": 214.2943878173828
23 },
24 {
25 "cfg": {
26 "lr": 0.009
27 },
28 "mean": 201.62980270385742
29 }
30 ],
31 "full": {
32 "mean": 200.0606346130371,
33 "std": 11.077029829348923,
34 "per_seed": [
35 212.36439514160156,
36 200.49159240722656,
37 205.28561401367188,
38 188.3776092529297,
39 203.29046630859375,
40 185.93289184570312,
41 187.44577026367188,
42 217.29673767089844
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 185.36586952209473,
49 "std": 11.095241493609498,
50 "per_seed": [
51 195.4981231689453,
52 187.09390258789062,
53 192.18927001953125,
54 175.18148803710938,
55 185.1798553466797,
56 171.63917541503906,
57 171.85842895507812,
58 204.28671264648438
59 ],
60 "n": 8,
61 "cfg": {
62 "lr": 0.009
63 },
64 "runs": [
65 {
66 "metric": 195.4981231689453,
67 "switched": true,
68 "switch_step": 23,
69 "lr_final": 0.013499999999999998,
70 "clip_steps": 72,
71 "observed_log_gap_slope": -0.01804690866414924,
72 "predicted_minus_q2": -382299857278.8767,
73 "q_tail_mean": 604388.9543802879,
74 "device": "cuda"
75 },
76 {
77 "metric": 187.09390258789062,
78 "switched": true,
79 "switch_step": 30,
80 "lr_final": 0.013499999999999998,
81 "clip_steps": 72,
82 "observed_log_gap_slope": -0.009911357660239538,
83 "predicted_minus_q2": -298791806484.8164,
84 "q_tail_mean": 499215.2766124988,
85 "device": "cuda"
86 },
87 {
88 "metric": 192.18927001953125,
89 "switched": true,
90 "switch_step": 30,
91 "lr_final": 0.013499999999999998,
92 "clip_steps": 72,
93 "observed_log_gap_slope": -0.06313450122089037,
94 "predicted_minus_q2": -307170570800.53937,
95 "q_tail_mean": 521645.67662283836,
96 "device": "cuda"
97 },
98 {
99 "metric": 175.18148803710938,
100 "switched": true,
101 "switch_step": 24,
102 "lr_final": 0.013499999999999998,
103 "clip_steps": 72,
104 "observed_log_gap_slope": 0.0313864532309592,
105 "predicted_minus_q2": -277706767948.9584,
106 "q_tail_mean": 508872.9958189457,
107 "device": "cuda"
108 },
109 {
110 "metric": 185.1798553466797,
111 "switched": true,
112 "switch_step": 25,
113 "lr_final": 0.013499999999999998,
114 "clip_steps": 72,
115 "observed_log_gap_slope": -0.08906700192000473,
116 "predicted_minus_q2": -469862343448.6883,
117 "q_tail_mean": 618141.8733281547,
118 "device": "cuda"
119 },
120 {
121 "metric": 171.63917541503906,
122 "switched": true,
123 "switch_step": 23,
124 "lr_final": 0.013499999999999998,
125 "clip_steps": 72,
126 "observed_log_gap_slope": -0.07050379253268516,
127 "predicted_minus_q2": -322708159123.9784,
128 "q_tail_mean": 542024.741677214,
129 "device": "cuda"
130 },
131 {
132 "metric": 171.85842895507812,
133 "switched": true,
134 "switch_step": 28,
135 "lr_final": 0.013499999999999998,
136 "clip_steps": 72,
137 "observed_log_gap_slope": -0.05052109490887936,
138 "predicted_minus_q2": -508205333696.0094,
139 "q_tail_mean": 697474.1491504112,
140 "device": "cuda"
141 },
142 {
143 "metric": 204.28671264648438,
144 "switched": true,
145 "switch_step": 28,
146 "lr_final": 0.013499999999999998,
147 "clip_steps": 72,
148 "observed_log_gap_slope": -0.04710672958307441,
149 "predicted_minus_q2": -307426876057.59827,
150 "q_tail_mean": 536556.6369037025,
151 "device": "cuda"
152 }
153 ],
154 "sweep": [
155 {
156 "cfg": {
157 "lr": 0.003
158 },
159 "mean": 222.8292999267578
160 },
161 {
162 "cfg": {
163 "lr": 0.006
164 },
165 "mean": 206.63719177246094
166 },
167 {
168 "cfg": {
169 "lr": 0.009
170 },
171 "mean": 187.49069595336914
172 }
173 ]
174 },
175 "comparison": {
176 "delta_mean": -14.694765090942383,
177 "idea_wins": 8,
178 "n_pairs": 8,
179 "per_seed_diffs": [
180 -16.86627197265625,
181 -13.397689819335938,
182 -13.096343994140625,
183 -13.196121215820312,
184 -18.110610961914062,
185 -14.293716430664062,
186 -15.58734130859375,
187 -13.010025024414062
188 ],
189 "p_value": 0.0081,
190 "mde": 1.6318810404189403,
191 "mde_rel_pct": 0.8156932239945007,
192 "verdict": "idea better (significant)",
193 "system_worked": true
194 },
195 "mechanism_signature": {
196 "quantity": "tail log(training loss gap) slope versus -mean(q^2), measured during trained NN runs",
197 "observed_mean": -0.039613116657370454,
198 "predicted_mean": -359271464354.93317,
199 "relative_error_mean": 0.9999999999998959,
200 "tolerance": 0.2,
201 "confirmed": false,
202 "switch_fraction": 1.0
203 },
204 "audit": {
205 "baseline_lr_grid": [
206 0.003,
207 0.006,
208 0.009
209 ],
210 "idea_lr_grid": [
211 0.003,
212 0.006,
213 0.009
214 ],
215 "baseline_selected_lr": 0.009,
216 "idea_selected_lr": 0.009,
217 "epochs": 18,
218 "batch": 128,
219 "clip_norm": 1.0,
220 "domain_rationale": "tabular is the prescribed structural track for optimizer and learning-rate schedule ideas"
221 }
222}