TD-to-PDE Continuation Training / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "poisson_boundary",
4 "model": "smooth_mlp_shared",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "sweep": [
9 {
10 "cfg": {
11 "lr": 0.001
12 },
13 "mean": 0.09443562291562557
14 },
15 {
16 "cfg": {
17 "lr": 0.003
18 },
19 "mean": 0.026866592932492495
20 },
21 {
22 "cfg": {
23 "lr": 0.01
24 },
25 "mean": 0.021620961604639888
26 }
27 ],
28 "best_cfg": {
29 "lr": 0.01
30 },
31 "full": {
32 "config": {
33 "lr": 0.01,
34 "pde_weight": 0.0
35 },
36 "per_seed": [
37 0.027827076613903046,
38 0.013140390627086163,
39 0.02447698265314102,
40 0.02103939652442932,
41 0.019167248159646988,
42 0.014232118614017963,
43 0.017978858202695847,
44 0.019848095253109932
45 ],
46 "details": [
47 {
48 "metric": 0.027827076613903046,
49 "ramp_epochs": [],
50 "early_pred": 0.17212451994419098,
51 "late_pred": 0.07173162906923715,
52 "early_pde": 0.016137513642509777,
53 "late_pde": 57.825637928758034,
54 "output_var": 0.16997186839580536
55 },
56 {
57 "metric": 0.013140390627086163,
58 "ramp_epochs": [],
59 "early_pred": 0.14410895109176636,
60 "late_pred": 0.06673828408341198,
61 "early_pde": 0.016183204328020413,
62 "late_pde": 49.783568495610616,
63 "output_var": 0.14312273263931274
64 },
65 {
66 "metric": 0.02447698265314102,
67 "ramp_epochs": [],
68 "early_pred": 0.2193710853656133,
69 "late_pred": 0.06691976044984425,
70 "early_pde": 0.033302336310346924,
71 "late_pde": 44.65269423695281,
72 "output_var": 0.15733948349952698
73 },
74 {
75 "metric": 0.02103939652442932,
76 "ramp_epochs": [],
77 "early_pred": 0.20242826143900552,
78 "late_pred": 0.06018218672012582,
79 "early_pde": 0.03576013880471388,
80 "late_pde": 46.459858779740685,
81 "output_var": 0.20421859622001648
82 },
83 {
84 "metric": 0.019167248159646988,
85 "ramp_epochs": [],
86 "early_pred": 0.19904146095116934,
87 "late_pred": 0.062198137974037844,
88 "early_pde": 0.030983473853363346,
89 "late_pde": 49.05369365796008,
90 "output_var": 0.20605206489562988
91 },
92 {
93 "metric": 0.014232118614017963,
94 "ramp_epochs": [],
95 "early_pred": 0.15507098038991293,
96 "late_pred": 0.06462596554089994,
97 "early_pde": 0.01172618723164002,
98 "late_pde": 23.61071216627298,
99 "output_var": 0.171492800116539
100 },
101 {
102 "metric": 0.017978858202695847,
103 "ramp_epochs": [],
104 "early_pred": 0.19897286593914032,
105 "late_pred": 0.07070110004176111,
106 "early_pde": 0.01596340723335743,
107 "late_pde": 40.135394351508964,
108 "output_var": 0.15762735903263092
109 },
110 {
111 "metric": 0.019848095253109932,
112 "ramp_epochs": [],
113 "early_pred": 0.12244720011949539,
114 "late_pred": 0.06269879924023852,
115 "early_pde": 0.006550400673101346,
116 "late_pde": 51.49694557055174,
117 "output_var": 0.18547753989696503
118 }
119 ],
120 "mean": 0.019713770831003785,
121 "std": 0.004566942238936102
122 }
123 },
124 "idea": {
125 "config": {
126 "lr": 0.003,
127 "pde_weight": 1.0
128 },
129 "per_seed": [
130 0.10768520832061768,
131 0.07102982699871063,
132 0.07831890136003494,
133 0.08951634913682938,
134 0.08078285306692123,
135 0.07756161689758301,
136 0.10001540929079056,
137 0.08986665308475494
138 ],
139 "details": [
140 {
141 "metric": 0.10768520832061768,
142 "ramp_epochs": [
143 15,
144 15
145 ],
146 "early_pred": 0.14781861007213593,
147 "late_pred": 0.09978784752242706,
148 "early_pde": 0.005272098972151677,
149 "late_pde": 0.6819872995290686,
150 "output_var": 0.0017096633091568947
151 },
152 {
153 "metric": 0.07102982699871063,
154 "ramp_epochs": [
155 12
156 ],
157 "early_pred": 0.1365677664677302,
158 "late_pred": 0.09450832053142436,
159 "early_pde": 0.0048792896171410876,
160 "late_pde": 0.15780467033276663,
161 "output_var": 0.01197989284992218
162 },
163 {
164 "metric": 0.07831890136003494,
165 "ramp_epochs": [
166 13
167 ],
168 "early_pred": 0.11298269033432007,
169 "late_pred": 0.08290284718660747,
170 "early_pde": 0.0038497335044667125,
171 "late_pde": 0.6933216733912773,
172 "output_var": 0.006689825095236301
173 },
174 {
175 "metric": 0.08951634913682938,
176 "ramp_epochs": [
177 13
178 ],
179 "early_pred": 0.13521990676720938,
180 "late_pred": 0.08473961953731145,
181 "early_pde": 0.007382349111139774,
182 "late_pde": 2.1494412894415507,
183 "output_var": 0.004558507353067398
184 },
185 {
186 "metric": 0.08078285306692123,
187 "ramp_epochs": [
188 11
189 ],
190 "early_pred": 0.14865803718566895,
191 "late_pred": 0.09791501523817286,
192 "early_pde": 0.007154937057445447,
193 "late_pde": 0.5216962382854784,
194 "output_var": 0.011441169306635857
195 },
196 {
197 "metric": 0.07756161689758301,
198 "ramp_epochs": [
199 15,
200 19
201 ],
202 "early_pred": 0.13096309204896292,
203 "late_pred": 0.09107760997379527,
204 "early_pde": 0.003719212933598707,
205 "late_pde": 0.5973782197722945,
206 "output_var": 0.007852709852159023
207 },
208 {
209 "metric": 0.10001540929079056,
210 "ramp_epochs": [
211 14,
212 14
213 ],
214 "early_pred": 0.12350016832351685,
215 "late_pred": 0.08857208950554624,
216 "early_pde": 0.007426746034373839,
217 "late_pde": 0.808233292773366,
218 "output_var": 0.0023250302765518427
219 },
220 {
221 "metric": 0.08986665308475494,
222 "ramp_epochs": [
223 12,
224 13
225 ],
226 "early_pred": 0.11297053098678589,
227 "late_pred": 0.08425354891840149,
228 "early_pde": 0.005976979232703646,
229 "late_pde": 0.4342757718199316,
230 "output_var": 0.002663834486156702
231 }
232 ],
233 "mean": 0.0868471022695303,
234 "std": 0.011563873184926184
235 },
236 "comparison": {
237 "delta_mean": 0.06713333143852651,
238 "idea_wins": 0,
239 "n_pairs": 8,
240 "per_seed_diffs": [
241 0.07985813170671463,
242 0.05788943637162447,
243 0.05384191870689392,
244 0.06847695261240005,
245 0.061615604907274246,
246 0.06332949828356504,
247 0.08203655108809471,
248 0.07001855783164501
249 ],
250 "p_value": 0.0081,
251 "mde": 0.008368594524021243,
252 "mde_rel_pct": 42.45050120426469,
253 "verdict": "idea worse (significant)",
254 "system_worked": false
255 },
256 "mechanism_signature": {
257 "prediction": "predictive loss stabilizes before strong PDE reduction",
258 "early_predictive_loss": 0.1310851002732913,
259 "late_predictive_loss": 0.09046961230171077,
260 "early_pde_residual": 0.005707668307877611,
261 "late_pde_residual": 0.7555173069182167,
262 "confirmed": false,
263 "math_check_max_abs_laplacian": 0.0
264 },
265 "custom_track": {
266 "name": "poisson_boundary",
267 "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/poisson_boundary.py",
268 "domain": "pde"
269 }
270}