Wavelet Conditional Sampler for Neural EBMs / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "multiscale_diffusion_pde",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01,
10 "weight_decay": 0.0
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "weight_decay": 0.0
17 },
18 "mean": 0.03494249051436782
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "weight_decay": 0.0
24 },
25 "mean": 0.0028896931326016784
26 },
27 {
28 "cfg": {
29 "lr": 0.01,
30 "weight_decay": 0.0
31 },
32 "mean": 0.0006090530368965119
33 }
34 ],
35 "full": {
36 "mean": 0.0006244597789191175,
37 "std": 0.00013816121674020655,
38 "per_seed": [
39 0.0005983817973174155,
40 0.0007256286917254329,
41 0.0006302266265265644,
42 0.00048197503201663494,
43 0.0006429867353290319,
44 0.00040344681474380195,
45 0.000893245916813612,
46 0.0006197866168804467
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 0.0588950552046299,
53 "std": 0.007581433628093914,
54 "per_seed": [
55 0.048095669597387314,
56 0.06269505620002747,
57 0.060969557613134384,
58 0.0601036362349987,
59 0.04443567618727684,
60 0.06491053104400635,
61 0.06635342538356781,
62 0.06359688937664032
63 ],
64 "n": 8,
65 "best_cfg": {
66 "lr": 0.01,
67 "weight_decay": 0.0,
68 "detail_weight": 2.0
69 }
70 },
71 "comparison": {
72 "delta_mean": 0.05827059542571078,
73 "idea_wins": 0,
74 "n_pairs": 8,
75 "per_seed_diffs": [
76 0.0474972878000699,
77 0.06196942750830203,
78 0.06033933098660782,
79 0.05962166120298207,
80 0.04379268945194781,
81 0.06450708422926255,
82 0.0654601794667542,
83 0.06297710275975987
84 ],
85 "p_value": 0.0081,
86 "mde": 0.006764917669931772,
87 "mde_rel_pct": 1083.3232016385784,
88 "verdict": "idea worse (significant)",
89 "system_worked": false
90 },
91 "mechanism_signature": {
92 "idea_hyperparameter_sweep": [
93 {
94 "cfg": {
95 "lr": 0.001,
96 "weight_decay": 0.0,
97 "detail_weight": 0.5
98 },
99 "mean": 0.46720340102910995
100 },
101 {
102 "cfg": {
103 "lr": 0.003,
104 "weight_decay": 0.0,
105 "detail_weight": 1.0
106 },
107 "mean": 0.1648601070046425
108 },
109 {
110 "cfg": {
111 "lr": 0.01,
112 "weight_decay": 0.0,
113 "detail_weight": 2.0
114 },
115 "mean": 0.05796597991138697
116 }
117 ],
118 "mechanism_signature": {
119 "claim": "multiscale objective reduces fine/detail residuals at NN scale",
120 "predicted": "detail residual is not worse than pixel residual",
121 "observed": [
122 {
123 "seed": 0,
124 "pixel_mse": 0.8897097706794739,
125 "detail_mse": 2.22203861673673
126 },
127 {
128 "seed": 1,
129 "pixel_mse": 0.8830438256263733,
130 "detail_mse": 1.9818376793215673
131 },
132 {
133 "seed": 2,
134 "pixel_mse": 0.8910840749740601,
135 "detail_mse": 2.0421754527837037
136 },
137 {
138 "seed": 3,
139 "pixel_mse": 0.8894067406654358,
140 "detail_mse": 1.9052459951490164
141 }
142 ],
143 "mean_detail_to_pixel_ratio": 2.2939384522012953,
144 "confirmed": false
145 },
146 "custom_track": {
147 "name": "multiscale_diffusion_pde",
148 "file": "bench/custom_tracks/multiscale_diffusion_pde.py",
149 "domain": "pde"
150 },
151 "protocol_note": "Baseline and idea use the same mlp_tiny architecture, dataset, epochs, batch size, and lr union; primary metric is held-out raw field MSE."
152 }
153}