Wavelet Conditional Sampler for Neural EBMs / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "multiscale_diffusion_pde",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "weight_decay": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "weight_decay": 0.0
 17        },
 18        "mean": 0.03494249051436782
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "weight_decay": 0.0
 24        },
 25        "mean": 0.0028896931326016784
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.01,
 30          "weight_decay": 0.0
 31        },
 32        "mean": 0.0006090530368965119
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.0006244597789191175,
 37      "std": 0.00013816121674020655,
 38      "per_seed": [
 39        0.0005983817973174155,
 40        0.0007256286917254329,
 41        0.0006302266265265644,
 42        0.00048197503201663494,
 43        0.0006429867353290319,
 44        0.00040344681474380195,
 45        0.000893245916813612,
 46        0.0006197866168804467
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 0.0588950552046299,
 53    "std": 0.007581433628093914,
 54    "per_seed": [
 55      0.048095669597387314,
 56      0.06269505620002747,
 57      0.060969557613134384,
 58      0.0601036362349987,
 59      0.04443567618727684,
 60      0.06491053104400635,
 61      0.06635342538356781,
 62      0.06359688937664032
 63    ],
 64    "n": 8,
 65    "best_cfg": {
 66      "lr": 0.01,
 67      "weight_decay": 0.0,
 68      "detail_weight": 2.0
 69    }
 70  },
 71  "comparison": {
 72    "delta_mean": 0.05827059542571078,
 73    "idea_wins": 0,
 74    "n_pairs": 8,
 75    "per_seed_diffs": [
 76      0.0474972878000699,
 77      0.06196942750830203,
 78      0.06033933098660782,
 79      0.05962166120298207,
 80      0.04379268945194781,
 81      0.06450708422926255,
 82      0.0654601794667542,
 83      0.06297710275975987
 84    ],
 85    "p_value": 0.0081,
 86    "mde": 0.006764917669931772,
 87    "mde_rel_pct": 1083.3232016385784,
 88    "verdict": "idea worse (significant)",
 89    "system_worked": false
 90  },
 91  "mechanism_signature": {
 92    "idea_hyperparameter_sweep": [
 93      {
 94        "cfg": {
 95          "lr": 0.001,
 96          "weight_decay": 0.0,
 97          "detail_weight": 0.5
 98        },
 99        "mean": 0.46720340102910995
100      },
101      {
102        "cfg": {
103          "lr": 0.003,
104          "weight_decay": 0.0,
105          "detail_weight": 1.0
106        },
107        "mean": 0.1648601070046425
108      },
109      {
110        "cfg": {
111          "lr": 0.01,
112          "weight_decay": 0.0,
113          "detail_weight": 2.0
114        },
115        "mean": 0.05796597991138697
116      }
117    ],
118    "mechanism_signature": {
119      "claim": "multiscale objective reduces fine/detail residuals at NN scale",
120      "predicted": "detail residual is not worse than pixel residual",
121      "observed": [
122        {
123          "seed": 0,
124          "pixel_mse": 0.8897097706794739,
125          "detail_mse": 2.22203861673673
126        },
127        {
128          "seed": 1,
129          "pixel_mse": 0.8830438256263733,
130          "detail_mse": 1.9818376793215673
131        },
132        {
133          "seed": 2,
134          "pixel_mse": 0.8910840749740601,
135          "detail_mse": 2.0421754527837037
136        },
137        {
138          "seed": 3,
139          "pixel_mse": 0.8894067406654358,
140          "detail_mse": 1.9052459951490164
141        }
142      ],
143      "mean_detail_to_pixel_ratio": 2.2939384522012953,
144      "confirmed": false
145    },
146    "custom_track": {
147      "name": "multiscale_diffusion_pde",
148      "file": "bench/custom_tracks/multiscale_diffusion_pde.py",
149      "domain": "pde"
150    },
151    "protocol_note": "Baseline and idea use the same mlp_tiny architecture, dataset, epochs, batch size, and lr union; primary metric is held-out raw field MSE."
152  }
153}