{ "bench_version": 1, "track": "multiscale_diffusion_pde", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.03494249051436782 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.0028896931326016784 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 0.0006090530368965119 } ], "full": { "mean": 0.0006244597789191175, "std": 0.00013816121674020655, "per_seed": [ 0.0005983817973174155, 0.0007256286917254329, 0.0006302266265265644, 0.00048197503201663494, 0.0006429867353290319, 0.00040344681474380195, 0.000893245916813612, 0.0006197866168804467 ], "n": 8 } }, "idea": { "mean": 0.0588950552046299, "std": 0.007581433628093914, "per_seed": [ 0.048095669597387314, 0.06269505620002747, 0.060969557613134384, 0.0601036362349987, 0.04443567618727684, 0.06491053104400635, 0.06635342538356781, 0.06359688937664032 ], "n": 8, "best_cfg": { "lr": 0.01, "weight_decay": 0.0, "detail_weight": 2.0 } }, "comparison": { "delta_mean": 0.05827059542571078, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0474972878000699, 0.06196942750830203, 0.06033933098660782, 0.05962166120298207, 0.04379268945194781, 0.06450708422926255, 0.0654601794667542, 0.06297710275975987 ], "p_value": 0.0081, "mde": 0.006764917669931772, "mde_rel_pct": 1083.3232016385784, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "idea_hyperparameter_sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0, "detail_weight": 0.5 }, "mean": 0.46720340102910995 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "detail_weight": 1.0 }, "mean": 0.1648601070046425 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0, "detail_weight": 2.0 }, "mean": 0.05796597991138697 } ], "mechanism_signature": { "claim": "multiscale objective reduces fine/detail residuals at NN scale", "predicted": "detail residual is not worse than pixel residual", "observed": [ { "seed": 0, "pixel_mse": 0.8897097706794739, "detail_mse": 2.22203861673673 }, { "seed": 1, "pixel_mse": 0.8830438256263733, "detail_mse": 1.9818376793215673 }, { "seed": 2, "pixel_mse": 0.8910840749740601, "detail_mse": 2.0421754527837037 }, { "seed": 3, "pixel_mse": 0.8894067406654358, "detail_mse": 1.9052459951490164 } ], "mean_detail_to_pixel_ratio": 2.2939384522012953, "confirmed": false }, "custom_track": { "name": "multiscale_diffusion_pde", "file": "bench/custom_tracks/multiscale_diffusion_pde.py", "domain": "pde" }, "protocol_note": "Baseline and idea use the same mlp_tiny architecture, dataset, epochs, batch size, and lr union; primary metric is held-out raw field MSE." } }