{ "bench_version": 1, "track": "poisson_boundary", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.046625981107354164 }, { "cfg": { "lr": 0.003 }, "mean": 0.005821306491270661 }, { "cfg": { "lr": 0.01 }, "mean": 0.0026237370329909027 } ], "full": { "mean": 0.0022902884520590305, "std": 0.0008475947478694112, "per_seed": [ 0.002140381373465061, 0.0017085936851799488, 0.0028188657015562057, 0.003827107371762395, 0.0007765397895127535, 0.0018183346837759018, 0.002519753761589527, 0.002712731249630451 ], "n": 8 } }, "idea": { "mean": 0.01020078727742657, "std": 0.00296426428649209, "per_seed": [ 0.009175088256597519, 0.007033985573798418, 0.006878904066979885, 0.015077905729413033, 0.014966735616326332, 0.009611713699996471, 0.009160290472209454, 0.009701674804091454 ], "n": 8 }, "comparison": { "delta_mean": 0.00791049882536754, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.007034706883132458, 0.005325391888618469, 0.004060038365423679, 0.011250798357650638, 0.014190195826813579, 0.00779337901622057, 0.0066405367106199265, 0.006988943554461002 ], "p_value": 0.0081, "mde": 0.0027432218817820646, "mde_rel_pct": 119.77626134017463, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "idea_config": { "lr": 0.003 }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 0.052139872685074806, "std": 0.010604419760995165, "per_seed": [ 0.055915020406246185, 0.04067733511328697, 0.048677653074264526, 0.06918065994977951, 0.03635910525918007, 0.0652485340833664, 0.05410538986325264, 0.04695528373122215 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 0.01020078727742657, "std": 0.00296426428649209, "per_seed": [ 0.009175088256597519, 0.007033985573798418, 0.006878904066979885, 0.015077905729413033, 0.014966735616326332, 0.009611713699996471, 0.009160290472209454, 0.009701674804091454 ], "n": 8 } }, { "cfg": { "lr": 0.01 }, "result": { "mean": 0.011461915099062026, "std": 0.0024442795764689383, "per_seed": [ 0.009399672970175743, 0.0106451865285635, 0.009206349961459637, 0.012322325259447098, 0.01035053189843893, 0.011077546514570713, 0.011263057589530945, 0.01743065007030964 ], "n": 8 } } ], "math_check": { "sphere_second_moment_increment": 0.1600427977741897, "predicted_increment": 0.16000000000000003, "relative_increment_error": 0.00026748608868542434, "variance_scaling": [ { "K": 1, "variance": 0.4991379976272583, "K_times_variance": 0.4991379976272583 }, { "K": 2, "variance": 0.24831385910511017, "K_times_variance": 0.49662771821022034 }, { "K": 4, "variance": 0.12296506762504578, "K_times_variance": 0.4918602705001831 }, { "K": 8, "variance": 0.060902342200279236, "K_times_variance": 0.4872187376022339 }, { "K": 16, "variance": 0.03029288910329342, "K_times_variance": 0.4846862256526947 }, { "K": 32, "variance": 0.014903044328093529, "K_times_variance": 0.4768974184989929 }, { "K": 64, "variance": 0.007048895116895437, "K_times_variance": 0.451129287481308 }, { "K": 128, "variance": 0.0035142002161592245, "K_times_variance": 0.44981762766838074 } ], "K_product_cv": 0.03766105478867267, "confirmed": true }, "mechanism_signature": { "prediction": "WOS stochastic supervision does not create a systematic output mean shift", "predicted_shift": 0.0, "observed_shift_mean": -0.013755707695963793, "observed_shift_abs_mean": 0.028182248890516348, "trained_systems": [ { "seed": 0, "baseline_mse": 0.005913021042943001, "idea_mse": 0.009175088256597519, "trained_prediction_mean_shift_idea_minus_baseline": 0.00194565171841532 }, { "seed": 1, "baseline_mse": 0.003503378015011549, "idea_mse": 0.007033985573798418, "trained_prediction_mean_shift_idea_minus_baseline": -0.02376757189631462 }, { "seed": 2, "baseline_mse": 0.003274704795330763, "idea_mse": 0.006878904066979885, "trained_prediction_mean_shift_idea_minus_baseline": 0.0016674669459462166 }, { "seed": 3, "baseline_mse": 0.010594122111797333, "idea_mse": 0.015077905729413033, "trained_prediction_mean_shift_idea_minus_baseline": 0.023475755006074905 }, { "seed": 4, "baseline_mse": 0.0036502110306173563, "idea_mse": 0.014966735616326332, "trained_prediction_mean_shift_idea_minus_baseline": -0.0916648656129837 }, { "seed": 5, "baseline_mse": 0.004745990503579378, "idea_mse": 0.009611713699996471, "trained_prediction_mean_shift_idea_minus_baseline": 0.023652706295251846 }, { "seed": 6, "baseline_mse": 0.006178014911711216, "idea_mse": 0.009160290472209454, "trained_prediction_mean_shift_idea_minus_baseline": 0.0069645848125219345 }, { "seed": 7, "baseline_mse": 0.0056354450061917305, "idea_mse": 0.009701674804091454, "trained_prediction_mean_shift_idea_minus_baseline": -0.05231938883662224 } ], "confirmed": false }, "custom_track": { "name": "poisson_boundary", "file": "bench/custom_tracks/poisson_boundary.py", "domain": "pde" }, "structural_match": "PDE Dirichlet boundary-value regression on the unit disk; WOS is the intervention." } }