{ "bench_version": 1, "track": "tabular", "model": "candidate_mlp_shared", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 119.02437210083008 }, { "cfg": { "lr": 0.003 }, "mean": 30.62220811843872 }, { "cfg": { "lr": 0.01 }, "mean": 21.151901245117188 } ], "full": { "mean": 21.90489387512207, "std": 1.9880925147812747, "per_seed": [ 23.918453216552734, 18.010822296142578, 22.42278480529785, 20.255544662475586, 22.012264251708984, 22.661293029785156, 21.173133850097656, 24.784854888916016 ], "n": 8 } }, "idea": { "mean": 21.988378763198853, "std": 1.863640983270208, "per_seed": [ 23.71569061279297, 18.270889282226562, 22.492475509643555, 20.57891082763672, 22.177988052368164, 22.6539249420166, 21.250635147094727, 24.766515731811523 ], "n": 8 }, "comparison": { "delta_mean": 0.08348488807678223, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ -0.20276260375976562, 0.2600669860839844, 0.06969070434570312, 0.3233661651611328, 0.1657238006591797, -0.0073680877685546875, 0.07750129699707031, -0.018339157104492188 ], "p_value": 0.18505, "mde": 0.14001291226171048, "mde_rel_pct": 0.639185531141635, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "predicted_projected_gain_mean": 26.90758864581585, "observed_heldout_selected_response_mse_mean": 65.35227632522583, "predicted_per_seed": [ 21.2170729637146, 7.129383563995361, 23.922744750976562, 49.054978370666504, 8.374441027641296, 25.982917308807373, 46.1535587310791, 33.425612449645996 ], "observed_per_seed": [ 64.23245239257812, 69.09458923339844, 59.128604888916016, 57.94867706298828, 67.77635955810547, 68.72184753417969, 67.34278106689453, 68.5728988647461 ], "correlation": -0.415484140116091, "confirmed": false }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 117.0982551574707, "std": 6.973504377883443, "per_seed": [ 121.33436584472656, 115.73588562011719, 113.34111785888672, 109.39837646484375, 118.32662963867188, 115.21646118164062, 110.5782699584961, 132.8549346923828 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 31.2304470539093, "std": 3.2026968213759157, "per_seed": [ 33.56842803955078, 26.45305633544922, 31.497737884521484, 29.350759506225586, 30.496389389038086, 29.599700927734375, 30.8070011138916, 38.07050323486328 ], "n": 8 } }, { "cfg": { "lr": 0.01 }, "result": { "mean": 21.988378763198853, "std": 1.863640983270208, "per_seed": [ 23.71569061279297, 18.270889282226562, 22.492475509643555, 20.57891082763672, 22.177988052368164, 22.6539249420166, 21.250635147094727, 24.766515731811523 ], "n": 8 } } ], "selection": { "candidates": 8, "active_blocks": 3, "epochs": 18, "n_train": 400, "n_test": 200, "track_rationale": "tabular regression is the built-in optimizer/regularizer/architecture-compatible small MLP track; no PDE/control structure is required by this adapter-bank idea" } }