{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.009 }, "sweep": [ { "cfg": { "lr": 0.003 }, "mean": 225.13445281982422 }, { "cfg": { "lr": 0.006 }, "mean": 214.2943878173828 }, { "cfg": { "lr": 0.009 }, "mean": 201.62980270385742 } ], "full": { "mean": 200.0606346130371, "std": 11.077029829348923, "per_seed": [ 212.36439514160156, 200.49159240722656, 205.28561401367188, 188.3776092529297, 203.29046630859375, 185.93289184570312, 187.44577026367188, 217.29673767089844 ], "n": 8 } }, "idea": { "mean": 185.36586952209473, "std": 11.095241493609498, "per_seed": [ 195.4981231689453, 187.09390258789062, 192.18927001953125, 175.18148803710938, 185.1798553466797, 171.63917541503906, 171.85842895507812, 204.28671264648438 ], "n": 8, "cfg": { "lr": 0.009 }, "runs": [ { "metric": 195.4981231689453, "switched": true, "switch_step": 23, "lr_final": 0.013499999999999998, "clip_steps": 72, "observed_log_gap_slope": -0.01804690866414924, "predicted_minus_q2": -382299857278.8767, "q_tail_mean": 604388.9543802879, "device": "cuda" }, { "metric": 187.09390258789062, "switched": true, "switch_step": 30, "lr_final": 0.013499999999999998, "clip_steps": 72, "observed_log_gap_slope": -0.009911357660239538, "predicted_minus_q2": -298791806484.8164, "q_tail_mean": 499215.2766124988, "device": "cuda" }, { "metric": 192.18927001953125, "switched": true, "switch_step": 30, "lr_final": 0.013499999999999998, "clip_steps": 72, "observed_log_gap_slope": -0.06313450122089037, "predicted_minus_q2": -307170570800.53937, "q_tail_mean": 521645.67662283836, "device": "cuda" }, { "metric": 175.18148803710938, "switched": true, "switch_step": 24, "lr_final": 0.013499999999999998, "clip_steps": 72, "observed_log_gap_slope": 0.0313864532309592, "predicted_minus_q2": -277706767948.9584, "q_tail_mean": 508872.9958189457, "device": "cuda" }, { "metric": 185.1798553466797, "switched": true, "switch_step": 25, "lr_final": 0.013499999999999998, "clip_steps": 72, "observed_log_gap_slope": -0.08906700192000473, "predicted_minus_q2": -469862343448.6883, "q_tail_mean": 618141.8733281547, "device": "cuda" }, { "metric": 171.63917541503906, "switched": true, "switch_step": 23, "lr_final": 0.013499999999999998, "clip_steps": 72, "observed_log_gap_slope": -0.07050379253268516, "predicted_minus_q2": -322708159123.9784, "q_tail_mean": 542024.741677214, "device": "cuda" }, { "metric": 171.85842895507812, "switched": true, "switch_step": 28, "lr_final": 0.013499999999999998, "clip_steps": 72, "observed_log_gap_slope": -0.05052109490887936, "predicted_minus_q2": -508205333696.0094, "q_tail_mean": 697474.1491504112, "device": "cuda" }, { "metric": 204.28671264648438, "switched": true, "switch_step": 28, "lr_final": 0.013499999999999998, "clip_steps": 72, "observed_log_gap_slope": -0.04710672958307441, "predicted_minus_q2": -307426876057.59827, "q_tail_mean": 536556.6369037025, "device": "cuda" } ], "sweep": [ { "cfg": { "lr": 0.003 }, "mean": 222.8292999267578 }, { "cfg": { "lr": 0.006 }, "mean": 206.63719177246094 }, { "cfg": { "lr": 0.009 }, "mean": 187.49069595336914 } ] }, "comparison": { "delta_mean": -14.694765090942383, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -16.86627197265625, -13.397689819335938, -13.096343994140625, -13.196121215820312, -18.110610961914062, -14.293716430664062, -15.58734130859375, -13.010025024414062 ], "p_value": 0.0081, "mde": 1.6318810404189403, "mde_rel_pct": 0.8156932239945007, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "quantity": "tail log(training loss gap) slope versus -mean(q^2), measured during trained NN runs", "observed_mean": -0.039613116657370454, "predicted_mean": -359271464354.93317, "relative_error_mean": 0.9999999999998959, "tolerance": 0.2, "confirmed": false, "switch_fraction": 1.0 }, "audit": { "baseline_lr_grid": [ 0.003, 0.006, 0.009 ], "idea_lr_grid": [ 0.003, 0.006, 0.009 ], "baseline_selected_lr": 0.009, "idea_selected_lr": 0.009, "epochs": 18, "batch": 128, "clip_norm": 1.0, "domain_rationale": "tabular is the prescribed structural track for optimizer and learning-rate schedule ideas" } }