{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "wd": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "wd": 0.0 }, "mean": 9.14509105682373 }, { "cfg": { "lr": 0.001, "wd": 0.0001 }, "mean": 9.145180225372314 }, { "cfg": { "lr": 0.003, "wd": 0.0 }, "mean": 6.927029252052307 }, { "cfg": { "lr": 0.003, "wd": 0.0001 }, "mean": 6.927072286605835 }, { "cfg": { "lr": 0.006, "wd": 0.0 }, "mean": 6.792275428771973 }, { "cfg": { "lr": 0.006, "wd": 0.0001 }, "mean": 6.792290449142456 } ], "full": { "mean": 7.667590081691742, "std": 1.7205125356211413, "per_seed": [ 6.4639973640441895, 6.4978742599487305, 7.33742094039917, 6.869809150695801, 7.3997697830200195, 7.772507190704346, 6.91866397857666, 12.08067798614502 ], "n": 8 } }, "idea": { "mean": 23.958279371261597, "std": 3.6945581466806723, "per_seed": [ 21.538589477539062, 17.00618553161621, 25.721471786499023, 23.093345642089844, 27.321157455444336, 26.617502212524414, 29.042064666748047, 21.325918197631836 ], "n": 8, "selected_cfg": { "lr": 0.003, "gain_eta": 0.08, "rho": 0.15 } }, "comparison": { "delta_mean": 16.290689289569855, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 15.074592113494873, 10.50831127166748, 18.384050846099854, 16.223536491394043, 19.921387672424316, 18.84499502182007, 22.123400688171387, 9.245240211486816 ], "p_value": 0.0081, "mde": 3.7748401575264636, "mde_rel_pct": 49.2311158696371, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "trained_model_signature": { "final_gains": [ 0.008204753574549313, 0.007716603211568231, 0.03 ], "clip_frequency": 1.0234375, "gradient_reversal_frequency": 1.1484375, "history": [ 30.83193588256836, 12.97095012664795, 19.285388946533203, 27.07645034790039, 22.369277954101562, 35.104671478271484, 20.543949127197266, 27.519351959228516 ], "predicted_delta_mean": 0.27506878502578563, "observed_delta_mean": 4.82632114851212e-05, "predicted_delta_slope": -7.362199623823305e-05, "observed_delta_slope": -7.362199623823305e-05, "n_updates": 765, "confirmed": false, "math_prediction": "gain change approximately eta*dot/(1+rho), measured on trained tabular MLP", "math_check": { "prediction": "delta_gain=eta*r*g^2/(1+rho) at gain=reference", "predicted_slope": 0.08450000000000002, "observed_slope": 0.08450000000000005, "max_abs_error": 1.1102230246251565e-16, "pass": true }, "idea_cfg": { "lr": 0.003, "gain_eta": 0.08, "rho": 0.15 } }, "idea_grid": [ { "cfg": { "lr": 0.006, "gain_eta": 0.08, "rho": 0.15 }, "mean": 34.99524688720703 }, { "cfg": { "lr": 0.003, "gain_eta": 0.08, "rho": 0.15 }, "mean": 23.958279371261597 }, { "cfg": { "lr": 0.006, "gain_eta": 0.08, "rho": 0.15 }, "mean": 34.99524688720703 } ] }, "math_check": { "prediction": "delta_gain=eta*r*g^2/(1+rho) at gain=reference", "predicted_slope": 0.08450000000000002, "observed_slope": 0.08450000000000005, "max_abs_error": 1.1102230246251565e-16, "pass": true } }