{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 17.2008535861969 }, { "cfg": { "lr": 0.003 }, "mean": 17.275779485702515 }, { "cfg": { "lr": 0.01 }, "mean": 18.10535430908203 } ], "full": { "mean": 17.477807760238647, "std": 1.5610336422417328, "per_seed": [ 18.36859893798828, 17.082815170288086, 17.65996551513672, 15.692034721374512, 14.8045015335083, 18.059467315673828, 17.911405563354492, 20.24367332458496 ], "n": 8 } }, "idea": { "mean": 22.206230878829956, "std": 1.2034773425543663, "per_seed": [ 22.064266204833984, 22.58884048461914, 20.288148880004883, 21.367250442504883, 21.962797164916992, 21.877431869506836, 22.725826263427734, 24.775285720825195 ], "n": 8, "selected_cfg": { "lr": 0.01 } }, "comparison": { "delta_mean": 4.728423118591309, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 3.695667266845703, 5.506025314331055, 2.628183364868164, 5.675215721130371, 7.158295631408691, 3.817964553833008, 4.814420700073242, 4.531612396240234 ], "p_value": 0.0081, "mde": 1.172236051535733, "mde_rel_pct": 6.70699705372962, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "mechanism_signature": { "prediction": "factorized Cholesky-preconditioned outer product equals matrix update", "per_seed": [ { "factorization_abs_err": 0.0021419525146484375, "factorization_rel_err": 1.424667971150484e-05, "raw_update_norm": 99.73847961425781, "conditioned_update_norm": 471.4458923339844, "predicted_norm_ratio": 4.726820468902588, "trained_activation_trace": 3.3609566688537598, "trained_error_trace": 22.064266204833984, "confirmed": false }, { "factorization_abs_err": 0.0013217926025390625, "factorization_rel_err": 9.378113645652775e-06, "raw_update_norm": 119.99061584472656, "conditioned_update_norm": 431.77825927734375, "predicted_norm_ratio": 3.598433494567871, "trained_activation_trace": 3.3852806091308594, "trained_error_trace": 22.588836669921875, "confirmed": true }, { "factorization_abs_err": 0.0012187957763671875, "factorization_rel_err": 7.294798706425354e-06, "raw_update_norm": 106.99031829833984, "conditioned_update_norm": 435.8670654296875, "predicted_norm_ratio": 4.073892593383789, "trained_activation_trace": 3.3690006732940674, "trained_error_trace": 20.288150787353516, "confirmed": true }, { "factorization_abs_err": 0.0012369155883789062, "factorization_rel_err": 8.22768470243318e-06, "raw_update_norm": 88.57902526855469, "conditioned_update_norm": 449.8793640136719, "predicted_norm_ratio": 5.078847408294678, "trained_activation_trace": 3.282832145690918, "trained_error_trace": 21.367252349853516, "confirmed": true }, { "factorization_abs_err": 0.0022106170654296875, "factorization_rel_err": 1.4202377315086778e-05, "raw_update_norm": 126.09120178222656, "conditioned_update_norm": 424.4380798339844, "predicted_norm_ratio": 3.366119623184204, "trained_activation_trace": 3.368903636932373, "trained_error_trace": 21.96279525756836, "confirmed": false }, { "factorization_abs_err": 0.001743316650390625, "factorization_rel_err": 9.334406058769673e-06, "raw_update_norm": 113.74923706054688, "conditioned_update_norm": 444.450927734375, "predicted_norm_ratio": 3.907287120819092, "trained_activation_trace": 3.3790221214294434, "trained_error_trace": 21.877431869506836, "confirmed": true }, { "factorization_abs_err": 0.002315521240234375, "factorization_rel_err": 1.217806766362628e-05, "raw_update_norm": 90.95088195800781, "conditioned_update_norm": 474.05853271484375, "predicted_norm_ratio": 5.212247848510742, "trained_activation_trace": 3.336045265197754, "trained_error_trace": 22.7258243560791, "confirmed": false }, { "factorization_abs_err": 0.0021305084228515625, "factorization_rel_err": 1.0202298653894104e-05, "raw_update_norm": 137.70616149902344, "conditioned_update_norm": 439.57916259765625, "predicted_norm_ratio": 3.192153215408325, "trained_activation_trace": 3.364262580871582, "trained_error_trace": 24.775285720825195, "confirmed": false } ], "confirmed": false, "mean_observed_norm_ratio": 4.144475221633911 }, "track_rationale": "Two-sided conditioning is an optimizer/update-rule idea; tabular is the prescribed optimizer track.", "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 200.41951751708984 }, { "cfg": { "lr": 0.003 }, "mean": 104.71292400360107 }, { "cfg": { "lr": 0.01 }, "mean": 22.206230878829956 } ], "selected_idea_cfg": { "lr": 0.01 }, "elapsed_sec": 17.28634238243103 } }