{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 25.60164165496826 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 13.860755920410156 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 10.442761182785034 } ], "full": { "mean": 10.930935978889465, "std": 1.3983305692789296, "per_seed": [ 10.067484855651855, 12.066851615905762, 9.622394561767578, 10.014313697814941, 8.787652015686035, 11.810267448425293, 12.032318115234375, 13.046205520629883 ], "n": 8 } }, "idea": { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 10.922250509262085, "std": 1.396535179145413, "per_seed": [ 10.052755355834961, 12.058212280273438, 9.612079620361328, 10.001825332641602, 8.791247367858887, 11.804107666015625, 12.02346420288086, 13.03431224822998 ], "n": 8, "behavior_all_seeds": [ { "raw_spike": 97, "clipped_entries": 462, "entries": 354888, "tail_sum": 0.4687500017462298, "k_sum": 4870.490382072394, "tau_sum": 3035.111967606231, "steps": 72, "mean_tail_above_tau": 0.0010850694484866431, "mean_kurtosis_bound": 11.274283291834244, "mean_tau": 7.025722147236645, "clip_fraction": 0.0013018191654831947 }, { "raw_spike": 102, "clipped_entries": 623, "entries": 354888, "tail_sum": 0.6460449252044782, "k_sum": 4870.597906613239, "tau_sum": 3113.7841693589585, "steps": 72, "mean_tail_above_tau": 0.001495474363899255, "mean_kurtosis_bound": 11.274532191234348, "mean_tau": 7.207833725367959, "clip_fraction": 0.0017554834201212778 }, { "raw_spike": 90, "clipped_entries": 539, "entries": 354888, "tail_sum": 0.4866699246922508, "k_sum": 5089.335932393671, "tau_sum": 2659.756519132028, "steps": 72, "mean_tail_above_tau": 0.0011265507516024325, "mean_kurtosis_bound": 11.78087021387424, "mean_tau": 6.156843794287102, "clip_fraction": 0.0015187890263970605 }, { "raw_spike": 100, "clipped_entries": 822, "entries": 354888, "tail_sum": 0.7038574230391532, "k_sum": 4833.979456970323, "tau_sum": 2974.376847470511, "steps": 72, "mean_tail_above_tau": 0.0016292995903684103, "mean_kurtosis_bound": 11.189767261505377, "mean_tau": 6.885131591366924, "clip_fraction": 0.0023162237100155542 }, { "raw_spike": 81, "clipped_entries": 358, "entries": 354888, "tail_sum": 0.29570312541909516, "k_sum": 5140.149971492376, "tau_sum": 3046.6057521423736, "steps": 72, "mean_tail_above_tau": 0.0006844979755071647, "mean_kurtosis_bound": 11.8984953043805, "mean_tau": 7.052328129959198, "clip_fraction": 0.001008768963729402 }, { "raw_spike": 106, "clipped_entries": 853, "entries": 354888, "tail_sum": 0.7641601584618911, "k_sum": 5438.268085443231, "tau_sum": 3097.6346601389573, "steps": 72, "mean_tail_above_tau": 0.001768889255698822, "mean_kurtosis_bound": 12.58858353111859, "mean_tau": 7.170450602173513, "clip_fraction": 0.0024035752124613964 }, { "raw_spike": 94, "clipped_entries": 469, "entries": 354888, "tail_sum": 0.5587890637107193, "k_sum": 5913.583425274048, "tau_sum": 3219.2745450983753, "steps": 72, "mean_tail_above_tau": 0.0012934932030340726, "mean_kurtosis_bound": 13.688850521467703, "mean_tau": 7.452024409949943, "clip_fraction": 0.0013215436982935461 }, { "raw_spike": 97, "clipped_entries": 813, "entries": 354888, "tail_sum": 0.8062500024680048, "k_sum": 5628.396702211232, "tau_sum": 3650.706699383914, "steps": 72, "mean_tail_above_tau": 0.0018663194501574185, "mean_kurtosis_bound": 13.028696069933407, "mean_tau": 8.45070995227758, "clip_fraction": 0.002290863596402245 } ] }, "comparison": { "delta_mean": -0.008685469627380371, "idea_wins": 7, "n_pairs": 8, "per_seed_diffs": [ -0.014729499816894531, -0.008639335632324219, -0.01031494140625, -0.012488365173339844, 0.0035953521728515625, -0.006159782409667969, -0.008853912353515625, -0.011893272399902344 ], "p_value": 0.01475, "mde": 0.004699979815996483, "mde_rel_pct": 0.04299704824063914, "verdict": "idea better (significant)", "system_worked": true }, "math_check": { "max_inverse_error": 8.881784197001252e-16, "max_transition_polynomial_error": 1.4210854715202004e-14, "min_projected_tail_margin": 0.0, "passed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 25.558531761169434 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 13.852189540863037 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 10.431218147277832 } ], "protocol_note": "8 paired seeds; baseline sweep and idea sweep share the full learning-rate union; Adam and architecture are otherwise identical.", "mechanism_signature": { "prediction": "trained gradient-coordinate tail above calibrated tau is controlled near target delta=.02", "target_delta": 0.02, "observed_mean_tail_above_tau": 0.0013686992548442773, "mean_clip_fraction": 0.0017396333491129594, "mean_kurtosis_bound": 12.09050979816855, "confirmed": true } }