{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 24.645838737487793 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 13.62548279762268 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 8.338012218475342 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 13.600164413452148 } ], "full": { "mean": 8.617289543151855, "std": 0.739608681399212, "per_seed": [ 8.399882316589355, 7.785224437713623, 7.834766864776611, 9.332175254821777, 7.886314392089844, 8.663776397705078, 9.938685417175293, 9.097491264343262 ], "n": 8 } }, "idea": { "mean": 8.601594865322113, "std": 0.7732046694513341, "per_seed": [ 8.518109321594238, 7.764858722686768, 7.801291465759277, 9.256509780883789, 7.880615234375, 8.263826370239258, 9.904521942138672, 9.423026084899902 ], "n": 8 }, "comparison": { "delta_mean": -0.01569467782974243, "idea_wins": 6, "n_pairs": 8, "per_seed_diffs": [ 0.11822700500488281, -0.02036571502685547, -0.033475399017333984, -0.07566547393798828, -0.00569915771484375, -0.3999500274658203, -0.034163475036621094, 0.3255348205566406 ], "p_value": 0.75635, "mde": 0.1691312343107815, "mde_rel_pct": 1.9626964309814772, "verdict": "no measurable effect", "system_worked": false }, "idea_sweep": [ { "cfg": { "lr": 0.001, "lambda_k": 0.0001 }, "mean": 23.893144130706787 }, { "cfg": { "lr": 0.003, "lambda_k": 0.0001 }, "mean": 13.534956455230713 }, { "cfg": { "lr": 0.01, "lambda_k": 0.0001 }, "mean": 8.335192322731018 } ], "matched_structure": "MLP/tabular optimizer-regularizer track", "mechanism_signature": { "predicted_duplicate_fraction_mean": 0.0, "observed_duplicate_fraction_mean": 0.0, "probe_prediction_rms_mean": 15.10029935836792, "confirmed": false } }