{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.002, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 140.17193984985352 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 140.17272758483887 }, { "cfg": { "lr": 0.002, "weight_decay": 0.0 }, "mean": 46.896180152893066 }, { "cfg": { "lr": 0.002, "weight_decay": 0.0001 }, "mean": 46.89336395263672 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 425.859375 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 425.85955810546875 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 150.0003662109375 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001 }, "mean": 150.00535202026367 } ], "full": { "mean": 53.96195363998413, "std": 40.99246488816214, "per_seed": [ 30.952533721923828, 22.93033218383789, 83.2318344116211, 50.45875549316406, 149.6821746826172, 21.348867416381836, 47.70417022705078, 25.386960983276367 ], "n": 8 } }, "idea": { "mean": 45.54406785964966, "std": 8.338173492397852, "per_seed": [ 43.00838851928711, 44.718257904052734, 28.018310546875, 49.26393508911133, 56.6592903137207, 41.586570739746094, 54.953060150146484, 46.14472961425781 ], "n": 8, "selected_cfg": { "lr": 0.002, "weight_decay": 0.0001 } }, "comparison": { "delta_mean": -8.417885780334473, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 12.055854797363281, 21.787925720214844, -55.213523864746094, -1.1948204040527344, -93.02288436889648, 20.237703323364258, 7.248889923095703, 20.757768630981445 ], "p_value": 0.60105, "mde": 35.54445282513561, "mde_rel_pct": 65.86946992741618, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "math_check": { "bound_max_ratio": 0.827890485216382, "bound": 1.0, "contraction_predicted": [ 0.9619047619047619, 0.8666666666666667, 0.6, 0.36 ], "contraction_measured": [ 0.9619047619047619, 0.8666666666666666, 0.5999999999999999, 0.35999999999999976 ], "max_contraction_error": 2.220446049250313e-16 }, "trained_model_signature": { "mean_observed_diag_gramian": 0.2610868251649663, "mean_update_factor_predicted": 0.8549541880687078, "mean_update_factor_observed": 0.8544371028741201, "relative_factor_error": 0.0006048104118371221, "confirmed": true }, "idea_configs": [ { "cfg": { "lr": 0.002, "weight_decay": 0.0001 }, "result": { "mean": 45.54406785964966, "std": 8.338173492397852, "per_seed": [ 43.00838851928711, 44.718257904052734, 28.018310546875, 49.26393508911133, 56.6592903137207, 41.586570739746094, 54.953060150146484, 46.14472961425781 ], "n": 8, "selected_cfg": { "lr": 0.002, "weight_decay": 0.0001 } } }, { "cfg": { "lr": 0.002, "weight_decay": 0.0001 }, "result": { "mean": 45.54406785964966, "std": 8.338173492397852, "per_seed": [ 43.00838851928711, 44.718257904052734, 28.018310546875, 49.26393508911133, 56.6592903137207, 41.586570739746094, 54.953060150146484, 46.14472961425781 ], "n": 8 } }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001 }, "result": { "mean": 53.81347846984863, "std": 9.649444093972434, "per_seed": [ 54.86537170410156, 67.9201431274414, 36.08623123168945, 58.39324188232422, 65.55195617675781, 47.311336517333984, 51.460205078125, 48.919342041015625 ], "n": 8 } } ] }, "protocol_notes": "Optimizer modification on structurally matched Friedman tabular regression; paired seeds 0-7, batch 128, 12 epochs, same architecture and lr/weight-decay union." }