{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "ratio": [ 100.0, 10.0, 1.0 ] }, "sweep": [ { "cfg": { "lr": 0.001, "ratio": [ 1.0, 1.0, 1.0 ] }, "mean": 128.7099723815918 }, { "cfg": { "lr": 0.001, "ratio": [ 10.0, 3.0, 1.0 ] }, "mean": 128.4849090576172 }, { "cfg": { "lr": 0.001, "ratio": [ 100.0, 10.0, 1.0 ] }, "mean": 127.46754837036133 }, { "cfg": { "lr": 0.003, "ratio": [ 1.0, 1.0, 1.0 ] }, "mean": 16.73896622657776 }, { "cfg": { "lr": 0.003, "ratio": [ 10.0, 3.0, 1.0 ] }, "mean": 16.98913860321045 }, { "cfg": { "lr": 0.003, "ratio": [ 100.0, 10.0, 1.0 ] }, "mean": 17.95883321762085 }, { "cfg": { "lr": 0.01, "ratio": [ 1.0, 1.0, 1.0 ] }, "mean": 11.914008855819702 }, { "cfg": { "lr": 0.01, "ratio": [ 10.0, 3.0, 1.0 ] }, "mean": 11.700665712356567 }, { "cfg": { "lr": 0.01, "ratio": [ 100.0, 10.0, 1.0 ] }, "mean": 10.906596660614014 } ], "full": { "mean": 11.41922926902771, "std": 1.3400197166712482, "per_seed": [ 11.151049613952637, 10.485822677612305, 10.90726375579834, 11.082250595092773, 9.644949913024902, 11.029101371765137, 12.869707107543945, 14.18368911743164 ], "n": 8 } }, "idea": { "mean": 11.052955508232117, "std": 1.160223574491651, "per_seed": [ 10.566213607788086, 10.391647338867188, 10.485791206359863, 11.461767196655273, 9.901324272155762, 9.85105037689209, 13.145121574401855, 12.620728492736816 ], "n": 8 }, "comparison": { "delta_mean": -0.36627376079559326, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.5848360061645508, -0.09417533874511719, -0.42147254943847656, 0.3795166015625, 0.2563743591308594, -1.1780509948730469, 0.27541446685791016, -1.5629606246948242 ], "p_value": 0.2116, "mde": 0.5972631267868054, "mde_rel_pct": 5.230327833129313, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "mechanism_signature": { "quantity": "parameter-gradient infinity stationarity residual at refreshes", "predicted_epsilon": 0.02, "observed_mean_residual": Infinity, "positive_margin_frequency": 0.0, "confirmed": false }, "math_check": { "predicted_weights": [ 3.0, 1.0 ], "observed_weights": [ 2.999999999, 1.000000001 ], "residual": 1.000000082740371e-09, "passed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001, "ratio": [ 1.0, 1.0, 1.0 ] }, "result": { "mean": 127.88450622558594, "std": 14.343906975103058, "per_seed": [ 142.4267578125, 132.91229248046875, 121.2231216430664, 118.38529205322266, 105.10956573486328, 127.8440170288086, 120.74082946777344, 154.43417358398438 ], "n": 8 } }, { "cfg": { "lr": 0.001, "ratio": [ 10.0, 3.0, 1.0 ] }, "result": { "mean": 127.65959358215332, "std": 14.388813821417166, "per_seed": [ 142.22030639648438, 132.71397399902344, 120.96118927001953, 118.2004623413086, 104.7640380859375, 127.63045501708984, 120.5007553100586, 154.2855682373047 ], "n": 8 } }, { "cfg": { "lr": 0.001, "ratio": [ 100.0, 10.0, 1.0 ] }, "result": { "mean": 126.63898754119873, "std": 14.61229098741295, "per_seed": [ 141.26730346679688, 131.85458374023438, 119.78008270263672, 117.36537170410156, 103.09697723388672, 126.7028579711914, 119.42959594726562, 153.61512756347656 ], "n": 8 } }, { "cfg": { "lr": 0.003, "ratio": [ 1.0, 1.0, 1.0 ] }, "result": { "mean": 17.716270089149475, "std": 2.1854981702675587, "per_seed": [ 17.7928466796875, 14.453100204467773, 20.243223190307617, 15.165732383728027, 18.23601722717285, 15.786874771118164, 19.99270248413086, 20.059663772583008 ], "n": 8 } }, { "cfg": { "lr": 0.003, "ratio": [ 10.0, 3.0, 1.0 ] }, "result": { "mean": 17.921056747436523, "std": 2.208602464634322, "per_seed": [ 18.224416732788086, 14.801833152770996, 20.551616668701172, 15.228721618652344, 18.417009353637695, 15.783102989196777, 20.219045639038086, 20.14270782470703 ], "n": 8 } }, { "cfg": { "lr": 0.003, "ratio": [ 100.0, 10.0, 1.0 ] }, "result": { "mean": 18.67002558708191, "std": 2.200020788096735, "per_seed": [ 19.961009979248047, 16.091012954711914, 21.057720184326172, 15.669567108154297, 18.654521942138672, 16.20878791809082, 21.031444549560547, 20.686140060424805 ], "n": 8 } }, { "cfg": { "lr": 0.01, "ratio": [ 1.0, 1.0, 1.0 ] }, "result": { "mean": 11.539970397949219, "std": 1.112516442321061, "per_seed": [ 10.973492622375488, 9.973017692565918, 10.890155792236328, 11.609981536865234, 10.801332473754883, 11.49035358428955, 13.19100284576416, 13.390426635742188 ], "n": 8 } }, { "cfg": { "lr": 0.01, "ratio": [ 10.0, 3.0, 1.0 ] }, "result": { "mean": 11.519728541374207, "std": 0.9986832975547216, "per_seed": [ 10.72226333618164, 10.168411254882812, 11.434860229492188, 11.341761589050293, 11.246848106384277, 11.001540184020996, 13.17798900604248, 13.064154624938965 ], "n": 8 } }, { "cfg": { "lr": 0.01, "ratio": [ 100.0, 10.0, 1.0 ] }, "result": { "mean": 11.052955508232117, "std": 1.160223574491651, "per_seed": [ 10.566213607788086, 10.391647338867188, 10.485791206359863, 11.461767196655273, 9.901324272155762, 9.85105037689209, 13.145121574401855, 12.620728492736816 ], "n": 8 } } ], "protocol_notes": "Matched tabular Friedman regression and mlp_tiny; baseline and controller share all lr and ratio configurations, Adam, epochs, batch, and data seeds." } }