{ "bench_version": 1, "track": "budgeted_route_costs", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "wd": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "wd": 0.0 }, "mean": 0.024585966020822525 }, { "cfg": { "lr": 0.001, "wd": 0.0001 }, "mean": 0.02389408415183425 }, { "cfg": { "lr": 0.003, "wd": 0.0 }, "mean": 0.004350764560513198 }, { "cfg": { "lr": 0.003, "wd": 0.0001 }, "mean": 0.004227392724715173 }, { "cfg": { "lr": 0.01, "wd": 0.0 }, "mean": 0.002535940962843597 }, { "cfg": { "lr": 0.01, "wd": 0.0001 }, "mean": 0.0022327409242279828 } ], "full": { "mean": 0.0023824743693694472, "std": 0.0003298540492088312, "per_seed": [ 0.002391217043623328, 0.0022307508625090122, 0.0022920493502169847, 0.002016946440562606, 0.0019817666616290808, 0.003033609827980399, 0.0027303267270326614, 0.0023831280414015055 ], "n": 8 } }, "idea": { "mean": 0.12442152807489038, "std": 0.06743830819346265, "per_seed": [ 0.09885232150554657, 0.07384644448757172, 0.14970475435256958, 0.25081515312194824, 0.05385749414563179, 0.21027871966362, 0.08540374785661697, 0.07261358946561813 ], "n": 8 }, "comparison": { "delta_mean": 0.12203905370552093, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.09646110446192324, 0.0716156936250627, 0.1474127050023526, 0.24879820668138564, 0.05187572748400271, 0.2072451098356396, 0.08267342112958431, 0.07023046142421663 ], "p_value": 0.0081, "mde": 0.06023392098974088, "mde_rel_pct": 2528.208561827365, "verdict": "idea worse (significant)", "system_worked": false }, "custom_track": { "name": "budgeted_route_costs", "file": "route_track.py", "domain": "graph-decision" }, "idea_sweep": [ { "cfg": { "lr": 0.01, "wd": 0.0001 }, "result": { "mean": 0.12442152807489038, "std": 0.06743830819346265, "per_seed": [ 0.09885232150554657, 0.07384644448757172, 0.14970475435256958, 0.25081515312194824, 0.05385749414563179, 0.21027871966362, 0.08540374785661697, 0.07261358946561813 ], "n": 8 } }, { "cfg": { "lr": 0.001, "wd": 0.0001 }, "result": { "mean": 0.27160821482539177, "std": 0.05016213483864423, "per_seed": [ 0.3274783790111542, 0.2356351912021637, 0.31766167283058167, 0.16266748309135437, 0.25924399495124817, 0.2929310202598572, 0.2722110152244568, 0.3050369620323181 ], "n": 8 } }, { "cfg": { "lr": 0.01, "wd": 0.0001 }, "result": { "mean": 0.12442152807489038, "std": 0.06743830819346265, "per_seed": [ 0.09885232150554657, 0.07384644448757172, 0.14970475435256958, 0.25081515312194824, 0.05385749414563179, 0.21027871966362, 0.08540374785661697, 0.07261358946561813 ], "n": 8 } } ], "mechanism_signature": { "baseline_worst_regret_mean": 0.006290760776028037, "idea_worst_regret_mean": 0.006380649516358972, "predicted_effect": "adversarial training reduces budgeted path flips/regret", "confirmed": false } }