{ "bench_version": 1, "track": "incidence_actions", "model": "custom_incidence_head", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.7750000208616257 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.6015625 }, { "cfg": { "lr": 0.006, "epochs": 12 }, "mean": 0.3687500059604645 } ], "full": { "mean": 0.3562500048428774, "std": 0.06817944972613313, "per_seed": [ 0.32500001788139343, 0.41875001788139343, 0.3812499940395355, 0.3499999940395355, 0.3062500059604645, 0.22500000894069672, 0.4625000059604645, 0.3812499940395355 ], "n": 8 } }, "idea": { "mean": 0.12421874981373549, "std": 0.02854504035137365, "per_seed": [ 0.09375, 0.15000000596046448, 0.14374999701976776, 0.11874999850988388, 0.15625, 0.06875000149011612, 0.14374999701976776, 0.11874999850988388 ], "n": 8, "best_cfg": { "lr": 0.006, "epochs": 12, "alpha": 0.0 }, "sweep": [ { "cfg": { "lr": 0.006, "epochs": 12, "alpha": 0.0 }, "mean": 0.12656250037252903 }, { "cfg": { "lr": 0.006, "epochs": 12, "alpha": 0.5 }, "mean": 0.27812499552965164 }, { "cfg": { "lr": 0.006, "epochs": 12, "alpha": 1.0 }, "mean": 0.690625011920929 } ] }, "comparison": { "delta_mean": -0.2320312550291419, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.23125001788139343, -0.26875001192092896, -0.23749999701976776, -0.23124999552965164, -0.15000000596046448, -0.1562500074505806, -0.3187500089406967, -0.26249999552965164 ], "p_value": 0.0081, "mde": 0.04719409486255682, "mde_rel_pct": 13.247465044490758, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "custom_track": { "name": "incidence_actions", "file": "incidence_actions.py", "domain": "structured_action_classification" }, "baseline_sweep_union_lrs": [ 0.001, 0.003, 0.006 ], "idea_sweep": [ { "cfg": { "lr": 0.006, "epochs": 12, "alpha": 0.0 }, "mean": 0.12656250037252903 }, { "cfg": { "lr": 0.006, "epochs": 12, "alpha": 0.5 }, "mean": 0.27812499552965164 }, { "cfg": { "lr": 0.006, "epochs": 12, "alpha": 1.0 }, "mean": 0.690625011920929 } ], "mechanism_signature": { "prediction": "trained incidence logits equal A times trained atomic scores (alpha-normalized)", "n_observed_logits": 1636, "predicted_max_abs_error": 0.0, "observed_mean_abs_error": 0.0, "confirmed": true } } }