{ "bench_version": 1, "track": "vision", "model": "cnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.0015 }, "sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.7512499988079071 }, { "cfg": { "lr": 0.003 }, "mean": 0.7537499964237213 }, { "cfg": { "lr": 0.006 }, "mean": 0.878125011920929 } ], "full": { "mean": 0.7653124928474426, "std": 0.035143397058649814, "per_seed": [ 0.7350000143051147, 0.7825000286102295, 0.7799999713897705, 0.7074999809265137, 0.8324999809265137, 0.7699999809265137, 0.7425000071525574, 0.7724999785423279 ], "n": 8 }, "idea_union_sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.7781250029802322 }, { "cfg": { "lr": 0.003 }, "mean": 0.7737499922513962 }, { "cfg": { "lr": 0.006 }, "mean": 0.7937500029802322 } ] }, "idea": { "mean": 0.7856250032782555, "std": 0.029993484958144172, "per_seed": [ 0.7699999809265137, 0.8374999761581421, 0.737500011920929, 0.75, 0.7975000143051147, 0.7975000143051147, 0.8050000071525574, 0.7900000214576721 ], "n": 8 }, "comparison": { "delta_mean": 0.020312510430812836, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 0.034999966621398926, 0.0549999475479126, -0.04249995946884155, 0.04250001907348633, -0.034999966621398926, 0.027500033378601074, 0.0625, 0.01750004291534424 ], "p_value": 0.17155, "mde": 0.03277566818472898, "mde_rel_pct": 4.282651660733112, "verdict": "no significant win", "system_worked": false }, "parameterization": { "alpha": 0.5, "r": 0.0, "epochs": 8, "batch": 128, "lr_union": [ 0.0015, 0.003, 0.006 ], "task": "CIFAR-10 subset classification" }, "mechanism_signature": { "quantity": "mean probability assigned to observed target event on trained test models", "baseline_target_event_prob": 0.14888361282646656, "idea_target_event_prob": 0.16992626152932644, "prediction": "r=0, alpha=0.5 changes power-law gradient weighting and should reduce gradient variability", "observed_baseline_grad_var": 3.603046359352762, "observed_idea_grad_var": 0.48674841174291406, "confirmed": true } }