{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 17.482568740844727 }, { "cfg": { "lr": 0.003 }, "mean": 12.535736083984375 }, { "cfg": { "lr": 0.006 }, "mean": 9.091599702835083 } ], "full": { "mean": 9.481420636177063, "std": 0.9072998646400672, "per_seed": [ 8.627572059631348, 8.736048698425293, 8.82056999206543, 10.182208061218262, 8.84079647064209, 9.23827075958252, 11.380922317504883, 10.02497673034668 ], "n": 8 } }, "idea": { "mean": 9.610056400299072, "std": 1.0356528912793441, "per_seed": [ 9.995634078979492, 8.813212394714355, 8.717215538024902, 9.493178367614746, 8.498827934265137, 9.12738037109375, 11.815202713012695, 10.4197998046875 ], "n": 8 }, "comparison": { "delta_mean": 0.12863576412200928, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 1.3680620193481445, 0.0771636962890625, -0.10335445404052734, -0.6890296936035156, -0.3419685363769531, -0.11089038848876953, 0.4342803955078125, 0.3948230743408203 ], "p_value": 0.61945, "mde": 0.5197178870759055, "mde_rel_pct": 5.481434766145522, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "signature": { "quantity": "family allocation variance proxy sum(u_c^2/n_c)", "predicted_mean": 0.0982159124687314, "observed_mean": 0.09136932715773582, "relative_error": 0.06970953218171544, "confirmed": true, "note": "u and n are computed from trained model residuals; observed proxy uses held-out family residual variances." }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epsilon": 0.05 }, "result": { "mean": 18.78651201725006, "std": 2.1210090381527644, "per_seed": [ 17.013912200927734, 15.361128807067871, 21.161161422729492, 16.918540954589844, 19.89978790283203, 17.97165870666504, 20.517269134521484, 21.448637008666992 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epsilon": 0.15 }, "result": { "mean": 13.162447214126587, "std": 1.3889931613668718, "per_seed": [ 13.541401863098145, 11.67493724822998, 12.949481964111328, 12.458735466003418, 11.737956047058105, 12.227039337158203, 15.25829792022705, 15.451727867126465 ], "n": 8 } }, { "cfg": { "lr": 0.006, "epsilon": 0.3 }, "result": { "mean": 9.610056400299072, "std": 1.0356528912793441, "per_seed": [ 9.995634078979492, 8.813212394714355, 8.717215538024902, 9.493178367614746, 8.498827934265137, 9.12738037109375, 11.815202713012695, 10.4197998046875 ], "n": 8 } } ], "track_rationale": "Family-conditioned minibatch selection is an optimizer/training-data mechanism; tabular regression is the mandated structural track for optimizer/data mechanics." }, "stage2_protocol": { "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "epochs": 12, "batch": 64, "baseline_grid": [ { "lr": 0.001 }, { "lr": 0.003 }, { "lr": 0.006 } ], "idea_grid": [ { "lr": 0.001, "epsilon": 0.05 }, { "lr": 0.003, "epsilon": 0.15 }, { "lr": 0.006, "epsilon": 0.3 } ] } }