{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "density": 0.75 }, "sweep": [ { "cfg": { "lr": 0.001, "density": 0.25 }, "mean": 235.12103271484375 }, { "cfg": { "lr": 0.001, "density": 0.5 }, "mean": 234.88482284545898 }, { "cfg": { "lr": 0.001, "density": 0.75 }, "mean": 234.4692726135254 }, { "cfg": { "lr": 0.003, "density": 0.25 }, "mean": 234.5323600769043 }, { "cfg": { "lr": 0.003, "density": 0.5 }, "mean": 233.07298278808594 }, { "cfg": { "lr": 0.003, "density": 0.75 }, "mean": 232.68642044067383 }, { "cfg": { "lr": 0.01, "density": 0.25 }, "mean": 232.15027618408203 }, { "cfg": { "lr": 0.01, "density": 0.5 }, "mean": 227.00447845458984 }, { "cfg": { "lr": 0.01, "density": 0.75 }, "mean": 226.18533325195312 } ], "full": { "mean": 224.90276336669922, "std": 11.172746066633566, "per_seed": [ 239.23036193847656, 226.6573944091797, 226.5115509033203, 212.34202575683594, 230.5985870361328, 209.33729553222656, 214.15821838378906, 240.3866729736328 ], "n": 8 } }, "idea": { "mean": 225.713041305542, "std": 11.455704812834473, "per_seed": [ 241.9227752685547, 225.7875518798828, 227.34036254882812, 211.91632080078125, 231.61343383789062, 209.4794921875, 217.06570434570312, 240.5786895751953 ], "n": 8, "sweep": [ { "cfg": { "lr": 0.001, "rho_aug": 0.5 }, "mean": 234.92945861816406 }, { "cfg": { "lr": 0.003, "rho_aug": 0.5 }, "mean": 232.97465896606445 }, { "cfg": { "lr": 0.01, "rho_aug": 0.5 }, "mean": 226.74175262451172 } ] }, "comparison": { "delta_mean": 0.8102779388427734, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 2.692413330078125, -0.869842529296875, 0.8288116455078125, -0.4257049560546875, 1.0148468017578125, 0.1421966552734375, 2.9074859619140625, 0.1920166015625 ], "p_value": 0.16705, "mde": 1.1465610155646562, "mde_rel_pct": 0.509802991480017, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "track_choice": "tabular matches pruning/regularization of a frozen MLP; identical MLP and task are used for both systems.", "shared_lr_grid": [ 0.001, 0.003, 0.01 ], "baseline_density_grid": [ 0.25, 0.5, 0.75 ], "idea_sweep": [ { "cfg": { "lr": 0.001, "rho_aug": 0.5 }, "mean": 234.92945861816406 }, { "cfg": { "lr": 0.003, "rho_aug": 0.5 }, "mean": 232.97465896606445 }, { "cfg": { "lr": 0.01, "rho_aug": 0.5 }, "mean": 226.74175262451172 } ], "idea_best_cfg": { "lr": 0.01, "rho_aug": 0.5 }, "signature": { "prediction": "For iid initialized real/dummy scores and fixed Top-K, expected dummy fraction is 0.5 and expected real density is rho_aug=0.5.", "predicted_dummy_fraction": 0.5, "observed_dummy_fraction_mean": 0.5014583333333333, "predicted_real_density": 0.5, "observed_real_density_mean": 0.5034952799479167, "baseline_observed_real_density": 0.75, "confirmed": true } }, "bench_report": { "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "density": 0.75 }, "sweep": [ { "cfg": { "lr": 0.001, "density": 0.25 }, "mean": 235.12103271484375 }, { "cfg": { "lr": 0.001, "density": 0.5 }, "mean": 234.88482284545898 }, { "cfg": { "lr": 0.001, "density": 0.75 }, "mean": 234.4692726135254 }, { "cfg": { "lr": 0.003, "density": 0.25 }, "mean": 234.5323600769043 }, { "cfg": { "lr": 0.003, "density": 0.5 }, "mean": 233.07298278808594 }, { "cfg": { "lr": 0.003, "density": 0.75 }, "mean": 232.68642044067383 }, { "cfg": { "lr": 0.01, "density": 0.25 }, "mean": 232.15027618408203 }, { "cfg": { "lr": 0.01, "density": 0.5 }, "mean": 227.00447845458984 }, { "cfg": { "lr": 0.01, "density": 0.75 }, "mean": 226.18533325195312 } ], "full": { "mean": 224.90276336669922, "std": 11.172746066633566, "per_seed": [ 239.23036193847656, 226.6573944091797, 226.5115509033203, 212.34202575683594, 230.5985870361328, 209.33729553222656, 214.15821838378906, 240.3866729736328 ], "n": 8 } }, "idea": { "mean": 225.713041305542, "std": 11.455704812834473, "per_seed": [ 241.9227752685547, 225.7875518798828, 227.34036254882812, 211.91632080078125, 231.61343383789062, 209.4794921875, 217.06570434570312, 240.5786895751953 ], "n": 8, "sweep": [ { "cfg": { "lr": 0.001, "rho_aug": 0.5 }, "mean": 234.92945861816406 }, { "cfg": { "lr": 0.003, "rho_aug": 0.5 }, "mean": 232.97465896606445 }, { "cfg": { "lr": 0.01, "rho_aug": 0.5 }, "mean": 226.74175262451172 } ] }, "comparison": { "delta_mean": 0.8102779388427734, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 2.692413330078125, -0.869842529296875, 0.8288116455078125, -0.4257049560546875, 1.0148468017578125, 0.1421966552734375, 2.9074859619140625, 0.1920166015625 ], "p_value": 0.16705, "mde": 1.1465610155646562, "mde_rel_pct": 0.509802991480017, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "track_choice": "tabular matches pruning/regularization of a frozen MLP; identical MLP and task are used for both systems.", "shared_lr_grid": [ 0.001, 0.003, 0.01 ], "baseline_density_grid": [ 0.25, 0.5, 0.75 ], "idea_sweep": [ { "cfg": { "lr": 0.001, "rho_aug": 0.5 }, "mean": 234.92945861816406 }, { "cfg": { "lr": 0.003, "rho_aug": 0.5 }, "mean": 232.97465896606445 }, { "cfg": { "lr": 0.01, "rho_aug": 0.5 }, "mean": 226.74175262451172 } ], "idea_best_cfg": { "lr": 0.01, "rho_aug": 0.5 }, "signature": { "prediction": "For iid initialized real/dummy scores and fixed Top-K, expected dummy fraction is 0.5 and expected real density is rho_aug=0.5.", "predicted_dummy_fraction": 0.5, "observed_dummy_fraction_mean": 0.5014583333333333, "predicted_real_density": 0.5, "observed_real_density_mean": 0.5034952799479167, "baseline_observed_real_density": 0.75, "confirmed": true } } } }