{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0001, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.0015, "weight_decay": 0.0, "epochs": 12 }, "mean": 13.675705671310425 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "epochs": 12 }, "mean": 9.352656126022339 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0, "epochs": 12 }, "mean": 7.226524114608765 }, { "cfg": { "lr": 0.0015, "weight_decay": 0.0001, "epochs": 12 }, "mean": 13.609990000724792 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "epochs": 12 }, "mean": 9.076743841171265 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001, "epochs": 12 }, "mean": 7.0532397627830505 } ], "full": { "mean": 7.0532397627830505, "std": 0.2264412705403704, "per_seed": [ 6.572167873382568, 7.1756792068481445, 7.042057037353516, 7.032951831817627, 7.018033504486084, 7.022153854370117, 7.112776756286621, 7.450098037719727 ], "n": 8 } }, "idea": { "mean": 7.014131605625153, "std": 0.24308566746895208, "per_seed": [ 6.6641693115234375, 7.260889053344727, 6.737545013427734, 6.856451034545898, 6.927297592163086, 7.039077281951904, 7.303320407867432, 7.324303150177002 ], "n": 8 }, "comparison": { "delta_mean": -0.03910815715789795, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.09200143814086914, 0.08520984649658203, -0.30451202392578125, -0.17650079727172852, -0.09073591232299805, 0.01692342758178711, 0.19054365158081055, -0.1257948875427246 ], "p_value": 0.50145, "mde": 0.13703746835599878, "mde_rel_pct": 1.9429010350546605, "verdict": "no measurable effect", "system_worked": false }, "selection_details": "Entropy and validation-risk masks selected from train split; final systems use identical mlp_tiny/training.", "mechanism_signature": { "prediction": "kappa>=0.90 routes away from entropy mask and avoids materially worse trained-model MSE", "observed": [ { "seed": 0, "kappa": 1.0, "gamma": 13.140283130679085, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": 0.09200143814086914 }, { "seed": 1, "kappa": 1.0, "gamma": 16.30871552694337, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": 0.08520984649658203 }, { "seed": 2, "kappa": 1.0, "gamma": 12.264759413539208, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": -0.30451202392578125 }, { "seed": 3, "kappa": 1.0, "gamma": 13.648493168331017, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": -0.17650079727172852 }, { "seed": 4, "kappa": 1.0, "gamma": 15.0961523290884, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": -0.09073591232299805 }, { "seed": 5, "kappa": 1.0, "gamma": 11.799654276914342, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": 0.01692342758178711 }, { "seed": 6, "kappa": 1.0, "gamma": 15.35830490498792, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": 0.19054365158081055 }, { "seed": 7, "kappa": 1.0, "gamma": 13.753987138531764, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": -0.1257948875427246 } ], "high_kappa_n": 8, "high_kappa_observed_mean_delta": -0.03910815715789795, "confirmed": true } }