{ "bench_version": 1, "track": "custom_relativistic_conservative_regression", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.95502670109272 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.2731384299695492 }, { "cfg": { "lr": 0.006, "epochs": 12 }, "mean": 0.2562924362719059 } ], "full": { "mean": 0.25546916387975216, "std": 0.020297905471986302, "per_seed": [ 0.26548606157302856, 0.26569655537605286, 0.222167506814003, 0.2718196213245392, 0.24948517978191376, 0.23331035673618317, 0.2888605296611786, 0.24692749977111816 ], "n": 8 } }, "idea": { "mean": 0.2924688458442688, "std": 0.11434509573619478, "per_seed": [ 0.24210484325885773, 0.26006338000297546, 0.22749106585979462, 0.2767752707004547, 0.5917121171951294, 0.23255784809589386, 0.2707672119140625, 0.23827902972698212 ], "n": 8 }, "comparison": { "delta_mean": 0.03699968196451664, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.023381218314170837, -0.005633175373077393, 0.005323559045791626, 0.004955649375915527, 0.34222693741321564, -0.0007525086402893066, -0.01809331774711609, -0.008648470044136047 ], "p_value": 0.92165, "mde": 0.10347551087691399, "mde_rel_pct": 40.504109891563786, "verdict": "no significant win", "system_worked": false }, "custom_track": { "name": "relativistic_conservative_regression", "file": "gql_track.py", "domain": "conservative_state_admissibility" }, "sweep_parity": { "union_grid": [ { "lr": 0.001, "epochs": 12 }, { "lr": 0.003, "epochs": 12 }, { "lr": 0.006, "epochs": 12 } ], "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.7376375496387482 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.2556793764233589 }, { "cfg": { "lr": 0.006, "epochs": 12 }, "mean": 0.25160863995552063 } ] }, "mechanism_signature": { "claim": "limiting a valid baseline candidate along the complete residual enforces admissibility", "predicted_invalid_rate_after_limit": 0.0, "observed_invalid_rate_after_limit": 0.019999999552965164, "observed_raw_invalid_rate": 0.1299999998882413, "trained_model_measurements": [ { "seed": 0, "invalid_raw": 0.029999999329447746, "invalid_limited": 0.0, "mean_theta": 0.9987504482269287 }, { "seed": 1, "invalid_raw": 0.009999999776482582, "invalid_limited": 0.0, "mean_theta": 0.9990912079811096 }, { "seed": 2, "invalid_raw": 0.0, "invalid_limited": 0.0, "mean_theta": 1.0 }, { "seed": 3, "invalid_raw": 0.0, "invalid_limited": 0.0, "mean_theta": 1.0 }, { "seed": 4, "invalid_raw": 1.0, "invalid_limited": 0.1599999964237213, "mean_theta": 0.5550016164779663 }, { "seed": 5, "invalid_raw": 0.0, "invalid_limited": 0.0, "mean_theta": 1.0 }, { "seed": 6, "invalid_raw": 0.0, "invalid_limited": 0.0, "mean_theta": 1.0 }, { "seed": 7, "invalid_raw": 0.0, "invalid_limited": 0.0, "mean_theta": 1.0 } ], "confirmed": false } }