{ "bench_version": 1, "track": "semantic_pushforward_classification", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "epochs": 18, "temperature": 1.0, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 18, "temperature": 0.8, "weight_decay": 0.0 }, "mean": 0.28562499955296516 }, { "cfg": { "lr": 0.001, "epochs": 18, "temperature": 1.0, "weight_decay": 0.0 }, "mean": 0.28999999538064003 }, { "cfg": { "lr": 0.001, "epochs": 18, "temperature": 1.2, "weight_decay": 0.0 }, "mean": 0.2906249985098839 }, { "cfg": { "lr": 0.003, "epochs": 18, "temperature": 0.8, "weight_decay": 0.0 }, "mean": 0.2812499962747097 }, { "cfg": { "lr": 0.003, "epochs": 18, "temperature": 1.0, "weight_decay": 0.0 }, "mean": 0.27812499180436134 }, { "cfg": { "lr": 0.003, "epochs": 18, "temperature": 1.2, "weight_decay": 0.0 }, "mean": 0.27812499180436134 }, { "cfg": { "lr": 0.006, "epochs": 18, "temperature": 0.8, "weight_decay": 0.0 }, "mean": 0.29624999314546585 }, { "cfg": { "lr": 0.006, "epochs": 18, "temperature": 1.0, "weight_decay": 0.0 }, "mean": 0.29749999940395355 }, { "cfg": { "lr": 0.006, "epochs": 18, "temperature": 1.2, "weight_decay": 0.0 }, "mean": 0.2862499877810478 } ], "full": { "mean": 0.27843749336898327, "std": 0.044545224984989557, "per_seed": [ 0.2824999988079071, 0.32499998807907104, 0.32999998331069946, 0.17499999701976776, 0.2800000011920929, 0.2750000059604645, 0.26749998331069946, 0.29249998927116394 ], "n": 8 } }, "idea": { "mean": 0.27843749336898327, "std": 0.04587580413113304, "per_seed": [ 0.2800000011920929, 0.32249999046325684, 0.3349999785423279, 0.17249999940395355, 0.2775000035762787, 0.27250000834465027, 0.26999998092651367, 0.29749998450279236 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.002499997615814209, -0.002499997615814209, 0.004999995231628418, -0.002499997615814209, -0.002499997615814209, -0.002499997615814209, 0.002499997615814209, 0.004999995231628418 ], "p_value": 1.0, "mde": 0.002956247180700302, "mde_rel_pct": 1.0617274078037706, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "mechanism_signature": { "prediction": "pushforward conserves state mass; calibration learns a nontrivial correction when raw response probabilities are distorted", "predicted_vs_observed": { "predicted_mass_error": 0.0, "observed_mass_error_mean": 1.1920928955078125e-07, "observed_abs_calibrated_vs_raw_mean": 0.007499914558138698, "learned_a_mean_by_state": [ 1.052509069442749, 1.069460391998291, 1.037056803703308 ], "learned_a_std_by_state": [ 0.016113081946969032, 0.022935794666409492, 0.013442201539874077 ] }, "confirmed": true }, "math_check": { "aggregation_error_vs_direct": 0.0, "mass_conservation_error": 4.440892098500626e-16 }, "custom_track": { "name": "semantic_pushforward_classification", "file": "semantic_track.py", "domain": "uncertainty_calibration" } } }