Semantic Pushforward Uncertainty Head / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "semantic_pushforward_classification",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.003,
10 "epochs": 18,
11 "temperature": 1.0,
12 "weight_decay": 0.0
13 },
14 "sweep": [
15 {
16 "cfg": {
17 "lr": 0.001,
18 "epochs": 18,
19 "temperature": 0.8,
20 "weight_decay": 0.0
21 },
22 "mean": 0.28562499955296516
23 },
24 {
25 "cfg": {
26 "lr": 0.001,
27 "epochs": 18,
28 "temperature": 1.0,
29 "weight_decay": 0.0
30 },
31 "mean": 0.28999999538064003
32 },
33 {
34 "cfg": {
35 "lr": 0.001,
36 "epochs": 18,
37 "temperature": 1.2,
38 "weight_decay": 0.0
39 },
40 "mean": 0.2906249985098839
41 },
42 {
43 "cfg": {
44 "lr": 0.003,
45 "epochs": 18,
46 "temperature": 0.8,
47 "weight_decay": 0.0
48 },
49 "mean": 0.2812499962747097
50 },
51 {
52 "cfg": {
53 "lr": 0.003,
54 "epochs": 18,
55 "temperature": 1.0,
56 "weight_decay": 0.0
57 },
58 "mean": 0.27812499180436134
59 },
60 {
61 "cfg": {
62 "lr": 0.003,
63 "epochs": 18,
64 "temperature": 1.2,
65 "weight_decay": 0.0
66 },
67 "mean": 0.27812499180436134
68 },
69 {
70 "cfg": {
71 "lr": 0.006,
72 "epochs": 18,
73 "temperature": 0.8,
74 "weight_decay": 0.0
75 },
76 "mean": 0.29624999314546585
77 },
78 {
79 "cfg": {
80 "lr": 0.006,
81 "epochs": 18,
82 "temperature": 1.0,
83 "weight_decay": 0.0
84 },
85 "mean": 0.29749999940395355
86 },
87 {
88 "cfg": {
89 "lr": 0.006,
90 "epochs": 18,
91 "temperature": 1.2,
92 "weight_decay": 0.0
93 },
94 "mean": 0.2862499877810478
95 }
96 ],
97 "full": {
98 "mean": 0.27843749336898327,
99 "std": 0.044545224984989557,
100 "per_seed": [
101 0.2824999988079071,
102 0.32499998807907104,
103 0.32999998331069946,
104 0.17499999701976776,
105 0.2800000011920929,
106 0.2750000059604645,
107 0.26749998331069946,
108 0.29249998927116394
109 ],
110 "n": 8
111 }
112 },
113 "idea": {
114 "mean": 0.27843749336898327,
115 "std": 0.04587580413113304,
116 "per_seed": [
117 0.2800000011920929,
118 0.32249999046325684,
119 0.3349999785423279,
120 0.17249999940395355,
121 0.2775000035762787,
122 0.27250000834465027,
123 0.26999998092651367,
124 0.29749998450279236
125 ],
126 "n": 8
127 },
128 "comparison": {
129 "delta_mean": 0.0,
130 "idea_wins": 5,
131 "n_pairs": 8,
132 "per_seed_diffs": [
133 -0.002499997615814209,
134 -0.002499997615814209,
135 0.004999995231628418,
136 -0.002499997615814209,
137 -0.002499997615814209,
138 -0.002499997615814209,
139 0.002499997615814209,
140 0.004999995231628418
141 ],
142 "p_value": 1.0,
143 "mde": 0.002956247180700302,
144 "mde_rel_pct": 1.0617274078037706,
145 "verdict": "no measurable effect",
146 "system_worked": false
147 },
148 "mechanism_signature": {
149 "mechanism_signature": {
150 "prediction": "pushforward conserves state mass; calibration learns a nontrivial correction when raw response probabilities are distorted",
151 "predicted_vs_observed": {
152 "predicted_mass_error": 0.0,
153 "observed_mass_error_mean": 1.1920928955078125e-07,
154 "observed_abs_calibrated_vs_raw_mean": 0.007499914558138698,
155 "learned_a_mean_by_state": [
156 1.052509069442749,
157 1.069460391998291,
158 1.037056803703308
159 ],
160 "learned_a_std_by_state": [
161 0.016113081946969032,
162 0.022935794666409492,
163 0.013442201539874077
164 ]
165 },
166 "confirmed": true
167 },
168 "math_check": {
169 "aggregation_error_vs_direct": 0.0,
170 "mass_conservation_error": 4.440892098500626e-16
171 },
172 "custom_track": {
173 "name": "semantic_pushforward_classification",
174 "file": "semantic_track.py",
175 "domain": "uncertainty_calibration"
176 }
177 }
178}