Semantic Pushforward Uncertainty Head / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "semantic_pushforward_classification",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.003,
 10      "epochs": 18,
 11      "temperature": 1.0,
 12      "weight_decay": 0.0
 13    },
 14    "sweep": [
 15      {
 16        "cfg": {
 17          "lr": 0.001,
 18          "epochs": 18,
 19          "temperature": 0.8,
 20          "weight_decay": 0.0
 21        },
 22        "mean": 0.28562499955296516
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.001,
 27          "epochs": 18,
 28          "temperature": 1.0,
 29          "weight_decay": 0.0
 30        },
 31        "mean": 0.28999999538064003
 32      },
 33      {
 34        "cfg": {
 35          "lr": 0.001,
 36          "epochs": 18,
 37          "temperature": 1.2,
 38          "weight_decay": 0.0
 39        },
 40        "mean": 0.2906249985098839
 41      },
 42      {
 43        "cfg": {
 44          "lr": 0.003,
 45          "epochs": 18,
 46          "temperature": 0.8,
 47          "weight_decay": 0.0
 48        },
 49        "mean": 0.2812499962747097
 50      },
 51      {
 52        "cfg": {
 53          "lr": 0.003,
 54          "epochs": 18,
 55          "temperature": 1.0,
 56          "weight_decay": 0.0
 57        },
 58        "mean": 0.27812499180436134
 59      },
 60      {
 61        "cfg": {
 62          "lr": 0.003,
 63          "epochs": 18,
 64          "temperature": 1.2,
 65          "weight_decay": 0.0
 66        },
 67        "mean": 0.27812499180436134
 68      },
 69      {
 70        "cfg": {
 71          "lr": 0.006,
 72          "epochs": 18,
 73          "temperature": 0.8,
 74          "weight_decay": 0.0
 75        },
 76        "mean": 0.29624999314546585
 77      },
 78      {
 79        "cfg": {
 80          "lr": 0.006,
 81          "epochs": 18,
 82          "temperature": 1.0,
 83          "weight_decay": 0.0
 84        },
 85        "mean": 0.29749999940395355
 86      },
 87      {
 88        "cfg": {
 89          "lr": 0.006,
 90          "epochs": 18,
 91          "temperature": 1.2,
 92          "weight_decay": 0.0
 93        },
 94        "mean": 0.2862499877810478
 95      }
 96    ],
 97    "full": {
 98      "mean": 0.27843749336898327,
 99      "std": 0.044545224984989557,
100      "per_seed": [
101        0.2824999988079071,
102        0.32499998807907104,
103        0.32999998331069946,
104        0.17499999701976776,
105        0.2800000011920929,
106        0.2750000059604645,
107        0.26749998331069946,
108        0.29249998927116394
109      ],
110      "n": 8
111    }
112  },
113  "idea": {
114    "mean": 0.27843749336898327,
115    "std": 0.04587580413113304,
116    "per_seed": [
117      0.2800000011920929,
118      0.32249999046325684,
119      0.3349999785423279,
120      0.17249999940395355,
121      0.2775000035762787,
122      0.27250000834465027,
123      0.26999998092651367,
124      0.29749998450279236
125    ],
126    "n": 8
127  },
128  "comparison": {
129    "delta_mean": 0.0,
130    "idea_wins": 5,
131    "n_pairs": 8,
132    "per_seed_diffs": [
133      -0.002499997615814209,
134      -0.002499997615814209,
135      0.004999995231628418,
136      -0.002499997615814209,
137      -0.002499997615814209,
138      -0.002499997615814209,
139      0.002499997615814209,
140      0.004999995231628418
141    ],
142    "p_value": 1.0,
143    "mde": 0.002956247180700302,
144    "mde_rel_pct": 1.0617274078037706,
145    "verdict": "no measurable effect",
146    "system_worked": false
147  },
148  "mechanism_signature": {
149    "mechanism_signature": {
150      "prediction": "pushforward conserves state mass; calibration learns a nontrivial correction when raw response probabilities are distorted",
151      "predicted_vs_observed": {
152        "predicted_mass_error": 0.0,
153        "observed_mass_error_mean": 1.1920928955078125e-07,
154        "observed_abs_calibrated_vs_raw_mean": 0.007499914558138698,
155        "learned_a_mean_by_state": [
156          1.052509069442749,
157          1.069460391998291,
158          1.037056803703308
159        ],
160        "learned_a_std_by_state": [
161          0.016113081946969032,
162          0.022935794666409492,
163          0.013442201539874077
164        ]
165      },
166      "confirmed": true
167    },
168    "math_check": {
169      "aggregation_error_vs_direct": 0.0,
170      "mass_conservation_error": 4.440892098500626e-16
171    },
172    "custom_track": {
173      "name": "semantic_pushforward_classification",
174      "file": "semantic_track.py",
175      "domain": "uncertainty_calibration"
176    }
177  }
178}