Amortized low-rank Laplace hyperparameter marginalization / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "weight_decay": 0.0001
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.0015,
 16          "weight_decay": 0.0001
 17        },
 18        "mean": 16.405593872070312
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "weight_decay": 0.0001
 24        },
 25        "mean": 13.136067628860474
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "weight_decay": 0.0001
 31        },
 32        "mean": 9.729963302612305
 33      }
 34    ],
 35    "full": {
 36      "mean": 9.7748162150383,
 37      "std": 1.146524142314583,
 38      "per_seed": [
 39        10.155755043029785,
 40        11.133987426757812,
 41        8.668990135192871,
 42        8.96112060546875,
 43        7.614502429962158,
 44        10.594099044799805,
 45        10.266080856323242,
 46        10.803994178771973
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 8.963683664798737,
 53    "std": 1.2184976932247173,
 54    "per_seed": [
 55      10.102669715881348,
 56      11.417046546936035,
 57      9.143009185791016,
 58      8.528031349182129,
 59      7.16295862197876,
 60      8.287325859069824,
 61      8.166311264038086,
 62      8.902116775512695
 63    ],
 64    "n": 8
 65  },
 66  "comparison": {
 67    "delta_mean": -0.811132550239563,
 68    "idea_wins": 6,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      -0.0530853271484375,
 72      0.28305912017822266,
 73      0.47401905059814453,
 74      -0.4330892562866211,
 75      -0.45154380798339844,
 76      -2.3067731857299805,
 77      -2.0997695922851562,
 78      -1.9018774032592773
 79    ],
 80    "p_value": 0.10015,
 81    "mde": 0.9366083105537301,
 82    "mde_rel_pct": 9.581850849663882,
 83    "verdict": "no significant win",
 84    "system_worked": false
 85  },
 86  "idea_sweep": [
 87    {
 88      "cfg": {
 89        "lr": 0.0015,
 90        "weight_decay": 0.0001
 91      },
 92      "mean": 17.79743456840515
 93    },
 94    {
 95      "cfg": {
 96        "lr": 0.003,
 97        "weight_decay": 0.0001
 98      },
 99      "mean": 13.299631118774414
100    },
101    {
102      "cfg": {
103        "lr": 0.006,
104        "weight_decay": 0.0001
105      },
106      "mean": 9.797689199447632
107    }
108  ],
109  "selection_note": "Both methods used the same lr/weight-decay union; idea selected on seeds 0-3.",
110  "mechanism_signature": {
111    "type": "trained_model_jacobian_low_rank",
112    "rank": 16,
113    "samples": [
114      {
115        "seed": 0,
116        "predicted_captured_fraction": 0.17476074945303136,
117        "observed_total_energy": 26951.634765625,
118        "projected_energy": 4710.087890625
119      },
120      {
121        "seed": 1,
122        "predicted_captured_fraction": 0.2573280523615646,
123        "observed_total_energy": 32180.689453125,
124        "projected_energy": 8280.994140625
125      },
126      {
127        "seed": 2,
128        "predicted_captured_fraction": 0.24594845290024767,
129        "observed_total_energy": 26192.974609375,
130        "projected_energy": 6442.12158203125
131      },
132      {
133        "seed": 3,
134        "predicted_captured_fraction": 0.17532369020915245,
135        "observed_total_energy": 24280.84765625,
136        "projected_energy": 4257.0078125
137      }
138    ],
139    "predicted_vs_observed_mean_ratio": 0.21334023623099901,
140    "confirmed": false
141  },
142  "runtime_sec": 21.001119817025028
143}