State-Dependent Metric Projected Optimizer / bench_report.json

✓✓ Beats tuned baseline

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.003,
 10      "beta2": 0.999
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.0003,
 16          "beta2": 0.99
 17        },
 18        "mean": 219.74071502685547
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.001,
 23          "beta2": 0.99
 24        },
 25        "mean": 133.59764099121094
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.003,
 30          "beta2": 0.999
 31        },
 32        "mean": 16.845557928085327
 33      }
 34    ],
 35    "full": {
 36      "mean": 17.666198015213013,
 37      "std": 2.17622036048186,
 38      "per_seed": [
 39        17.691715240478516,
 40        14.373583793640137,
 41        20.163808822631836,
 42        15.15312385559082,
 43        18.178590774536133,
 44        15.800971031188965,
 45        19.925329208374023,
 46        20.042461395263672
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "per_seed": [
 53      15.087238311767578,
 54      12.6608247756958,
 55      16.30777359008789,
 56      14.145133972167969,
 57      15.023676872253418,
 58      15.424975395202637,
 59      17.59527587890625,
 60      18.863933563232422
 61    ],
 62    "mean": 15.638604044914246,
 63    "best_cfg": {
 64      "lr": 0.003,
 65      "beta2": 0.999,
 66      "metric_beta": -0.5
 67    },
 68    "nearby_settings": [
 69      {
 70        "cfg": {
 71          "lr": 0.0003,
 72          "beta2": 0.99,
 73          "metric_beta": -0.5
 74        },
 75        "mean": 216.299165725708
 76      },
 77      {
 78        "cfg": {
 79          "lr": 0.001,
 80          "beta2": 0.99,
 81          "metric_beta": -0.5
 82        },
 83        "mean": 81.73757028579712
 84      },
 85      {
 86        "cfg": {
 87          "lr": 0.003,
 88          "beta2": 0.999,
 89          "metric_beta": -0.5
 90        },
 91        "mean": 15.638604044914246
 92      }
 93    ]
 94  },
 95  "comparison": {
 96    "delta_mean": -2.027593970298767,
 97    "idea_wins": 8,
 98    "n_pairs": 8,
 99    "per_seed_diffs": [
100      -2.6044769287109375,
101      -1.712759017944336,
102      -3.8560352325439453,
103      -1.0079898834228516,
104      -3.154913902282715,
105      -0.3759956359863281,
106      -2.3300533294677734,
107      -1.17852783203125
108    ],
109    "p_value": 0.0081,
110    "mde": 0.9805142418858956,
111    "mde_rel_pct": 5.550227847788975,
112    "verdict": "idea better (significant)",
113    "system_worked": true
114  },
115  "mechanism_signature": {
116    "predicted": "m decreases as observed v increases (inverse-variance metric)",
117    "observed_metric_mean": 3.7805249429075047,
118    "observed_log_metric_vs_negative_log_variance_corr": 0.8070462500798509,
119    "baseline_final_train_loss": 17.63215286254883,
120    "idea_final_train_loss": 15.715824356079102,
121    "max_constraint_violation": 0.0,
122    "confirmed": true
123  },
124  "protocol_note": "Baseline and idea use identical tabular task, mlp_tiny architecture, 12 epochs, batch 128, and the same lr union; baseline Adam beta2 was swept."
125}