Double-Geometric Layerwise ES / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "weight_decay": 0.0001
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.0015,
 16          "weight_decay": 0.0
 17        },
 18        "mean": 16.004083156585693
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.0015,
 23          "weight_decay": 0.0001
 24        },
 25        "mean": 16.01387643814087
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.003,
 30          "weight_decay": 0.0
 31        },
 32        "mean": 12.535736083984375
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.003,
 37          "weight_decay": 0.0001
 38        },
 39        "mean": 12.430302143096924
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.006,
 44          "weight_decay": 0.0
 45        },
 46        "mean": 9.091599702835083
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.006,
 51          "weight_decay": 0.0001
 52        },
 53        "mean": 8.875346541404724
 54      }
 55    ],
 56    "full": {
 57      "mean": 9.257637917995453,
 58      "std": 0.7946203059794043,
 59      "per_seed": [
 60        9.313394546508789,
 61        7.957194805145264,
 62        8.725268363952637,
 63        9.505528450012207,
 64        8.830371856689453,
 65        9.170703887939453,
 66        10.88531494140625,
 67        9.67332649230957
 68      ],
 69      "n": 8
 70    }
 71  },
 72  "idea": {
 73    "mean": 10.167674660682678,
 74    "std": 1.8586175283157877,
 75    "per_seed": [
 76      12.230741500854492,
 77      8.306159973144531,
 78      8.560102462768555,
 79      9.36517333984375,
 80      8.156329154968262,
 81      9.683719635009766,
 82      13.33909797668457,
 83      11.7000732421875
 84    ],
 85    "n": 8
 86  },
 87  "comparison": {
 88    "delta_mean": 0.9100367426872253,
 89    "idea_wins": 3,
 90    "n_pairs": 8,
 91    "per_seed_diffs": [
 92      2.917346954345703,
 93      0.3489651679992676,
 94      -0.16516590118408203,
 95      -0.14035511016845703,
 96      -0.6740427017211914,
 97      0.5130157470703125,
 98      2.4537830352783203,
 99      2.0267467498779297
100    ],
101    "p_value": 0.129,
102    "mde": 1.1351211014956983,
103    "mde_rel_pct": 12.261454936460563,
104    "verdict": "no significant win",
105    "system_worked": false
106  },
107  "idea_sweep": [
108    {
109      "cfg": {
110        "lr": 0.006,
111        "rho": 0.12,
112        "beta": 0.85,
113        "epochs": 12,
114        "K": 6
115      },
116      "mean": 9.615544319152832
117    },
118    {
119      "cfg": {
120        "lr": 0.0015,
121        "rho": 0.12,
122        "beta": 0.85,
123        "epochs": 12,
124        "K": 6
125      },
126      "mean": 15.944299936294556
127    },
128    {
129      "cfg": {
130        "lr": 0.006,
131        "rho": 0.12,
132        "beta": 0.85,
133        "epochs": 12,
134        "K": 6
135      },
136      "mean": 9.615544319152832
137    }
138  ],
139  "track_justification": "Optimizer intervention matches tabular MLP training; both systems share architecture and data.",
140  "budget": {
141    "epochs": 12,
142    "batch": 64,
143    "candidates_per_epoch": 6,
144    "seeds": 8
145  },
146  "mechanism_signature": {
147    "predicted": "utility-|z| covariance should determine q update direction",
148    "observed_note": "trained-model candidate losses and DG q updates were collected during each run",
149    "predicted_vs_observed": "see per-seed trained metrics; no fixed quantitative tolerance claimed",
150    "confirmed": false
151  }
152}