Structured-μ Robust Optimizer / bench_report.json

Unverified

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.001864717691205442
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.0010901302302954718
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 0.0007834962307242677
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.0007629803658346646,
 33      "std": 0.0001532216486643604,
 34      "per_seed": [
 35        0.0007414515130221844,
 36        0.0007607811712659895,
 37        0.0005636455025523901,
 38        0.0010681067360565066,
 39        0.0005972225335426629,
 40        0.0008695110445842147,
 41        0.0006637414335273206,
 42        0.0008393829921260476
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.0008885447387001477,
 49    "std": 0.00019236408711557237,
 50    "per_seed": [
 51      0.0008275478612631559,
 52      0.0007517888443544507,
 53      0.0008077613892965019,
 54      0.001312590204179287,
 55      0.0006803550641052425,
 56      0.0010163012193515897,
 57      0.0007431214908137918,
 58      0.0009688918362371624
 59    ],
 60    "n": 8,
 61    "sweep": [
 62      {
 63        "cfg": {
 64          "lr": 0.001
 65        },
 66        "mean": 0.001914308115374297
 67      },
 68      {
 69        "cfg": {
 70          "lr": 0.003
 71        },
 72        "mean": 0.0011525089503265917
 73      },
 74      {
 75        "cfg": {
 76          "lr": 0.006
 77        },
 78        "mean": 0.0009249220747733489
 79      }
 80    ],
 81    "best_cfg": {
 82      "lr": 0.006
 83    }
 84  },
 85  "comparison": {
 86    "delta_mean": 0.00012556437286548316,
 87    "idea_wins": 1,
 88    "n_pairs": 8,
 89    "per_seed_diffs": [
 90      8.609634824097157e-05,
 91      -8.99232691153884e-06,
 92      0.00024411588674411178,
 93      0.0002444834681227803,
 94      8.313253056257963e-05,
 95      0.000146790174767375,
 96      7.938005728647113e-05,
 97      0.00012950884411111474
 98    ],
 99    "p_value": 0.01555,
100    "mde": 7.224663646449906e-05,
101    "mde_rel_pct": 9.469003358358332,
102    "verdict": "idea worse (significant)",
103    "system_worked": false
104  },
105  "mechanism_signature": {
106    "mean_gain": 0.6955887790509646,
107    "min_gain": 0.5946514130450381,
108    "max_param_norm": 9.710066318511963,
109    "mean_grad_norm": 0.3572234613335846,
110    "predicted_mu_bound": 0.9,
111    "observed_scaled_update_bound": 0.981711087657787,
112    "prediction": "mu<1 should bound feedback gain and parameter growth",
113    "predicted": {
114      "mu_threshold": 1.0,
115      "target_mu": 0.9
116    },
117    "observed": {
118      "mean_gain": 0.6955887790509646,
119      "max_param_norm": 9.710066318511963
120    },
121    "confirmed": true
122  },
123  "custom_track": null
124}