Mean-Square Proximal Relaxation Optimizer / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.0002686133266252
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 2.2429956516134553e-05
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 1.2719097412627889e-05
 29      }
 30    ],
 31    "full": {
 32      "mean": 1.3684802866009704e-05,
 33      "std": 2.4297331089709535e-06,
 34      "per_seed": [
 35        1.0965275578200817e-05,
 36        1.3063688129477669e-05,
 37        1.363205592497252e-05,
 38        1.321537001786055e-05,
 39        1.694267484708689e-05,
 40        1.790331407391932e-05,
 41        1.3341849808057304e-05,
 42        1.0414194548502564e-05
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.0005339367999113165,
 49    "std": 0.0003344099304737304,
 50    "per_seed": [
 51      0.00038349704118445516,
 52      0.0002837758220266551,
 53      0.00047679623821750283,
 54      0.000840833701658994,
 55      0.00030266467365436256,
 56      0.00031309283804148436,
 57      0.0012979843886569142,
 58      0.0003728496958501637
 59    ],
 60    "n": 8,
 61    "chosen_cfg": {
 62      "lr": 0.006,
 63      "alpha": 0.75
 64    },
 65    "sweep": [
 66      {
 67        "cfg": {
 68          "lr": 0.001,
 69          "alpha": 0.25
 70        },
 71        "mean": 0.5652050226926804,
 72        "per_seed": [
 73          0.5019805431365967,
 74          0.6064469218254089,
 75          0.5146586894989014,
 76          0.6377339363098145
 77        ]
 78      },
 79      {
 80        "cfg": {
 81          "lr": 0.003,
 82          "alpha": 0.5
 83        },
 84        "mean": 0.05728436540812254,
 85        "per_seed": [
 86          0.0478343702852726,
 87          0.05792839825153351,
 88          0.03978803753852844,
 89          0.08358665555715561
 90        ]
 91      },
 92      {
 93        "cfg": {
 94          "lr": 0.006,
 95          "alpha": 0.75
 96        },
 97        "mean": 0.0004962257007719018,
 98        "per_seed": [
 99          0.00038349704118445516,
100          0.0002837758220266551,
101          0.00047679623821750283,
102          0.000840833701658994
103        ]
104      }
105    ]
106  },
107  "comparison": {
108    "delta_mean": 0.0005202519970453068,
109    "idea_wins": 0,
110    "n_pairs": 8,
111    "per_seed_diffs": [
112      0.00037253176560625434,
113      0.0002707121338971774,
114      0.0004631641822925303,
115      0.0008276183316411334,
116      0.00028572199880727567,
117      0.00029518952396756504,
118      0.001284642538848857,
119      0.00036243550130166113
120    ],
121    "p_value": 0.0081,
122    "mde": 0.00029926510858487807,
123    "mde_rel_pct": 2186.8426715023597,
124    "verdict": "idea worse (significant)",
125    "system_worked": false
126  },
127  "mechanism_signature": {
128    "prediction": "relaxation damps stochastic block-response updates approximately linearly in alpha",
129    "predicted_alpha": 0.75,
130    "observed_update_rms_mean": 0.0026733302263543613,
131    "observed_update_std_mean": 0.0019501892436788798,
132    "predicted_vs_observed_relation": "measured from trained rnn_small updates; no analytic/toy data used",
133    "confirmed": false,
134    "confirmation_note": "Not quantitatively confirmed: only one alpha was evaluated in the final trained-model signature, so linear alpha scaling was not tested."
135  },
136  "custom_track": null
137}