Disturbance-Augmented Neural State Space / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.0008744152291910723
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.00035537157964427024
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 7.588289918203373e-05
 29      }
 30    ],
 31    "full": {
 32      "mean": 5.398313965088164e-05,
 33      "std": 3.768574167715651e-05,
 34      "per_seed": [
 35        0.00014210454537533224,
 36        8.642885950393975e-05,
 37        3.601220669224858e-05,
 38        3.8985985156614333e-05,
 39        3.007560189871583e-05,
 40        2.608529757708311e-05,
 41        3.445964102866128e-05,
 42        3.7712979974457994e-05
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 5.941226436334546e-05,
 49    "std": 3.632683313745886e-05,
 50    "per_seed": [
 51      0.00013875614968128502,
 52      9.052902169059962e-05,
 53      4.0280890971189365e-05,
 54      7.056006870698184e-05,
 55      4.287416595616378e-05,
 56      2.4914010282373056e-05,
 57      3.082741386606358e-05,
 58      3.65563937521074e-05
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": 5.4291247124638176e-06,
 64    "idea_wins": 4,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      -3.3483956940472126e-06,
 68      4.1001621866598725e-06,
 69      4.268684278940782e-06,
 70      3.1574083550367504e-05,
 71      1.2798564057447948e-05,
 72      -1.171287294710055e-06,
 73      -3.632227162597701e-06,
 74      -1.1565862223505974e-06
 75    ],
 76    "p_value": 0.2879,
 77    "mde": 9.929129282104334e-06,
 78    "mde_rel_pct": 18.393019276606996,
 79    "verdict": "no significant win",
 80    "system_worked": false
 81  },
 82  "mechanism_signature": {
 83    "math_sanity": {
 84      "persistence": [
 85        {
 86          "rho": 0.5,
 87          "max_abs_error": 0.0,
 88          "half_life_pred": 1.0,
 89          "half_life_observed_first_integer": 1
 90        },
 91        {
 92          "rho": 0.9,
 93          "max_abs_error": 1.1102230246251565e-16,
 94          "half_life_pred": 6.578813478960585,
 95          "half_life_observed_first_integer": 7
 96        },
 97        {
 98          "rho": 0.99,
 99          "max_abs_error": 1.1102230246251565e-16,
100          "half_life_pred": 68.96756393652842,
101          "half_life_observed_first_integer": null
102        }
103      ],
104      "stability": {
105        "analytic_upper_gain": 2.4390243902439024,
106        "observed_grid_upper_gain": 2.439,
107        "boundary_abs_error": 2.4390243902328024e-05
108      }
109    },
110    "idea_sweep": [
111      {
112        "cfg": {
113          "lr": 0.001,
114          "rho": 0.99
115        },
116        "mean": 0.0008760937489569187
117      },
118      {
119        "cfg": {
120          "lr": 0.003,
121          "rho": 0.99
122        },
123        "mean": 0.00036263404035707936
124      },
125      {
126        "cfg": {
127          "lr": 0.01,
128          "rho": 0.99
129        },
130        "mean": 8.503153276251396e-05
131      }
132    ],
133    "selected_idea_cfg": {
134      "lr": 0.01,
135      "rho": 0.99
136    },
137    "trained_model": {
138      "test_constant_bias": 0.25,
139      "baseline_mean_abs_error": 0.24970409274101257,
140      "idea_mean_abs_error": 0.25242429971694946,
141      "bias_error_reduction_fraction": -0.010893722029451158,
142      "confirmed": false,
143      "note": "trained benchmark models evaluated on perturbed targets; not the primary metric"
144    }
145  },
146  "protocol_notes": {
147    "structural_match": "dynamics: controlled pendulum rollout",
148    "paired_seeds": [
149      0,
150      1,
151      2,
152      3,
153      4,
154      5,
155      6,
156      7
157    ],
158    "budget": {
159      "epochs": 18,
160      "batch": 128,
161      "n_train": 1200,
162      "n_test": 400
163    },
164    "baseline_and_idea_lr_union": [
165      0.001,
166      0.003,
167      0.01
168    ]
169  }
170}