Observable-Reduced Neural World Model / bench_report.json

✓✓ Beats tuned baseline

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "epochs": 12
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 12
 17        },
 18        "mean": 0.0010860307957045734
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "epochs": 12
 24        },
 25        "mean": 0.0005809691647300497
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "epochs": 12
 31        },
 32        "mean": 0.0002912725685746409
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.0002669833438631031,
 37      "std": 8.681528355373122e-05,
 38      "per_seed": [
 39        0.00031876337016001344,
 40        0.0002849859884008765,
 41        0.00017326572560705245,
 42        0.0003880751901306212,
 43        0.00033014125074259937,
 44        0.0003085587522946298,
 45        0.00010380324238212779,
 46        0.000228273231186904
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "best_cfg": {
 53      "lr": 0.006,
 54      "epochs": 12,
 55      "penalty": 0.0
 56    },
 57    "sweep": [
 58      {
 59        "cfg": {
 60          "lr": 0.001,
 61          "epochs": 12,
 62          "penalty": 0.0
 63        },
 64        "mean": 1.0584739413843636e-06,
 65        "per_seed": [
 66          1.0828274525920278e-06,
 67          1.0643407222232781e-06,
 68          1.100200734072132e-06,
 69          1.1011246670022956e-06,
 70          1.0659464351192582e-06,
 71          1.0385464292994584e-06,
 72          1.0149252602786873e-06,
 73          9.99879830487771e-07
 74        ]
 75      },
 76      {
 77        "cfg": {
 78          "lr": 0.003,
 79          "epochs": 12,
 80          "penalty": 0.0
 81        },
 82        "mean": 7.993562256558562e-08,
 83        "per_seed": [
 84          6.861665013957463e-08,
 85          7.364582188529312e-08,
 86          9.95038575979379e-08,
 87          8.163866027643962e-08,
 88          8.44757082063552e-08,
 89          8.488292024821931e-08,
 90          7.652040068251154e-08,
 91          7.020096148835364e-08
 92        ]
 93      },
 94      {
 95        "cfg": {
 96          "lr": 0.006,
 97          "epochs": 12,
 98          "penalty": 0.0
 99        },
100        "mean": 5.279662751433989e-08,
101        "per_seed": [
102          4.7656406820806296e-08,
103          5.733669539154107e-08,
104          5.804359304306672e-08,
105          4.7830777560875504e-08,
106          5.6010112103876963e-08,
107          5.760812271660143e-08,
108          4.9883055908139795e-08,
109          4.800425656981133e-08
110        ]
111      }
112    ],
113    "mean": 5.279662751433989e-08,
114    "std": 4.5298604585404984e-09,
115    "per_seed": [
116      4.7656406820806296e-08,
117      5.733669539154107e-08,
118      5.804359304306672e-08,
119      4.7830777560875504e-08,
120      5.6010112103876963e-08,
121      5.760812271660143e-08,
122      4.9883055908139795e-08,
123      4.800425656981133e-08
124    ],
125    "n": 8
126  },
127  "comparison": {
128    "delta_mean": -0.00026693054723558873,
129    "idea_wins": 8,
130    "n_pairs": 8,
131    "per_seed_diffs": [
132      -0.00031871571375319263,
133      -0.000284928651705485,
134      -0.00017320768201400938,
135      -0.0003880273593530603,
136      -0.0003300852406304955,
137      -0.0003085011441719132,
138      -0.00010375335932621965,
139      -0.0002282252269303342
140    ],
141    "p_value": 0.0081,
142    "mde": 7.760323964174408e-05,
143    "mde_rel_pct": 29.066697015202376,
144    "verdict": "idea better (significant)",
145    "system_worked": true
146  },
147  "mechanism_signature": {
148    "prediction": "second-order structured dynamics improves extrapolative neural prediction",
149    "trained_model_signature": {
150      "output_target_corr_mean": 0.9999999671294927,
151      "output_rmse_mean": 0.00022956307111599017,
152      "confirmed": false,
153      "note": "This built-in task has no aggregate two-compartment ground truth, so the exact cy=beta*r invariant cannot be quantitatively retested."
154    },
155    "structural_match": "dynamics stability/control"
156  }
157}