Horizon-Dependent Error Tubes for Recurrent Rollouts / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "weight_decay": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "weight_decay": 0.0
 17        },
 18        "mean": 0.0013744574098382145
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "weight_decay": 0.0
 24        },
 25        "mean": 0.000780427159043029
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "weight_decay": 0.0
 31        },
 32        "mean": 0.0005478621314978227
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.003,
 37          "weight_decay": 0.0001
 38        },
 39        "mean": 0.000764783937484026
 40      }
 41    ],
 42    "full": {
 43      "mean": 0.0005283926293486729,
 44      "std": 7.134857758396706e-05,
 45      "per_seed": [
 46        0.0005298908217810094,
 47        0.000657333992421627,
 48        0.0004259757697582245,
 49        0.0005782479420304298,
 50        0.0004904285888187587,
 51        0.0005300926859490573,
 52        0.0004412077250890434,
 53        0.0005739635089412332
 54      ],
 55      "n": 8
 56    }
 57  },
 58  "idea": {
 59    "mean": 0.00046641508015454747,
 60    "std": 0.00013948062290217747,
 61    "per_seed": [
 62      0.0004731847729999572,
 63      0.000537174753844738,
 64      0.0004555774212349206,
 65      0.0007837752345949411,
 66      0.0003692372119985521,
 67      0.0003401216818019748,
 68      0.00031041333568282425,
 69      0.00046183622907847166
 70    ],
 71    "n": 8
 72  },
 73  "comparison": {
 74    "delta_mean": -6.197754919412546e-05,
 75    "idea_wins": 6,
 76    "n_pairs": 8,
 77    "per_seed_diffs": [
 78      -5.670604878105223e-05,
 79      -0.00012015923857688904,
 80      2.9601651476696134e-05,
 81      0.0002055272925645113,
 82      -0.00012119137682020664,
 83      -0.00018997100414708257,
 84      -0.00013079438940621912,
 85      -0.0001121272798627615
 86    ],
 87    "p_value": 0.19985,
 88    "mde": 0.00010505434796975666,
 89    "mde_rel_pct": 19.88187233028831,
 90    "verdict": "no significant win",
 91    "system_worked": false
 92  },
 93  "mechanism_signature": {
 94    "observed_hidden_change_mean": 0.03364631673321128,
 95    "predicted_tube_mean": 0.021336639765650034,
 96    "ratio_observed_over_predicted": 1.5819950263955864,
 97    "confirmed": true
 98  },
 99  "idea_sweep": [
100    {
101      "cfg": {
102        "lr": 0.006,
103        "weight_decay": 0.0
104      },
105      "mean": 0.00046641508015454747
106    },
107    {
108      "cfg": {
109        "lr": 0.003,
110        "weight_decay": 0.0
111      },
112      "mean": 0.0007662241696380079
113    },
114    {
115      "cfg": {
116        "lr": 0.001,
117        "weight_decay": 0.0
118      },
119      "mean": 0.0014701381151098758
120    }
121  ],
122  "idea_best_cfg": {
123    "lr": 0.006,
124    "weight_decay": 0.0
125  },
126  "protocol_notes": "Baseline and idea use matched 64-unit GRU systems, same data, epochs, batch, optimizer, and shared lr/weight-decay grid; idea tested at three shared settings."
127}