Certified Tube Wrapper for Learned Predictive Control / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.0016004437929950655
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.0008657508878968656
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 0.0003360401788086165
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.00029742292554146843,
 33      "std": 0.00012590863545935686,
 34      "per_seed": [
 35        0.0004953785100951791,
 36        0.0003386490570846945,
 37        0.0002134958194801584,
 38        0.0002966373285744339,
 39        0.0001490332215325907,
 40        0.00031617036438547075,
 41        0.0001173576238215901,
 42        0.00045266147935763
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.00031140187456912827,
 49    "std": 0.00012528404252057512,
 50    "per_seed": [
 51      0.0005046091391704977,
 52      0.00035253993701189756,
 53      0.00023353651340585202,
 54      0.00032840640051290393,
 55      0.00015706471458543092,
 56      0.00032477168133482337,
 57      0.00012830838386435062,
 58      0.00046197822666727006
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": 1.3978949027659837e-05,
 64    "idea_wins": 0,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      9.230629075318575e-06,
 68      1.389087992720306e-05,
 69      2.004069392569363e-05,
 70      3.1769071938470006e-05,
 71      8.031493052840233e-06,
 72      8.601316949352622e-06,
 73      1.0950760042760521e-05,
 74      9.31674730964005e-06
 75    ],
 76    "p_value": 0.0081,
 77    "mde": 6.858680107943e-06,
 78    "mde_rel_pct": 2.3060361253109667,
 79    "verdict": "idea worse (significant)",
 80    "system_worked": false
 81  },
 82  "mechanism_signature": {
 83    "best_idea_cfg": {
 84      "lr": 0.01,
 85      "lambda": 0.02
 86    },
 87    "all_idea_settings": {
 88      "0.001": {
 89        "mean": 0.0016261089622275904,
 90        "std": 0.00047570904542975056,
 91        "per_seed": [
 92          0.0012551955878734589,
 93          0.0012359732063487172,
 94          0.0015323605621233582,
 95          0.002465372672304511,
 96          0.001136873965151608,
 97          0.0012831705389544368,
 98          0.001836425275541842,
 99          0.002263499889522791
100        ],
101        "n": 8
102      },
103      "0.003": {
104        "mean": 0.0008687566078151576,
105        "std": 0.0002024636252280242,
106        "per_seed": [
107          0.0008179493015632033,
108          0.0007614863570779562,
109          0.0006751477485522628,
110          0.001272146706469357,
111          0.0006523997872136533,
112          0.0007431273115798831,
113          0.0009471484227105975,
114          0.0010806472273543477
115        ],
116        "n": 8
117      },
118      "0.01": {
119        "mean": 0.00031140187456912827,
120        "std": 0.00012528404252057512,
121        "per_seed": [
122          0.0005046091391704977,
123          0.00035253993701189756,
124          0.00023353651340585202,
125          0.00032840640051290393,
126          0.00015706471458543092,
127          0.00032477168133482337,
128          0.00012830838386435062,
129          0.00046197822666727006
130        ],
131        "n": 8
132      }
133    },
134    "custom_track": null,
135    "signature": {
136      "prediction": "horizon weighting produces a finite, measured sensitivity proxy",
137      "observed": [
138        {
139          "seed": 0,
140          "observed_jacobian_abs": 0.047531094402074814,
141          "tube_weighted_observed": 0.039783747423522677
142        },
143        {
144          "seed": 1,
145          "observed_jacobian_abs": 0.046463221311569214,
146          "tube_weighted_observed": 0.03905660488809137
147        },
148        {
149          "seed": 2,
150          "observed_jacobian_abs": 0.04596756026148796,
151          "tube_weighted_observed": 0.04002308358438155
152        },
153        {
154          "seed": 3,
155          "observed_jacobian_abs": 0.0467328242957592,
156          "tube_weighted_observed": 0.040204589420798326
157        }
158      ],
159      "predicted_vs_observed_ratio": 0.852146210300268,
160      "confirmed": false
161    }
162  },
163  "protocol_notes": {
164    "paired_seeds": [
165      0,
166      1,
167      2,
168      3,
169      4,
170      5,
171      6,
172      7
173    ],
174    "epochs": 12,
175    "n_train": 800,
176    "n_test": 200,
177    "structural_match": "dynamics/control",
178    "baseline_grid_equals_idea_union": true
179  }
180}