Certified Tube Wrapper for Learned Predictive Control / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 0.0016004437929950655
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.0008657508878968656
23 },
24 {
25 "cfg": {
26 "lr": 0.01
27 },
28 "mean": 0.0003360401788086165
29 }
30 ],
31 "full": {
32 "mean": 0.00029742292554146843,
33 "std": 0.00012590863545935686,
34 "per_seed": [
35 0.0004953785100951791,
36 0.0003386490570846945,
37 0.0002134958194801584,
38 0.0002966373285744339,
39 0.0001490332215325907,
40 0.00031617036438547075,
41 0.0001173576238215901,
42 0.00045266147935763
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.00031140187456912827,
49 "std": 0.00012528404252057512,
50 "per_seed": [
51 0.0005046091391704977,
52 0.00035253993701189756,
53 0.00023353651340585202,
54 0.00032840640051290393,
55 0.00015706471458543092,
56 0.00032477168133482337,
57 0.00012830838386435062,
58 0.00046197822666727006
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": 1.3978949027659837e-05,
64 "idea_wins": 0,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 9.230629075318575e-06,
68 1.389087992720306e-05,
69 2.004069392569363e-05,
70 3.1769071938470006e-05,
71 8.031493052840233e-06,
72 8.601316949352622e-06,
73 1.0950760042760521e-05,
74 9.31674730964005e-06
75 ],
76 "p_value": 0.0081,
77 "mde": 6.858680107943e-06,
78 "mde_rel_pct": 2.3060361253109667,
79 "verdict": "idea worse (significant)",
80 "system_worked": false
81 },
82 "mechanism_signature": {
83 "best_idea_cfg": {
84 "lr": 0.01,
85 "lambda": 0.02
86 },
87 "all_idea_settings": {
88 "0.001": {
89 "mean": 0.0016261089622275904,
90 "std": 0.00047570904542975056,
91 "per_seed": [
92 0.0012551955878734589,
93 0.0012359732063487172,
94 0.0015323605621233582,
95 0.002465372672304511,
96 0.001136873965151608,
97 0.0012831705389544368,
98 0.001836425275541842,
99 0.002263499889522791
100 ],
101 "n": 8
102 },
103 "0.003": {
104 "mean": 0.0008687566078151576,
105 "std": 0.0002024636252280242,
106 "per_seed": [
107 0.0008179493015632033,
108 0.0007614863570779562,
109 0.0006751477485522628,
110 0.001272146706469357,
111 0.0006523997872136533,
112 0.0007431273115798831,
113 0.0009471484227105975,
114 0.0010806472273543477
115 ],
116 "n": 8
117 },
118 "0.01": {
119 "mean": 0.00031140187456912827,
120 "std": 0.00012528404252057512,
121 "per_seed": [
122 0.0005046091391704977,
123 0.00035253993701189756,
124 0.00023353651340585202,
125 0.00032840640051290393,
126 0.00015706471458543092,
127 0.00032477168133482337,
128 0.00012830838386435062,
129 0.00046197822666727006
130 ],
131 "n": 8
132 }
133 },
134 "custom_track": null,
135 "signature": {
136 "prediction": "horizon weighting produces a finite, measured sensitivity proxy",
137 "observed": [
138 {
139 "seed": 0,
140 "observed_jacobian_abs": 0.047531094402074814,
141 "tube_weighted_observed": 0.039783747423522677
142 },
143 {
144 "seed": 1,
145 "observed_jacobian_abs": 0.046463221311569214,
146 "tube_weighted_observed": 0.03905660488809137
147 },
148 {
149 "seed": 2,
150 "observed_jacobian_abs": 0.04596756026148796,
151 "tube_weighted_observed": 0.04002308358438155
152 },
153 {
154 "seed": 3,
155 "observed_jacobian_abs": 0.0467328242957592,
156 "tube_weighted_observed": 0.040204589420798326
157 }
158 ],
159 "predicted_vs_observed_ratio": 0.852146210300268,
160 "confirmed": false
161 }
162 },
163 "protocol_notes": {
164 "paired_seeds": [
165 0,
166 1,
167 2,
168 3,
169 4,
170 5,
171 6,
172 7
173 ],
174 "epochs": 12,
175 "n_train": 800,
176 "n_test": 200,
177 "structural_match": "dynamics/control",
178 "baseline_grid_equals_idea_union": true
179 }
180}