Adaptive reset neural ODE / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 0.001864717691205442
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.0010901302302954718
23 },
24 {
25 "cfg": {
26 "lr": 0.01
27 },
28 "mean": 0.0006186682076076977
29 }
30 ],
31 "full": {
32 "mean": 0.00054517226817552,
33 "std": 0.00020361842727135583,
34 "per_seed": [
35 0.0004930912400595844,
36 0.0004765945195686072,
37 0.0004673648509196937,
38 0.0010376222198829055,
39 0.000511663849465549,
40 0.00027233464061282575,
41 0.0005571767687797546,
42 0.0005455300561152399
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.07319906074553728,
49 "std": 0.03402286097230311,
50 "per_seed": [
51 0.056350141763687134,
52 0.08426478505134583,
53 0.052617624402046204,
54 0.06809338182210922,
55 0.04265451803803444,
56 0.04711783304810524,
57 0.07909751683473587,
58 0.15539668500423431
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": 0.07265388847736176,
64 "idea_wins": 0,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 0.05585705052362755,
68 0.08378819053177722,
69 0.05215025955112651,
70 0.06705575960222632,
71 0.04214285418856889,
72 0.046845498407492414,
73 0.07854034006595612,
74 0.15485115494811907
75 ],
76 "p_value": 0.0081,
77 "mde": 0.030388641902834822,
78 "mde_rel_pct": 5574.135677248187,
79 "verdict": "idea worse (significant)",
80 "system_worked": false
81 },
82 "mechanism_signature": {
83 "math_sanity": {
84 "formula": "q95(|exp(.5s)-exp(.35s)| |x0|)",
85 "rows": [
86 {
87 "epsilon": 0.01,
88 "predicted": 0.055187317647128684,
89 "observed": 0.056,
90 "abs_error": 0.0008126823528713176
91 },
92 {
93 "epsilon": 0.03,
94 "predicted": 0.15844985968729142,
95 "observed": 0.16,
96 "abs_error": 0.0015501403127085867
97 },
98 {
99 "epsilon": 0.08,
100 "predicted": 0.3838849584642059,
101 "observed": 0.384,
102 "abs_error": 0.00011504153579411369
103 }
104 ],
105 "passed": true
106 },
107 "trained_model_signature": {
108 "prediction": "local q95 flow error should remain near epsilon before reset",
109 "observed_mean_q95_by_window": [
110 0.41497564166784273,
111 0.4705420028418301,
112 NaN,
113 NaN,
114 NaN,
115 NaN,
116 NaN,
117 NaN,
118 NaN,
119 NaN
120 ],
121 "epsilon": 0.1,
122 "confirmed": false
123 },
124 "idea_config_grid": [
125 {
126 "lr": 0.001
127 },
128 {
129 "lr": 0.003
130 },
131 {
132 "lr": 0.01
133 }
134 ],
135 "idea_meta": {
136 "0": {
137 "windows": 2,
138 "q95_errors": [
139 0.20428025126457203,
140 0.43705364465713503
141 ],
142 "epsilon": 0.1
143 },
144 "1": {
145 "windows": 2,
146 "q95_errors": [
147 0.5327116042375563,
148 0.5056339323520659
149 ],
150 "epsilon": 0.1
151 },
152 "2": {
153 "windows": 2,
154 "q95_errors": [
155 0.28441762030124623,
156 0.4018018126487727
157 ],
158 "epsilon": 0.1
159 },
160 "3": {
161 "windows": 2,
162 "q95_errors": [
163 0.5256956934928891,
164 0.401323390007019
165 ],
166 "epsilon": 0.1
167 },
168 "4": {
169 "windows": 2,
170 "q95_errors": [
171 0.1993324041366577,
172 0.3880627930164337
173 ],
174 "epsilon": 0.1
175 },
176 "5": {
177 "windows": 2,
178 "q95_errors": [
179 0.4679859936237335,
180 0.3935546219348907
181 ],
182 "epsilon": 0.1
183 },
184 "6": {
185 "windows": 2,
186 "q95_errors": [
187 0.4792444229125976,
188 0.5255674421787261
189 ],
190 "epsilon": 0.1
191 },
192 "7": {
193 "windows": 2,
194 "q95_errors": [
195 0.6261371433734889,
196 0.7113383859395978
197 ],
198 "epsilon": 0.1
199 }
200 }
201 }
202}