Horizon-Adaptive Neural Tube Rollouts / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.001
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 0.8349032551050186
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.8359973579645157
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 0.8355543166399002
29 }
30 ],
31 "full": {
32 "mean": 0.7859984934329987,
33 "std": 0.07510655446575974,
34 "per_seed": [
35 0.8355869054794312,
36 0.7388775944709778,
37 0.8546704053878784,
38 0.9104781150817871,
39 0.7400559186935425,
40 0.7168379426002502,
41 0.8168118000030518,
42 0.6746692657470703
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.7857095971703529,
49 "std": 0.07640934958971482,
50 "per_seed": [
51 0.8372436761856079,
52 0.7375508546829224,
53 0.8549157381057739,
54 0.9125410914421082,
55 0.7379266023635864,
56 0.7164239287376404,
57 0.8165872693061829,
58 0.6724876165390015
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": -0.00028889626264572144,
64 "idea_wins": 5,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 0.0016567707061767578,
68 -0.00132673978805542,
69 0.0002453327178955078,
70 0.002062976360321045,
71 -0.0021293163299560547,
72 -0.0004140138626098633,
73 -0.00022453069686889648,
74 -0.0021816492080688477
75 ],
76 "p_value": 0.58005,
77 "mde": 0.0013284398908388765,
78 "mde_rel_pct": 0.16901303271418006,
79 "verdict": "no measurable effect",
80 "system_worked": false
81 },
82 "mechanism_signature": {
83 "quantity": "absolute local Jacobian gain vs finite-difference gain",
84 "predicted_mean": [
85 0.02751869708299637,
86 0.04405847191810608,
87 0.040442872792482376,
88 0.07109975069761276
89 ],
90 "observed_mean": [
91 0.019221652299165726,
92 0.029958780854940414,
93 0.018909338861703873,
94 0.0590406097471714
95 ],
96 "correlation": 0.9556240583468331,
97 "relative_error": 0.5613289126670399,
98 "confirmed": false
99 },
100 "idea_sweep": [
101 {
102 "cfg": {
103 "lr": 0.001,
104 "lam": 0.03
105 },
106 "result": {
107 "mean": 0.7859929502010345,
108 "std": 0.07511012743166294,
109 "per_seed": [
110 0.8355842232704163,
111 0.7388842105865479,
112 0.8546649217605591,
113 0.9104771614074707,
114 0.740043580532074,
115 0.7168059349060059,
116 0.8168159127235413,
117 0.6746676564216614
118 ],
119 "n": 8
120 }
121 },
122 {
123 "cfg": {
124 "lr": 0.003,
125 "lam": 0.03
126 },
127 "result": {
128 "mean": 0.7857807502150536,
129 "std": 0.07594789968969756,
130 "per_seed": [
131 0.8376532196998596,
132 0.7396882176399231,
133 0.8549769520759583,
134 0.9116700887680054,
135 0.738188624382019,
136 0.7167485356330872,
137 0.814774215221405,
138 0.6725461483001709
139 ],
140 "n": 8
141 }
142 },
143 {
144 "cfg": {
145 "lr": 0.006,
146 "lam": 0.03
147 },
148 "result": {
149 "mean": 0.7857095971703529,
150 "std": 0.07640934958971482,
151 "per_seed": [
152 0.8372436761856079,
153 0.7375508546829224,
154 0.8549157381057739,
155 0.9125410914421082,
156 0.7379266023635864,
157 0.7164239287376404,
158 0.8165872693061829,
159 0.6724876165390015
160 ],
161 "n": 8
162 }
163 }
164 ],
165 "budget": {
166 "epochs": 18,
167 "n_train": 400,
168 "n_test": 120,
169 "seeds": [
170 0,
171 1,
172 2,
173 3,
174 4,
175 5,
176 6,
177 7
178 ]
179 }
180}