Lag-Compensated Spectral Scheduler / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "weight_decay": 0.0
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "weight_decay": 0.0
17 },
18 "mean": 0.0720269184675999
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "weight_decay": 0.0
24 },
25 "mean": 0.0028564660606207326
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "weight_decay": 0.0
31 },
32 "mean": 0.00228094776684884
33 }
34 ],
35 "full": {
36 "mean": 0.00228094776684884,
37 "std": 0.0008615682293713639,
38 "per_seed": [
39 0.002221147296950221,
40 0.001970731420442462,
41 0.0013024760410189629,
42 0.0042177895084023476,
43 0.0020735678263008595,
44 0.0015317687066271901,
45 0.002943465718999505,
46 0.0019866356160491705
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "cfg": {
53 "lr": 0.006,
54 "weight_decay": 0.0,
55 "kappa": 8.0
56 },
57 "mean": 0.002070821574307047,
58 "std": 0.0007668985617216761,
59 "per_seed": [
60 0.0024689047131687403,
61 0.0014718936290591955,
62 0.0017854231409728527,
63 0.0037137719336897135,
64 0.0013458451721817255,
65 0.0012669704155996442,
66 0.0025451004039496183,
67 0.0019686631858348846
68 ],
69 "n": 8
70 },
71 "comparison": {
72 "delta_mean": -0.000210126192541793,
73 "delta_std": 0.0003877800102460661,
74 "p_value": 0.1702,
75 "diffs": [
76 0.0002477574162185192,
77 -0.0004988377913832664,
78 0.00048294709995388985,
79 -0.0005040175747126341,
80 -0.000727722654119134,
81 -0.00026479829102754593,
82 -0.0003983653150498867,
83 -1.797243021428585e-05
84 ]
85 },
86 "mechanism_signature": {
87 "math_check": {
88 "kappas": [
89 1,
90 2,
91 4,
92 8,
93 16
94 ],
95 "delays": [
96 0.9989999999999988,
97 0.4989999999999988,
98 0.24899999999999878,
99 0.12399999999999878,
100 0.062000000000001165
101 ],
102 "predicted_offset_slope": 1.0,
103 "fit_slope": 0.9997204301075259,
104 "r2": 0.9999997339246215,
105 "passed": true
106 },
107 "idea_sweep": [
108 {
109 "cfg": {
110 "lr": 0.006,
111 "weight_decay": 0.0,
112 "kappa": 2.0
113 },
114 "mean": 0.002092966591590084,
115 "std": 0.0007941076298383792,
116 "per_seed": [
117 0.0025941352359950542,
118 0.0013959517236799002,
119 0.0019340378930792212,
120 0.0037612225860357285,
121 0.0012745162239298224,
122 0.0012861500727012753,
123 0.0025039087049663067,
124 0.0019938102923333645
125 ],
126 "n": 8
127 },
128 {
129 "cfg": {
130 "lr": 0.006,
131 "weight_decay": 0.0,
132 "kappa": 4.0
133 },
134 "mean": 0.0020771025301655754,
135 "std": 0.0007748204332654841,
136 "per_seed": [
137 0.002521086484193802,
138 0.0014459786470979452,
139 0.0018341594841331244,
140 0.003721740795299411,
141 0.0013138779904693365,
142 0.001272903406061232,
143 0.0025291924830526114,
144 0.0019778809510171413
145 ],
146 "n": 8
147 },
148 {
149 "cfg": {
150 "lr": 0.006,
151 "weight_decay": 0.0,
152 "kappa": 8.0
153 },
154 "mean": 0.002070821574307047,
155 "std": 0.0007668985617216761,
156 "per_seed": [
157 0.0024689047131687403,
158 0.0014718936290591955,
159 0.0017854231409728527,
160 0.0037137719336897135,
161 0.0013458451721817255,
162 0.0012669704155996442,
163 0.0025451004039496183,
164 0.0019686631858348846
165 ],
166 "n": 8
167 }
168 ],
169 "comparison_recomputed": {
170 "delta_mean": -0.000210126192541793,
171 "delta_std": 0.0003877800102460661,
172 "p_value": 0.1702,
173 "diffs": [
174 0.0002477574162185192,
175 -0.0004988377913832664,
176 0.00048294709995388985,
177 -0.0005040175747126341,
178 -0.000727722654119134,
179 -0.00026479829102754593,
180 -0.0003983653150498867,
181 -1.797243021428585e-05
182 ]
183 },
184 "mechanism_signature": {
185 "prediction": "lag delay scales as 1/kappa and positive feed-forward compensation reduces it",
186 "trained_model_measurements": [
187 {
188 "kappa": 2.0,
189 "baseline_cross_step": 1.0,
190 "idea_cross_step": 1.0,
191 "observed_mean_effective_gap": 0.0
192 },
193 {
194 "kappa": 4.0,
195 "baseline_cross_step": 1.0,
196 "idea_cross_step": 1.0,
197 "observed_mean_effective_gap": 0.0
198 },
199 {
200 "kappa": 8.0,
201 "baseline_cross_step": 1.0,
202 "idea_cross_step": 1.0,
203 "observed_mean_effective_gap": 0.0
204 }
205 ],
206 "confirmed": false,
207 "reason": "No reliable local-growth threshold crossing was observed consistently in the trained dynamics runs; therefore the NN-scale quantitative claim is not confirmed."
208 }
209 }
210}