Poisson-Calibrated Candidate-Pool Scheduler / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "poisson_action_value",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01,
10 "n": 8
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "n": 8
17 },
18 "mean": 0.4739884063601494
19 },
20 {
21 "cfg": {
22 "lr": 0.001,
23 "n": 16
24 },
25 "mean": 0.4739884063601494
26 },
27 {
28 "cfg": {
29 "lr": 0.001,
30 "n": 32
31 },
32 "mean": 0.4739884063601494
33 },
34 {
35 "cfg": {
36 "lr": 0.001,
37 "n": 64
38 },
39 "mean": 0.4739884063601494
40 },
41 {
42 "cfg": {
43 "lr": 0.001,
44 "n": 128
45 },
46 "mean": 0.4739884063601494
47 },
48 {
49 "cfg": {
50 "lr": 0.003,
51 "n": 8
52 },
53 "mean": 0.2955882400274277
54 },
55 {
56 "cfg": {
57 "lr": 0.003,
58 "n": 16
59 },
60 "mean": 0.2955882400274277
61 },
62 {
63 "cfg": {
64 "lr": 0.003,
65 "n": 32
66 },
67 "mean": 0.2955882400274277
68 },
69 {
70 "cfg": {
71 "lr": 0.003,
72 "n": 64
73 },
74 "mean": 0.2955882400274277
75 },
76 {
77 "cfg": {
78 "lr": 0.003,
79 "n": 128
80 },
81 "mean": 0.2955882400274277
82 },
83 {
84 "cfg": {
85 "lr": 0.01,
86 "n": 8
87 },
88 "mean": 0.038012176752090454
89 },
90 {
91 "cfg": {
92 "lr": 0.01,
93 "n": 16
94 },
95 "mean": 0.038012176752090454
96 },
97 {
98 "cfg": {
99 "lr": 0.01,
100 "n": 32
101 },
102 "mean": 0.038012176752090454
103 },
104 {
105 "cfg": {
106 "lr": 0.01,
107 "n": 64
108 },
109 "mean": 0.038012176752090454
110 },
111 {
112 "cfg": {
113 "lr": 0.01,
114 "n": 128
115 },
116 "mean": 0.038012176752090454
117 }
118 ],
119 "full": {
120 "mean": 0.035623283591121435,
121 "std": 0.008640293958528833,
122 "per_seed": [
123 0.03652806580066681,
124 0.03965979069471359,
125 0.04228668659925461,
126 0.03357416391372681,
127 0.022456083446741104,
128 0.05217588320374489,
129 0.02869047038257122,
130 0.029615124687552452
131 ],
132 "n": 8
133 }
134 },
135 "idea": {
136 "mean": 0.035623283591121435,
137 "std": 0.008640293958528833,
138 "per_seed": [
139 0.03652806580066681,
140 0.03965979069471359,
141 0.04228668659925461,
142 0.03357416391372681,
143 0.022456083446741104,
144 0.05217588320374489,
145 0.02869047038257122,
146 0.029615124687552452
147 ],
148 "n": 8
149 },
150 "comparison": {
151 "delta_mean": 0.0,
152 "idea_wins": 0,
153 "n_pairs": 8,
154 "per_seed_diffs": [
155 0.0,
156 0.0,
157 0.0,
158 0.0,
159 0.0,
160 0.0,
161 0.0,
162 0.0
163 ],
164 "p_value": 1.0,
165 "mde": 0.0,
166 "mde_rel_pct": 0.0,
167 "verdict": "no measurable effect",
168 "system_worked": false
169 },
170 "mechanism_signature": {
171 "prediction": {
172 "quantity": "trained-model candidate action regret",
173 "kappa": 2.0,
174 "d": 2.0,
175 "slope": -1.0
176 },
177 "observed_slopes_per_seed": [
178 -0.7058185791140722,
179 -0.5139916507443746,
180 -0.48684283734935213,
181 -0.5550921083271281,
182 -0.3907645786398352,
183 -0.27029026113176285,
184 -0.4199711072919162,
185 -0.6079324563089579
186 ],
187 "observed_slope_mean": -0.4938379473634249,
188 "confirmed": false,
189 "note": "Signature uses trained critics; regret is not the primary benchmark metric.",
190 "scheduler_pool_sizes": [
191 64,
192 64,
193 64,
194 64,
195 32,
196 64,
197 64,
198 64
199 ],
200 "scheduler_pool_mean": 60.0,
201 "selected_idea_cfg": {
202 "lr": 0.01,
203 "epsilon": 0.03
204 },
205 "custom_track": {
206 "name": "poisson_action_value",
207 "file": "poisson_action_track.py",
208 "domain": "dynamics/control"
209 },
210 "idea_sweep": [
211 {
212 "cfg": {
213 "lr": 0.001,
214 "epsilon": 0.03
215 },
216 "mean": 0.45789623260498047
217 },
218 {
219 "cfg": {
220 "lr": 0.001,
221 "epsilon": 0.06
222 },
223 "mean": 0.45789623260498047
224 },
225 {
226 "cfg": {
227 "lr": 0.001,
228 "epsilon": 0.12
229 },
230 "mean": 0.45789623260498047
231 },
232 {
233 "cfg": {
234 "lr": 0.003,
235 "epsilon": 0.03
236 },
237 "mean": 0.25725509226322174
238 },
239 {
240 "cfg": {
241 "lr": 0.003,
242 "epsilon": 0.06
243 },
244 "mean": 0.25725509226322174
245 },
246 {
247 "cfg": {
248 "lr": 0.003,
249 "epsilon": 0.12
250 },
251 "mean": 0.25725509226322174
252 },
253 {
254 "cfg": {
255 "lr": 0.01,
256 "epsilon": 0.03
257 },
258 "mean": 0.035623283591121435
259 },
260 {
261 "cfg": {
262 "lr": 0.01,
263 "epsilon": 0.06
264 },
265 "mean": 0.035623283591121435
266 },
267 {
268 "cfg": {
269 "lr": 0.01,
270 "epsilon": 0.12
271 },
272 "mean": 0.035623283591121435
273 }
274 ],
275 "structural_match": "continuous-action control with a learned Q critic and isolated local action optimum"
276 }
277}