Poisson-Calibrated Candidate-Pool Scheduler / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "poisson_action_value",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "n": 8
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "n": 8
 17        },
 18        "mean": 0.4739884063601494
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.001,
 23          "n": 16
 24        },
 25        "mean": 0.4739884063601494
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.001,
 30          "n": 32
 31        },
 32        "mean": 0.4739884063601494
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.001,
 37          "n": 64
 38        },
 39        "mean": 0.4739884063601494
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.001,
 44          "n": 128
 45        },
 46        "mean": 0.4739884063601494
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.003,
 51          "n": 8
 52        },
 53        "mean": 0.2955882400274277
 54      },
 55      {
 56        "cfg": {
 57          "lr": 0.003,
 58          "n": 16
 59        },
 60        "mean": 0.2955882400274277
 61      },
 62      {
 63        "cfg": {
 64          "lr": 0.003,
 65          "n": 32
 66        },
 67        "mean": 0.2955882400274277
 68      },
 69      {
 70        "cfg": {
 71          "lr": 0.003,
 72          "n": 64
 73        },
 74        "mean": 0.2955882400274277
 75      },
 76      {
 77        "cfg": {
 78          "lr": 0.003,
 79          "n": 128
 80        },
 81        "mean": 0.2955882400274277
 82      },
 83      {
 84        "cfg": {
 85          "lr": 0.01,
 86          "n": 8
 87        },
 88        "mean": 0.038012176752090454
 89      },
 90      {
 91        "cfg": {
 92          "lr": 0.01,
 93          "n": 16
 94        },
 95        "mean": 0.038012176752090454
 96      },
 97      {
 98        "cfg": {
 99          "lr": 0.01,
100          "n": 32
101        },
102        "mean": 0.038012176752090454
103      },
104      {
105        "cfg": {
106          "lr": 0.01,
107          "n": 64
108        },
109        "mean": 0.038012176752090454
110      },
111      {
112        "cfg": {
113          "lr": 0.01,
114          "n": 128
115        },
116        "mean": 0.038012176752090454
117      }
118    ],
119    "full": {
120      "mean": 0.035623283591121435,
121      "std": 0.008640293958528833,
122      "per_seed": [
123        0.03652806580066681,
124        0.03965979069471359,
125        0.04228668659925461,
126        0.03357416391372681,
127        0.022456083446741104,
128        0.05217588320374489,
129        0.02869047038257122,
130        0.029615124687552452
131      ],
132      "n": 8
133    }
134  },
135  "idea": {
136    "mean": 0.035623283591121435,
137    "std": 0.008640293958528833,
138    "per_seed": [
139      0.03652806580066681,
140      0.03965979069471359,
141      0.04228668659925461,
142      0.03357416391372681,
143      0.022456083446741104,
144      0.05217588320374489,
145      0.02869047038257122,
146      0.029615124687552452
147    ],
148    "n": 8
149  },
150  "comparison": {
151    "delta_mean": 0.0,
152    "idea_wins": 0,
153    "n_pairs": 8,
154    "per_seed_diffs": [
155      0.0,
156      0.0,
157      0.0,
158      0.0,
159      0.0,
160      0.0,
161      0.0,
162      0.0
163    ],
164    "p_value": 1.0,
165    "mde": 0.0,
166    "mde_rel_pct": 0.0,
167    "verdict": "no measurable effect",
168    "system_worked": false
169  },
170  "mechanism_signature": {
171    "prediction": {
172      "quantity": "trained-model candidate action regret",
173      "kappa": 2.0,
174      "d": 2.0,
175      "slope": -1.0
176    },
177    "observed_slopes_per_seed": [
178      -0.7058185791140722,
179      -0.5139916507443746,
180      -0.48684283734935213,
181      -0.5550921083271281,
182      -0.3907645786398352,
183      -0.27029026113176285,
184      -0.4199711072919162,
185      -0.6079324563089579
186    ],
187    "observed_slope_mean": -0.4938379473634249,
188    "confirmed": false,
189    "note": "Signature uses trained critics; regret is not the primary benchmark metric.",
190    "scheduler_pool_sizes": [
191      64,
192      64,
193      64,
194      64,
195      32,
196      64,
197      64,
198      64
199    ],
200    "scheduler_pool_mean": 60.0,
201    "selected_idea_cfg": {
202      "lr": 0.01,
203      "epsilon": 0.03
204    },
205    "custom_track": {
206      "name": "poisson_action_value",
207      "file": "poisson_action_track.py",
208      "domain": "dynamics/control"
209    },
210    "idea_sweep": [
211      {
212        "cfg": {
213          "lr": 0.001,
214          "epsilon": 0.03
215        },
216        "mean": 0.45789623260498047
217      },
218      {
219        "cfg": {
220          "lr": 0.001,
221          "epsilon": 0.06
222        },
223        "mean": 0.45789623260498047
224      },
225      {
226        "cfg": {
227          "lr": 0.001,
228          "epsilon": 0.12
229        },
230        "mean": 0.45789623260498047
231      },
232      {
233        "cfg": {
234          "lr": 0.003,
235          "epsilon": 0.03
236        },
237        "mean": 0.25725509226322174
238      },
239      {
240        "cfg": {
241          "lr": 0.003,
242          "epsilon": 0.06
243        },
244        "mean": 0.25725509226322174
245      },
246      {
247        "cfg": {
248          "lr": 0.003,
249          "epsilon": 0.12
250        },
251        "mean": 0.25725509226322174
252      },
253      {
254        "cfg": {
255          "lr": 0.01,
256          "epsilon": 0.03
257        },
258        "mean": 0.035623283591121435
259      },
260      {
261        "cfg": {
262          "lr": 0.01,
263          "epsilon": 0.06
264        },
265        "mean": 0.035623283591121435
266      },
267      {
268        "cfg": {
269          "lr": 0.01,
270          "epsilon": 0.12
271        },
272        "mean": 0.035623283591121435
273      }
274    ],
275    "structural_match": "continuous-action control with a learned Q critic and isolated local action optimum"
276  }
277}