{ "bench_version": 1, "track": "poisson_action_value", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "n": 8 }, "sweep": [ { "cfg": { "lr": 0.001, "n": 8 }, "mean": 0.4739884063601494 }, { "cfg": { "lr": 0.001, "n": 16 }, "mean": 0.4739884063601494 }, { "cfg": { "lr": 0.001, "n": 32 }, "mean": 0.4739884063601494 }, { "cfg": { "lr": 0.001, "n": 64 }, "mean": 0.4739884063601494 }, { "cfg": { "lr": 0.001, "n": 128 }, "mean": 0.4739884063601494 }, { "cfg": { "lr": 0.003, "n": 8 }, "mean": 0.2955882400274277 }, { "cfg": { "lr": 0.003, "n": 16 }, "mean": 0.2955882400274277 }, { "cfg": { "lr": 0.003, "n": 32 }, "mean": 0.2955882400274277 }, { "cfg": { "lr": 0.003, "n": 64 }, "mean": 0.2955882400274277 }, { "cfg": { "lr": 0.003, "n": 128 }, "mean": 0.2955882400274277 }, { "cfg": { "lr": 0.01, "n": 8 }, "mean": 0.038012176752090454 }, { "cfg": { "lr": 0.01, "n": 16 }, "mean": 0.038012176752090454 }, { "cfg": { "lr": 0.01, "n": 32 }, "mean": 0.038012176752090454 }, { "cfg": { "lr": 0.01, "n": 64 }, "mean": 0.038012176752090454 }, { "cfg": { "lr": 0.01, "n": 128 }, "mean": 0.038012176752090454 } ], "full": { "mean": 0.035623283591121435, "std": 0.008640293958528833, "per_seed": [ 0.03652806580066681, 0.03965979069471359, 0.04228668659925461, 0.03357416391372681, 0.022456083446741104, 0.05217588320374489, 0.02869047038257122, 0.029615124687552452 ], "n": 8 } }, "idea": { "mean": 0.035623283591121435, "std": 0.008640293958528833, "per_seed": [ 0.03652806580066681, 0.03965979069471359, 0.04228668659925461, 0.03357416391372681, 0.022456083446741104, 0.05217588320374489, 0.02869047038257122, 0.029615124687552452 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": { "quantity": "trained-model candidate action regret", "kappa": 2.0, "d": 2.0, "slope": -1.0 }, "observed_slopes_per_seed": [ -0.7058185791140722, -0.5139916507443746, -0.48684283734935213, -0.5550921083271281, -0.3907645786398352, -0.27029026113176285, -0.4199711072919162, -0.6079324563089579 ], "observed_slope_mean": -0.4938379473634249, "confirmed": false, "note": "Signature uses trained critics; regret is not the primary benchmark metric.", "scheduler_pool_sizes": [ 64, 64, 64, 64, 32, 64, 64, 64 ], "scheduler_pool_mean": 60.0, "selected_idea_cfg": { "lr": 0.01, "epsilon": 0.03 }, "custom_track": { "name": "poisson_action_value", "file": "poisson_action_track.py", "domain": "dynamics/control" }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epsilon": 0.03 }, "mean": 0.45789623260498047 }, { "cfg": { "lr": 0.001, "epsilon": 0.06 }, "mean": 0.45789623260498047 }, { "cfg": { "lr": 0.001, "epsilon": 0.12 }, "mean": 0.45789623260498047 }, { "cfg": { "lr": 0.003, "epsilon": 0.03 }, "mean": 0.25725509226322174 }, { "cfg": { "lr": 0.003, "epsilon": 0.06 }, "mean": 0.25725509226322174 }, { "cfg": { "lr": 0.003, "epsilon": 0.12 }, "mean": 0.25725509226322174 }, { "cfg": { "lr": 0.01, "epsilon": 0.03 }, "mean": 0.035623283591121435 }, { "cfg": { "lr": 0.01, "epsilon": 0.06 }, "mean": 0.035623283591121435 }, { "cfg": { "lr": 0.01, "epsilon": 0.12 }, "mean": 0.035623283591121435 } ], "structural_match": "continuous-action control with a learned Q critic and isolated local action optimum" } }