{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.0011108634498668835 }, { "cfg": { "lr": 0.003 }, "mean": 0.0008105679735308513 }, { "cfg": { "lr": 0.006 }, "mean": 0.000628942609182559 } ], "full": { "mean": 0.0005640739254886284, "std": 0.0001367984084942288, "per_seed": [ 0.00048537924885749817, 0.0007160367094911635, 0.000499650021083653, 0.0008147044572979212, 0.0004540993832051754, 0.0005191828240640461, 0.0003816201351583004, 0.0006419186247512698 ], "n": 8 } }, "idea": { "mean": 0.0005420081324700732, "std": 0.00013960018191357758, "per_seed": [ 0.000509127858094871, 0.0005584119935519993, 0.000469617429189384, 0.0008545061573386192, 0.00044199760304763913, 0.0003986096999142319, 0.00044967373833060265, 0.0006541205802932382 ], "n": 8, "best_cfg": { "lr": 0.006, "alpha": 2.0, "beta": 0.9, "sigma": 0.05 }, "sweep": [ { "cfg": { "lr": 0.0015, "alpha": 1.0, "beta": 0.9, "sigma": 0.05 }, "mean": 0.0013087970073684119 }, { "cfg": { "lr": 0.003, "alpha": 1.5, "beta": 0.9, "sigma": 0.05 }, "mean": 0.0008830113292788155 }, { "cfg": { "lr": 0.006, "alpha": 2.0, "beta": 0.9, "sigma": 0.05 }, "mean": 0.0005420081324700732 } ] }, "comparison": { "delta_mean": -2.206579301855527e-05, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 2.3748609237372875e-05, -0.00015762471593916416, -3.003259189426899e-05, 3.980170004069805e-05, -1.2101780157536268e-05, -0.00012057312414981425, 6.805360317230225e-05, 1.2201955541968346e-05 ], "p_value": 0.44995, "mde": 6.588809659856915e-05, "mde_rel_pct": 11.680755592716622, "verdict": "no significant win", "system_worked": false }, "protocol_notes": { "epochs": 8, "n_train": 1200, "n_test": 400, "batch": 128, "track_choice": "dynamics matches stability/control and multi-step pendulum rollouts", "idea": "residual-adaptive candidate trajectory sampling", "lr_union": [ 0.0015, 0.003, 0.006 ] }, "mechanism_signature": { "prediction": "larger trained-model observed residual induces larger temperature and flatter candidate weights", "observed_residual_mean": 0.01952467652328778, "observed_residual_p90": 0.03243881464004517, "observed_ESS_low_residual": 25.594260510103627, "observed_ESS_high_residual": 28.17312607209512, "ESS_ratio_high_over_low": 1.1007595261825773, "confirmed": true } }