{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "wd": 0.0 }, "sweep": [ { "cfg": { "lr": 0.0015, "wd": 0.0 }, "mean": 0.00032828053372213617 }, { "cfg": { "lr": 0.0015, "wd": 0.0001 }, "mean": 0.0004147848885622807 }, { "cfg": { "lr": 0.003, "wd": 0.0 }, "mean": 4.9621185098658316e-05 }, { "cfg": { "lr": 0.003, "wd": 0.0001 }, "mean": 0.00020817978656850755 }, { "cfg": { "lr": 0.006, "wd": 0.0 }, "mean": 2.345215943932999e-05 }, { "cfg": { "lr": 0.006, "wd": 0.0001 }, "mean": 0.00010142060364159988 } ], "full": { "mean": 2.282289460708853e-05, "std": 2.305330446600017e-06, "per_seed": [ 2.4922346710809506e-05, 2.6788266040966846e-05, 1.934224746946711e-05, 2.2755777536076494e-05, 2.3468126528314315e-05, 2.385292282269802e-05, 2.0721481632790528e-05, 2.073198811558541e-05 ], "n": 8 } }, "idea": { "mean": 4.757533133670222e-05, "std": 2.1643697598220244e-05, "per_seed": [ 9.76939991232939e-05, 3.8501457311213017e-05, 3.3765736588975415e-05, 2.9315116989891976e-05, 6.082628169679083e-05, 5.370224607759155e-05, 3.0736955523025244e-05, 3.606085738283582e-05 ], "n": 8 }, "comparison": { "delta_mean": 2.475243672961369e-05, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 7.27716524124844e-05, 1.171319127024617e-05, 1.4423489119508304e-05, 6.5593394538154826e-06, 3.7358155168476515e-05, 2.9849323254893534e-05, 1.0015473890234716e-05, 1.532886926725041e-05 ], "p_value": 0.0081, "mde": 1.8439870679175355e-05, "mde_rel_pct": 80.79549503527105, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "signature": { "prediction": "idea lowers trained recurrent cross-block q and keeps it near <=0.8", "baseline_q_mean": 2.9282636810198936, "idea_q_mean": 0.7976552316857172, "baseline_q_per_seed": [ 2.7491974371903396, 2.8032834877024646, 2.7482760381642044, 3.334465893518113, 2.8231071925105216, 3.0133113893982655, 2.993095970408364, 2.9613720392668768 ], "idea_q_per_seed": [ 0.7953895769092711, 0.7993655229735372, 0.7991708584055264, 0.79743240619884, 0.7974510193922437, 0.798977436754247, 0.7961304629450436, 0.7973245699070284 ], "observed_reduction": 2.1306084493341766, "target_q": 0.8, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.006, "lam": 0.1 }, "result": { "mean": 4.757533133670222e-05, "std": 2.1643697598220244e-05, "per_seed": [ 9.76939991232939e-05, 3.8501457311213017e-05, 3.3765736588975415e-05, 2.9315116989891976e-05, 6.082628169679083e-05, 5.370224607759155e-05, 3.0736955523025244e-05, 3.606085738283582e-05 ], "n": 8 } }, { "cfg": { "lr": 0.0015, "lam": 0.1 }, "result": { "mean": 0.00037327232348616235, "std": 3.6520547820565044e-05, "per_seed": [ 0.0003330762847326696, 0.00043403543531894684, 0.00033968265051953495, 0.000401037948904559, 0.00037536423769779503, 0.0003695053164847195, 0.0003257567877881229, 0.00040771992644295096 ], "n": 8 } }, { "cfg": { "lr": 0.006, "lam": 0.1 }, "result": { "mean": 4.757533133670222e-05, "std": 2.1643697598220244e-05, "per_seed": [ 9.76939991232939e-05, 3.8501457311213017e-05, 3.3765736588975415e-05, 2.9315116989891976e-05, 6.082628169679083e-05, 5.370224607759155e-05, 3.0736955523025244e-05, 3.606085738283582e-05 ], "n": 8 } } ], "bdd_delta": 0.2 }, "protocol_notes": "Dynamics is structurally matched: controlled pendulum rollout and recurrent state coupling. Baseline and idea share rnn_small, data, Adam, epochs, batch, lr/weight-decay grids." }