{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "alpha": 0.7, "sigma": 0.035 }, "sweep": [ { "cfg": { "lr": 0.001, "alpha": 0.7, "sigma": 0.035 }, "mean": 0.8283906430006027 }, { "cfg": { "lr": 0.003, "alpha": 0.7, "sigma": 0.035 }, "mean": 0.8293724805116653 }, { "cfg": { "lr": 0.01, "alpha": 0.7, "sigma": 0.035 }, "mean": 0.8328554034233093 } ], "full": { "mean": 0.787501223385334, "std": 0.06788976443931306, "per_seed": [ 0.8156408071517944, 0.7547019720077515, 0.8308971524238586, 0.9123226404190063, 0.7518438100814819, 0.7541651725769043, 0.8133183717727661, 0.6671198606491089 ], "n": 8 } }, "idea": { "mean": 0.7941433116793633, "std": 0.07100903064007838, "per_seed": [ 0.8096513748168945, 0.803184986114502, 0.8362289667129517, 0.9341802597045898, 0.7649334669113159, 0.7608115077018738, 0.7781288623809814, 0.6660270690917969 ], "n": 8 }, "comparison": { "delta_mean": 0.006642088294029236, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ -0.005989432334899902, 0.04848301410675049, 0.005331814289093018, 0.021857619285583496, 0.013089656829833984, 0.006646335124969482, -0.03518950939178467, -0.0010927915573120117 ], "p_value": 0.4855, "mde": 0.0199747259489214, "mde_rel_pct": 2.5364691959529213, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "idea_config": { "lr": 0.001, "alpha": 0.7, "sigma": 0.035 }, "idea_sweep": [ { "cfg": { "lr": 0.001, "alpha": 0.7, "sigma": 0.035 }, "result": { "mean": 0.7941433116793633, "std": 0.07100903064007838, "per_seed": [ 0.8096513748168945, 0.803184986114502, 0.8362289667129517, 0.9341802597045898, 0.7649334669113159, 0.7608115077018738, 0.7781288623809814, 0.6660270690917969 ], "n": 8 } }, { "cfg": { "lr": 0.003, "alpha": 0.7, "sigma": 0.035 }, "result": { "mean": 0.8040007650852203, "std": 0.07647255737581943, "per_seed": [ 0.8088628649711609, 0.8104173541069031, 0.8454757928848267, 0.9598079919815063, 0.7718257308006287, 0.7834799289703369, 0.7857349514961243, 0.6664015054702759 ], "n": 8 } }, { "cfg": { "lr": 0.01, "alpha": 0.7, "sigma": 0.035 }, "result": { "mean": 0.8066116720438004, "std": 0.07406785573886294, "per_seed": [ 0.811928391456604, 0.8005879521369934, 0.8522548079490662, 0.9512794017791748, 0.7587114572525024, 0.7952184677124023, 0.8118025064468384, 0.6711103916168213 ], "n": 8 } } ], "sampler": "feedback pendulum rollout + Gaussian exploration + uniform reservoir", "mechanism_signature": { "prediction": "gradient sign predicts which bounded control increases model-predicted next angle", "observed_sign_agreement": 1.0, "predicted_threshold": 0.75, "confirmed": true }, "protocol_note": "8 paired seeds; baseline and idea share rnn_small, Adam, epochs, batch, and lr union." } }