{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.02141550718806684 }, { "cfg": { "lr": 0.003 }, "mean": 0.0037718631356256083 }, { "cfg": { "lr": 0.01 }, "mean": 0.0034299326362088323 } ], "full": { "mean": 0.002775895278318785, "std": 0.0017084856346187775, "per_seed": [ 0.0014615225372835994, 0.004334237892180681, 0.0012712624156847596, 0.006652707699686289, 0.0020110509358346462, 0.0024756770581007004, 0.0018914247630164027, 0.0021092789247632027 ], "n": 8 } }, "idea": { "best_config": { "lr": 0.01 }, "per_seed": [ 0.006583117414265871, 0.009368831291794777, 0.007072345819324255, 0.01220707781612873, 0.0064491755329072475, 0.006343720480799675, 0.006881004199385643, 0.0053885444067418575 ], "mean": 0.007536727120168507, "std": 0.0020598694618333747, "n": 8, "idea_grid": [ { "lr": 0.001 }, { "lr": 0.003 }, { "lr": 0.01 } ] }, "comparison": { "delta_mean": 0.004760831841849722, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.005121594876982272, 0.005034593399614096, 0.005801083403639495, 0.005554370116442442, 0.004438124597072601, 0.0038680434226989746, 0.00498957943636924, 0.003279265481978655 ], "p_value": 0.0081, "mde": 0.000711292400072098, "mde_rel_pct": 25.623891709016156, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "strong contraction and small residual keep observer; otherwise retrieve", "observed": { "median_r": 0.9880073070526123, "mean_switch_rate": 1.0, "mean_q_threshold": 0.10375677701085806 }, "per_seed": [ { "r_est": 0.9952841997146606, "q_threshold": 0.11885927617549896, "switch_rate": 1.0, "observer_mse": 0.0014615217223763466, "retrieval_mse": 0.006583117414265871 }, { "r_est": 0.980730414390564, "q_threshold": 0.13610804080963135, "switch_rate": 1.0, "observer_mse": 0.004334237426519394, "retrieval_mse": 0.009368831291794777 }, { "r_est": 1.0263248682022095, "q_threshold": 0.07391086220741272, "switch_rate": 1.0, "observer_mse": 0.0012712617171928287, "retrieval_mse": 0.007072345819324255 }, { "r_est": 0.9759218096733093, "q_threshold": 0.12216280400753021, "switch_rate": 1.0, "observer_mse": 0.006652706768363714, "retrieval_mse": 0.01220707781612873 }, { "r_est": 1.007511854171753, "q_threshold": 0.10744541883468628, "switch_rate": 1.0, "observer_mse": 0.0020110502373427153, "retrieval_mse": 0.0064491755329072475 }, { "r_est": 0.9763659238815308, "q_threshold": 0.11470293998718262, "switch_rate": 1.0, "observer_mse": 0.0024756789207458496, "retrieval_mse": 0.006343720480799675 }, { "r_est": 0.9624899625778198, "q_threshold": 0.08983396738767624, "switch_rate": 1.0, "observer_mse": 0.0018914258107542992, "retrieval_mse": 0.006881004199385643 }, { "r_est": 0.9965905547142029, "q_threshold": 0.0670309066772461, "switch_rate": 1.0, "observer_mse": 0.002109278691932559, "retrieval_mse": 0.0053885444067418575 } ], "confirmed": true }, "protocol_note": "Built-in dynamics is the required stability/control track. Baseline and idea use independently trained rnn_small systems, identical data, epochs, batch, and shared LR grid; gating uses inputs only, never test labels." }