{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.33852236717939377 }, { "cfg": { "lr": 0.003 }, "mean": 0.024998844717629254 }, { "cfg": { "lr": 0.006 }, "mean": 0.0168350946623832 } ], "full": { "mean": 0.019937668344937265, "std": 0.013005039202094617, "per_seed": [ 0.03213806077837944, 0.009990346617996693, 0.010487839579582214, 0.014724131673574448, 0.04623213782906532, 0.006986701861023903, 0.011433426290750504, 0.027508702129125595 ], "n": 8 } }, "idea": { "per_seed": [ 0.032140087336301804, 0.010026148520410061, 0.010492031462490559, 0.01471502985805273, 0.04622451215982437, 0.006962496321648359, 0.011483874171972275, 0.02751341462135315 ], "mean": 0.019944699306506664, "std": 0.013896786279171906 }, "comparison": { "delta_mean": 7.030961569398642e-06, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 2.0265579223632812e-06, 3.5801902413368225e-05, 4.191882908344269e-06, -9.101815521717072e-06, -7.625669240951538e-06, -2.4205539375543594e-05, 5.044788122177124e-05, 4.712492227554321e-06 ], "p_value": 0.45785, "mde": 2.0486566875431273e-05, "mde_rel_pct": 0.10275307283177568, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "For T=1, m >= n/2 is the counting threshold for full rank.", "baseline_trained_model": { "state_dim": 64, "horizon_T": 1, "predicted_counting_threshold_m": 32, "observed": [ { "m": 8, "predicted_rank_upper_bound_T1": 16, "observed_rank_T1": 16, "observed_smin": 0.03744511306285858, "observed_logdet": -383.529296875 }, { "m": 16, "predicted_rank_upper_bound_T1": 32, "observed_rank_T1": 32, "observed_smin": 0.028290288522839546, "observed_logdet": -327.2057189941406 }, { "m": 32, "predicted_rank_upper_bound_T1": 64, "observed_rank_T1": 64, "observed_smin": 4.912145959679037e-05, "observed_logdet": -227.1643829345703 } ], "confirmed": true }, "idea_trained_model": { "state_dim": 64, "horizon_T": 1, "predicted_counting_threshold_m": 32, "observed": [ { "m": 8, "predicted_rank_upper_bound_T1": 16, "observed_rank_T1": 16, "observed_smin": 0.04268581420183182, "observed_logdet": -381.6462097167969 }, { "m": 16, "predicted_rank_upper_bound_T1": 32, "observed_rank_T1": 32, "observed_smin": 0.02824431285262108, "observed_logdet": -325.7181701660156 }, { "m": 32, "predicted_rank_upper_bound_T1": 64, "observed_rank_T1": 64, "observed_smin": 0.0018923624884337187, "observed_logdet": -225.09347534179688 } ], "confirmed": true } }, "idea_sweep": { "0.0015": { "per_seed": [ 0.2595526874065399, 0.3410550355911255, 0.31123819947242737, 0.4425976574420929, 0.19178999960422516, 0.34441572427749634, 0.3199017643928528, 0.3680892884731293 ], "mean": 0.32233004458248615, "std": 0.07416895300576867 }, "0.003": { "per_seed": [ 0.03490198403596878, 0.014994751662015915, 0.0031942580826580524, 0.046722445636987686, 0.06990749388933182, 0.01345915999263525, 0.008423914201557636, 0.06726980954408646 ], "mean": 0.0323592271306552, "std": 0.02652120695991089 }, "0.006": { "per_seed": [ 0.032140087336301804, 0.010026148520410061, 0.010492031462490559, 0.01471502985805273, 0.04622451215982437, 0.006962496321648359, 0.011483874171972275, 0.02751341462135315 ], "mean": 0.019944699306506664, "std": 0.013896786279171906 } }, "protocol_notes": "Baseline sweep uses the same three learning rates as the idea; idea adds only finite-horizon logdet loss." }