{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "epochs": 8, "rho": 0.0, "beta": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 8, "rho": 0.0, "beta": 0.0 }, "mean": 0.5321156531572342 }, { "cfg": { "lr": 0.003, "epochs": 8, "rho": 0.0, "beta": 0.0 }, "mean": 0.6582250595092773 }, { "cfg": { "lr": 0.006, "epochs": 8, "rho": 0.0, "beta": 0.0 }, "mean": 0.91780074685812 } ], "full": { "mean": 0.5321156531572342, "std": 0.03988514268446927, "per_seed": [ 0.5299221873283386, 0.45885390043258667, 0.5064432621002197, 0.5547861456871033, 0.5245285630226135, 0.5539869070053101, 0.6065487861633301, 0.5218554735183716 ], "n": 8 } }, "idea": { "mean": 0.5394741781055927, "std": 0.0655720338898959, "per_seed": [ 0.6348236799240112, 0.39886191487312317, 0.5056540369987488, 0.5536980628967285, 0.5338740348815918, 0.5505685210227966, 0.602857768535614, 0.5354554057121277 ], "n": 8 }, "comparison": { "delta_mean": 0.007358524948358536, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ 0.10490149259567261, -0.0599919855594635, -0.0007892251014709473, -0.0010880827903747559, 0.009345471858978271, -0.0034183859825134277, -0.0036910176277160645, 0.013599932193756104 ], "p_value": 0.6281, "mde": 0.03801589735734751, "mde_rel_pct": 7.1442922477069555, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "track_rationale": "Sequence forecast contains multi-token temporal correlations and matches the proposed per-token fading-memory transformer gate.", "observed_best_cfg": { "lr": 0.001, "epochs": 8, "rho": 0.85, "beta": 0.5 }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 8, "rho": 0.85, "beta": 0.5 }, "result": { "mean": 0.5394741781055927, "std": 0.0655720338898959, "per_seed": [ 0.6348236799240112, 0.39886191487312317, 0.5056540369987488, 0.5536980628967285, 0.5338740348815918, 0.5505685210227966, 0.602857768535614, 0.5354554057121277 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 8, "rho": 0.9, "beta": 0.5 }, "result": { "mean": 0.6679390706121922, "std": 0.11291799270623928, "per_seed": [ 0.57618248462677, 0.4957140386104584, 0.6142106652259827, 0.6856930255889893, 0.6076048016548157, 0.8247736692428589, 0.6928988695144653, 0.846435010433197 ], "n": 8 } }, { "cfg": { "lr": 0.006, "epochs": 8, "rho": 0.9, "beta": 1.0 }, "result": { "mean": 0.9237265363335609, "std": 0.17665093311633415, "per_seed": [ 1.304537057876587, 0.6689846515655518, 0.846419632434845, 1.0522245168685913, 0.8211356401443481, 0.86773282289505, 0.9556908011436462, 0.8730871677398682 ], "n": 8 } } ], "mechanism_signature": { "trained_model_seed": 0, "metric": 0.6348236799240112, "initial_gain": 0.9424585700035095, "final_gain": 0.7104766368865967, "mean_state": 0.8186129927635193, "predicted_steady_gain": 0.7095688571417152, "fitted_state_pole": 1.0177967548370361, "rho": 0.85, "beta": 0.5, "confirmed": false }, "math_check": { "rows": [ { "rho": 0.85, "steady_gain_abs_error": 3.3306690738754696e-16, "half_observed": 5, "half_predicted": 5 }, { "rho": 0.9, "steady_gain_abs_error": 4.773959005888173e-15, "half_observed": 7, "half_predicted": 7 }, { "rho": 0.9, "steady_gain_abs_error": 4.385380947269368e-15, "half_observed": 7, "half_predicted": 7 } ], "confirmed": true }, "protocol": { "seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "epochs": 8, "baseline_lr_grid": [ 0.001, 0.003, 0.006 ], "idea_lr_grid": [ 0.001, 0.003, 0.006 ] } } }