{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.19863465800881386 }, { "cfg": { "lr": 0.003 }, "mean": 0.20291408896446228 }, { "cfg": { "lr": 0.01 }, "mean": 0.7486049979925156 } ], "full": { "mean": 0.20585612207651138, "std": 0.022614501649959134, "per_seed": [ 0.23615866899490356, 0.18743106722831726, 0.17751933634281158, 0.19342955946922302, 0.20024268329143524, 0.20917430520057678, 0.24740388989448547, 0.19548946619033813 ], "n": 8 } }, "idea": { "mean": 0.14687445014715195, "std": 0.018827814048492597, "per_seed": [ 0.17195841670036316, 0.1316526234149933, 0.12245547771453857, 0.15120451152324677, 0.135431170463562, 0.12997840344905853, 0.176153764128685, 0.15616123378276825 ], "n": 8 }, "comparison": { "delta_mean": -0.058981671929359436, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.0642002522945404, -0.055778443813323975, -0.05506385862827301, -0.04222504794597626, -0.06481151282787323, -0.07919590175151825, -0.07125012576580048, -0.039328232407569885 ], "p_value": 0.0081, "mde": 0.011451699601831964, "mde_rel_pct": 5.5629628530433815, "verdict": "idea better (significant)", "system_worked": true }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "full": { "mean": 0.14746149070560932, "std": 0.012264365784412576, "per_seed": [ 0.16718325018882751, 0.12648990750312805, 0.13353104889392853, 0.15779778361320496, 0.14990615844726562, 0.14269356429576874, 0.15414929389953613, 0.14794091880321503 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "full": { "mean": 0.14687445014715195, "std": 0.018827814048492597, "per_seed": [ 0.17195841670036316, 0.1316526234149933, 0.12245547771453857, 0.15120451152324677, 0.135431170463562, 0.12997840344905853, 0.176153764128685, 0.15616123378276825 ], "n": 8 } }, { "cfg": { "lr": 0.01 }, "full": { "mean": 0.23110334761440754, "std": 0.04669852475794671, "per_seed": [ 0.23717589676380157, 0.19244495034217834, 0.21007037162780762, 0.2582976818084717, 0.203369140625, 0.19808459281921387, 0.3420470058917999, 0.2073371410369873 ], "n": 8 } } ], "shared_architecture": true, "gain_graph_edges": 51, "mechanism_signature": { "prediction": "trained gain-rigid sparse attention should retain connected input influence, with nonzero gradient reach comparable to dense attention", "observed": { "seed": 0, "baseline_test_mse": 0.22468174993991852, "idea_test_mse": 0.17195841670036316, "baseline_input_gradient_mean": 0.1916990876197815, "idea_input_gradient_mean": 0.27051663398742676, "baseline_input_gradient_active_fraction": 1.0, "idea_input_gradient_active_fraction": 1.0, "gain_edges": 51, "nodes": 32 }, "confirmed": true } }