{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "epochs": 8, "lam": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 8, "lam": 0.0 }, "mean": 0.19084082171320915 }, { "cfg": { "lr": 0.003, "epochs": 8, "lam": 0.0 }, "mean": 0.2167150229215622 }, { "cfg": { "lr": 0.006, "epochs": 8, "lam": 0.0 }, "mean": 0.26577289402484894 } ], "full": { "mean": 0.19580462761223316, "std": 0.019276107610397688, "per_seed": [ 0.21272796392440796, 0.16291894018650055, 0.18857084214687347, 0.19914554059505463, 0.2006099969148636, 0.1974794715642929, 0.22919276356697083, 0.17579150199890137 ], "n": 8 } }, "idea": { "mean": 0.19599766097962856, "std": 0.018529453120078188, "per_seed": [ 0.21339234709739685, 0.1631648987531662, 0.19162587821483612, 0.19664713740348816, 0.1998937577009201, 0.20089472830295563, 0.22621849179267883, 0.1761440485715866 ], "n": 8 }, "comparison": { "delta_mean": 0.000193033367395401, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.0006643831729888916, 0.0002459585666656494, 0.0030550360679626465, -0.0024984031915664673, -0.0007162392139434814, 0.0034152567386627197, -0.002974271774291992, 0.0003525465726852417 ], "p_value": 0.7309, "mde": 0.0019204674874472793, "mde_rel_pct": 0.9808080181079926, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "commutator regularization lowers trained attention commutator; multi-step compatibility follows from resolvent identity", "baseline_comm_rms": { "mean": 0.03365310910157859, "std": 0.005540028408003687, "per_seed": [ 0.028813593089580536, 0.04024209827184677, 0.037993812933564186, 0.02756293211132288 ], "n": 4 }, "idea_comm_rms": { "mean": 0.02128551318310201, "std": 0.0034537152021512133, "per_seed": [ 0.018550011795014143, 0.024316378869116306, 0.02507482608780265, 0.01720083598047495 ], "n": 4 }, "baseline_function_reversal_mse": { "mean": 1.6439854502677917, "std": 0.2084291753940242, "per_seed": [ 1.8240505456924438, 1.5404354333877563, 1.3530447483062744, 1.8584110736846924 ], "n": 4 }, "idea_function_reversal_mse": { "mean": 1.6318478286266327, "std": 0.20953659306825898, "per_seed": [ 1.841636061668396, 1.5250027179718018, 1.340692400932312, 1.820060133934021 ], "n": 4 }, "observed_reduction_factor": 1.5810334856429433, "confirmed": true, "math_check": { "resolvent_identity_rel_error": 4.1222850040650605e-15, "gamma_1_commutator": 0.0, "identity_confirmed": true }, "idea_pilot_sweep": [ { "cfg": { "lr": 0.001, "epochs": 8, "lam": 0.3 }, "result": { "mean": 0.19120756536722183, "std": 0.018085350569029532, "per_seed": [ 0.21339234709739685, 0.1631648987531662, 0.19162587821483612, 0.19664713740348816 ], "n": 4 } }, { "cfg": { "lr": 0.003, "epochs": 8, "lam": 0.3 }, "result": { "mean": 0.21730473637580872, "std": 0.029589204134821655, "per_seed": [ 0.2179270088672638, 0.1916452795267105, 0.1942574828863144, 0.26538917422294617 ], "n": 4 } }, { "cfg": { "lr": 0.006, "epochs": 8, "lam": 0.3 }, "result": { "mean": 0.26101431995630264, "std": 0.014287884388682429, "per_seed": [ 0.2409307062625885, 0.26482611894607544, 0.2576110064983368, 0.28068944811820984 ], "n": 4 } } ] }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 8, "lam": 0.3 }, "mean": 0.19120756536722183 }, { "cfg": { "lr": 0.003, "epochs": 8, "lam": 0.3 }, "mean": 0.21730473637580872 }, { "cfg": { "lr": 0.006, "epochs": 8, "lam": 0.3 }, "mean": 0.26101431995630264 } ] }