{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "epochs": 6, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 6, "weight_decay": 0.0 }, "mean": 0.46786613017320633 }, { "cfg": { "lr": 0.003, "epochs": 6, "weight_decay": 0.0 }, "mean": 0.5299046412110329 }, { "cfg": { "lr": 0.006, "epochs": 6, "weight_decay": 0.0 }, "mean": 0.7419369965791702 } ], "full": { "mean": 0.4766220450401306, "std": 0.09934194575564281, "per_seed": [ 0.5715442299842834, 0.39496564865112305, 0.3930272161960602, 0.5119274258613586, 0.4745565354824066, 0.4187285602092743, 0.6776894927024841, 0.37053725123405457 ], "n": 8 } }, "idea": { "mean": 0.5983163416385651, "std": 0.16587939812424876, "per_seed": [ 0.3822963237762451, 0.5229498744010925, 0.8081433773040771, 0.863442063331604, 0.6520702838897705, 0.45361945033073425, 0.6645830869674683, 0.4394262731075287 ], "n": 8 }, "comparison": { "delta_mean": 0.12169429659843445, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ -0.18924790620803833, 0.12798422574996948, 0.41511616110801697, 0.35151463747024536, 0.1775137484073639, 0.03489089012145996, -0.01310640573501587, 0.06888902187347412 ], "p_value": 0.1299, "mde": 0.16337849985483555, "mde_rel_pct": 34.27841862435872, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 6, "weight_decay": 0.0 }, "result": { "mean": 0.5983163416385651, "std": 0.16587939812424876, "per_seed": [ 0.3822963237762451, 0.5229498744010925, 0.8081433773040771, 0.863442063331604, 0.6520702838897705, 0.45361945033073425, 0.6645830869674683, 0.4394262731075287 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 6, "weight_decay": 0.0 }, "result": { "mean": 2.1142318695783615, "std": 0.7959891886633405, "per_seed": [ 2.495609998703003, 2.4600517749786377, 0.8293719291687012, 1.1857432126998901, 1.480914831161499, 3.2832841873168945, 2.778350830078125, 2.4005281925201416 ], "n": 8 } }, { "cfg": { "lr": 0.006, "epochs": 6, "weight_decay": 0.0 }, "result": { "mean": 5.809824541211128, "std": 2.711991843326257, "per_seed": [ 4.945932388305664, 11.078203201293945, 1.813473105430603, 5.887286186218262, 2.609509229660034, 6.428954124450684, 7.734877109527588, 5.980360984802246 ], "n": 8 } } ], "observed_best_cfg": { "lr": 0.001, "epochs": 6, "weight_decay": 0.0 }, "math_check": [ { "n": 2, "norm_ratio": 1.0000001192092896, "inverse_max_error": 2.384185791015625e-07 }, { "n": 4, "norm_ratio": 1.0, "inverse_max_error": 4.76837158203125e-07 }, { "n": 8, "norm_ratio": 1.0000001192092896, "inverse_max_error": 4.76837158203125e-07 }, { "n": 16, "norm_ratio": 1.0000001192092896, "inverse_max_error": 7.152557373046875e-07 }, { "n": 32, "norm_ratio": 1.0, "inverse_max_error": 9.5367431640625e-07 } ], "mechanism_signature": { "prediction": "trained isometric token mixer preserves feature-token Euclidean norm and has exact adjoint inverse", "predicted_norm_ratio": 1.0, "observed_norm_ratio_seed0": 1.0, "observed_inverse_max_error_seed0": 1.1920928955078125e-06, "baseline_observed_norm_ratio_seed0": 0.5025865435600281, "confirmed": true, "trained_model_metric_seed0": 0.3822963237762451 } } }