{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "eps": 0.7, "iters": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "eps": 0.7, "iters": 12 }, "mean": 0.9074711948633194 }, { "cfg": { "lr": 0.003, "eps": 0.7, "iters": 12 }, "mean": 0.915537878870964 }, { "cfg": { "lr": 0.006, "eps": 0.7, "iters": 12 }, "mean": 0.8664272725582123 } ], "full": { "mean": 0.9269421473145485, "std": 0.08130362337327321, "per_seed": [ 0.9268826246261597, 0.8607907891273499, 0.8572450280189514, 0.8207906484603882, 1.0688729286193848, 0.9266430139541626, 1.0371272563934326, 0.9171848893165588 ], "n": 8 } }, "idea": { "mean": 0.9356912449002266, "std": 0.05696883264914271, "per_seed": [ 0.9681993126869202, 0.8495118021965027, 0.900809645652771, 0.961909830570221, 0.9716687798500061, 0.9182450175285339, 1.038270115852356, 0.876915454864502 ], "n": 8 }, "comparison": { "delta_mean": 0.0087490975856781, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.0413166880607605, -0.011278986930847168, 0.04356461763381958, 0.14111918210983276, -0.09720414876937866, -0.008397996425628662, 0.0011428594589233398, -0.040269434452056885 ], "p_value": 0.75565, "mde": 0.05842531038665775, "mde_rel_pct": 6.303015841487215, "verdict": "no measurable effect", "system_worked": false }, "idea_sweep": [ { "lr": 0.006, "eps": 0.5, "iters": 12 }, { "lr": 0.006, "eps": 0.7, "iters": 12 }, { "lr": 0.006, "eps": 1.0, "iters": 12 } ], "track_justification": "Sequence forecast contains multi-token correlations and directly exercises attention.", "mechanism_signature": { "predicted_max_marginal_error": 0.0001, "observed_mean_row_marginal_error": 0.007857249001972377, "observed_mean_column_marginal_error": 1.1294105761727735e-08, "observed_min_attention_mean": 1.0011145091900235e-14, "confirmed": false } }