{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.3383217714726925 }, { "cfg": { "lr": 0.003 }, "mean": 0.3591853603720665 }, { "cfg": { "lr": 0.009 }, "mean": 1.0258603394031525 } ], "full": { "mean": 0.3383217714726925, "std": 0.046140530839104237, "per_seed": [ 0.3308762013912201, 0.28574880957603455, 0.3010590970516205, 0.3668035864830017, 0.33377403020858765, 0.28919702768325806, 0.4317983090877533, 0.3673171103000641 ], "n": 8 } }, "idea": { "mean": 0.33857686817646027, "std": 0.04627190481655083, "per_seed": [ 0.3314558267593384, 0.2857537865638733, 0.30147865414619446, 0.36729896068573, 0.3336082696914673, 0.28876644372940063, 0.43178096413612366, 0.36847203969955444 ], "n": 8 }, "comparison": { "delta_mean": 0.0002550967037677765, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.0005796253681182861, 4.976987838745117e-06, 0.0004195570945739746, 0.0004953742027282715, -0.00016576051712036133, -0.0004305839538574219, -1.7344951629638672e-05, 0.0011549293994903564 ], "p_value": 0.2419, "mde": 0.00042210225891124443, "mde_rel_pct": 0.12476355189140237, "verdict": "no measurable effect", "system_worked": false }, "idea_sweep": [ { "cfg": { "lr": 0.001, "lambda_cov": 0.0001 }, "result": { "mean": 0.33857686817646027, "std": 0.04627190481655083, "per_seed": [ 0.3314558267593384, 0.2857537865638733, 0.30147865414619446, 0.36729896068573, 0.3336082696914673, 0.28876644372940063, 0.43178096413612366, 0.36847203969955444 ], "n": 8 } }, { "cfg": { "lr": 0.001, "lambda_cov": 0.001 }, "result": { "mean": 0.33870137482881546, "std": 0.04630866547362218, "per_seed": [ 0.3318597674369812, 0.28587043285369873, 0.30147260427474976, 0.3680233657360077, 0.3338707685470581, 0.2883317470550537, 0.4315110445022583, 0.3686712682247162 ], "n": 8 } }, { "cfg": { "lr": 0.009, "lambda_cov": 0.01 }, "result": { "mean": 1.0103588178753853, "std": 0.2665844690585086, "per_seed": [ 1.0186030864715576, 0.9780297875404358, 0.7393418550491333, 1.433849811553955, 1.3804410696029663, 0.6398636698722839, 0.8194577097892761, 1.0732835531234741 ], "n": 8 } } ], "epochs": 12, "batch": 64, "mechanism_signature": { "quantity": "pooled input-projection covariance deviation on held-out benchmark windows", "predicted_finite_width_scale_at_width_64": 0.125, "observed_baseline_mean": 0.10427584871649742, "observed_idea_mean": 0.10427427012473345, "observed_idea_over_baseline": 0.9999848613865684, "confirmed": false, "note": "The O(n^-1/2) prediction is a scale law, not an absolute covariance value; this signature tests reduction on trained systems." } }