{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.0, "epochs": 3 }, "sweep": [ { "cfg": { "lr": 0.001, "temperature": 0.7, "lambda": 0.0, "epochs": 3 }, "mean": 0.9924133718013763 }, { "cfg": { "lr": 0.001, "temperature": 1.0, "lambda": 0.0, "epochs": 3 }, "mean": 0.9980460554361343 }, { "cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.0, "epochs": 3 }, "mean": 0.9220127463340759 }, { "cfg": { "lr": 0.003, "temperature": 1.0, "lambda": 0.0, "epochs": 3 }, "mean": 0.9310937225818634 } ], "full": { "mean": 0.9596702232956886, "std": 0.08513843682164902, "per_seed": [ 0.9665683507919312, 0.7839867472648621, 0.9865642786026001, 0.9509316086769104, 0.9385733604431152, 0.9886918663978577, 1.1170657873153687, 0.9449797868728638 ], "n": 8 } }, "idea": { "mean": 0.959431529045105, "std": 0.08500281686713337, "per_seed": [ 0.9662969708442688, 0.7839559316635132, 0.9864087700843811, 0.9510284662246704, 0.9385600090026855, 0.9874905347824097, 1.1167069673538208, 0.9450045824050903 ], "n": 8, "sweep": [ { "cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.01, "epochs": 3 }, "mean": 0.921985849738121 }, { "cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.03, "epochs": 3 }, "mean": 0.922079473733902 }, { "cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.08, "epochs": 3 }, "mean": 0.9221688061952591 } ] }, "comparison": { "delta_mean": -0.00023869425058364868, "idea_wins": 6, "n_pairs": 8, "per_seed_diffs": [ -0.0002713799476623535, -3.081560134887695e-05, -0.00015550851821899414, 9.685754776000977e-05, -1.33514404296875e-05, -0.001201331615447998, -0.00035881996154785156, 2.47955322265625e-05 ], "p_value": 0.0863, "mde": 0.0003498030498009527, "mde_rel_pct": 0.03645033901329803, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "expansion penalty increases token-group expert neighborhood and reduces load dispersion", "baseline_observed": { "soft_C": 8.0, "mean_hard_neighborhood": 4.5625, "violation_fraction": 0.21875, "load_std": 446.43703842163086 }, "idea_observed": { "soft_C": 8.0, "mean_hard_neighborhood": 4.625, "violation_fraction": 0.21875, "load_std": 430.1180419921875 }, "confirmed": true }, "idea_hyperparameter_grid": [ { "lr": 0.003, "temperature": 0.7, "lambda": 0.01, "epochs": 3 }, { "lr": 0.003, "temperature": 0.7, "lambda": 0.03, "epochs": 3 }, { "lr": 0.003, "temperature": 0.7, "lambda": 0.08, "epochs": 3 } ], "notes": "Matched compact sequence forecaster; same 8-expert dense MoE and training budget; CPU fallback used to avoid shared GPU contention." }