{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "weight_decay": 0.0, "epochs": 8, "adv_lr": 0.08, "lambda_lr": 0.2, "radius_scale": 0.1 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0, "epochs": 8, "adv_lr": 0.08, "lambda_lr": 0.2, "radius_scale": 0.1 }, "mean": 0.41393087804317474 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001, "epochs": 8, "adv_lr": 0.08, "lambda_lr": 0.2, "radius_scale": 0.1 }, "mean": 0.41419199854135513 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "epochs": 8, "adv_lr": 0.08, "lambda_lr": 0.2, "radius_scale": 0.1 }, "mean": 0.46493180841207504 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "epochs": 8, "adv_lr": 0.08, "lambda_lr": 0.2, "radius_scale": 0.1 }, "mean": 0.4638128876686096 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0, "epochs": 8, "adv_lr": 0.08, "lambda_lr": 0.2, "radius_scale": 0.1 }, "mean": 0.667711153626442 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001, "epochs": 8, "adv_lr": 0.08, "lambda_lr": 0.2, "radius_scale": 0.1 }, "mean": 0.5989826694130898 } ], "full": { "mean": 0.43296366557478905, "std": 0.0464950719362365, "per_seed": [ 0.4563036859035492, 0.3589187264442444, 0.3965584337711334, 0.443942666053772, 0.4800455868244171, 0.38371741771698, 0.5046233534812927, 0.4395994544029236 ], "n": 8 } }, "idea": { "mean": 0.4326546713709831, "std": 0.046648733640043204, "per_seed": [ 0.45671361684799194, 0.3578817546367645, 0.3963860869407654, 0.44397932291030884, 0.4796009659767151, 0.3833600878715515, 0.50420743227005, 0.43910810351371765 ], "n": 8 }, "comparison": { "delta_mean": -0.00030899420380592346, "idea_wins": 6, "n_pairs": 8, "per_seed_diffs": [ 0.000409930944442749, -0.0010369718074798584, -0.000172346830368042, 3.6656856536865234e-05, -0.00044462084770202637, -0.0003573298454284668, -0.0004159212112426758, -0.0004913508892059326 ], "p_value": 0.0797, "mde": 0.00035339177440740587, "mde_rel_pct": 0.0816215776301353, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "math_and_nn_signature": { "prediction": "translation S approximately k*delta^2", "fitted_k": 0.7166269634451184, "max_relative_error": 0.022699180966030196, "S_values": [ 0.0, 0.007007211446762085, 0.02810005284845829, 0.0634879618883133, 0.11350420862436295, 0.17858079075813293, 0.25921881198883057 ], "debiased_identity": 0.0, "confirmed": true, "nn_observed_mean_sinkhorn": 9.942629664028146e-08, "nn_observed_mean_lambda": 0.0, "nn_predicted_radius": 0.035 }, "idea_sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0, "epochs": 8, "adv_lr": 0.08, "lambda_lr": 0.2, "radius_scale": 0.1 }, "mean": 0.41374019533395767 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "epochs": 8, "adv_lr": 0.08, "lambda_lr": 0.2, "radius_scale": 0.1 }, "mean": 0.4662386029958725 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0, "epochs": 8, "adv_lr": 0.04, "lambda_lr": 0.2, "radius_scale": 0.07 }, "mean": 0.4139372706413269 } ], "custom_track": null, "track_rationale": "Sequence forecasting has context-conditioned multi-token windows; residual trajectory augmentation acts on the generated sequence manifold." } }