{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.0015, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.0015, "epochs": 12 }, "mean": 0.42323087900877 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.4927415996789932 }, { "cfg": { "lr": 0.006, "epochs": 12 }, "mean": 0.721754178404808 } ], "full": { "mean": 0.44760169088840485, "std": 0.0483900971330472, "per_seed": [ 0.3936149477958679, 0.3890821635723114, 0.40740370750427246, 0.5028226971626282, 0.4323761761188507, 0.4885129928588867, 0.5237836837768555, 0.4432171583175659 ], "n": 8 } }, "idea": { "config": { "lr": 0.0015, "epochs": 12 }, "per_seed": [ 0.36546337604522705, 0.33078253269195557, 0.3787442743778229, 0.4493727684020996, 0.35211890935897827, 0.4167359173297882, 0.4435553252696991, 0.30875149369239807 ], "details": [ { "seed": 0, "metric": 0.36546337604522705, "final_train_loss": 0.3290974372625351 }, { "seed": 1, "metric": 0.33078253269195557, "final_train_loss": 0.3341557741165161 }, { "seed": 2, "metric": 0.3787442743778229, "final_train_loss": 0.3714332640171051 }, { "seed": 3, "metric": 0.4493727684020996, "final_train_loss": 0.35627098798751833 }, { "seed": 4, "metric": 0.35211890935897827, "final_train_loss": 0.3012402510643005 }, { "seed": 5, "metric": 0.4167359173297882, "final_train_loss": 0.34340501070022583 }, { "seed": 6, "metric": 0.4435553252696991, "final_train_loss": 0.3110033637285233 }, { "seed": 7, "metric": 0.30875149369239807, "final_train_loss": 0.2961388397216797 } ], "mean": 0.3806905746459961 }, "comparison": { "delta_mean": -0.06691111624240875, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.02815157175064087, -0.058299630880355835, -0.028659433126449585, -0.053449928760528564, -0.08025726675987244, -0.07177707552909851, -0.08022835850715637, -0.13446566462516785 ], "p_value": 0.0081, "mde": 0.028554757083691817, "mde_rel_pct": 6.379501611581497, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "quantity": "trained gate vs one-step Fisher-KPP prediction", "predicted_gate_rmse": 0.4042392542224135, "observed_front_index_mean": 0.37890625, "tolerance": 0.15, "confirmed": false }, "math_sanity": { "speed_scaling": [ { "D": 0.1, "r": 1.0, "predicted": 0.6324555320336759, "observed": 0.6649048996195985, "relative_error": 0.05130695510177757 }, { "D": 0.25, "r": 1.0, "predicted": 1.0, "observed": 0.9468693074772295, "relative_error": 0.05313069252277047 }, { "D": 0.5, "r": 1.0, "predicted": 1.4142135623730951, "observed": 1.268869715478862, "relative_error": 0.1027736197426516 } ], "stability_boundary": [ { "r": -0.5, "predicted": -0.5, "observed": -0.5063520554424232, "abs_error": 0.006352055442423232 }, { "r": 0.0, "predicted": 0.0, "observed": -1.083053609166525e-14, "abs_error": 1.083053609166525e-14 }, { "r": 0.5, "predicted": 0.5, "observed": 0.49384613004092737, "abs_error": 0.006153869959072633 } ] }, "protocol_note": "8 paired seeds; baseline sweep and idea sweep use identical lr/epoch union; n_train=400." }