{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.0015, "weight_decay": 0.0 }, "mean": 6.582355260848999 }, { "cfg": { "lr": 0.0015, "weight_decay": 0.0001 }, "mean": 6.403406500816345 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 6.050842046737671 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 5.60420548915863 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 5.5363428592681885 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001 }, "mean": 4.698180794715881 } ], "full": { "mean": 4.819164454936981, "std": 0.17166144964543392, "per_seed": [ 4.596839904785156, 4.635165214538574, 4.646710395812988, 4.914007663726807, 5.076730251312256, 4.984879016876221, 4.754410743713379, 4.944572448730469 ], "n": 8 } }, "idea": { "mean": 6.840818226337433, "std": 0.17257722313102455, "per_seed": [ 6.538304328918457, 6.585258960723877, 6.972299098968506, 6.974996089935303, 6.823678970336914, 7.017618656158447, 6.853421211242676, 6.960968494415283 ], "n": 8 }, "comparison": { "delta_mean": 2.0216537714004517, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 1.9414644241333008, 1.9500937461853027, 2.3255887031555176, 2.060988426208496, 1.7469487190246582, 2.0327396392822266, 2.099010467529297, 2.0163960456848145 ], "p_value": 0.0081, "mde": 0.13669161157539178, "mde_rel_pct": 2.8364172431459234, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "nonzero replica circulation when k1!=k2", "k1": 0.2, "k2": 0.05, "observed_epoch_area_seed0": -1.9684885011277033e-08, "observed_mean_replica_separation": 0.07705571800470352, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.0015, "weight_decay": 0.0001 }, "result": { "mean": 6.842114150524139, "std": 0.19106420610526897, "per_seed": [ 6.48126745223999, 6.709563732147217, 7.120368957519531, 6.81691312789917, 6.813747406005859, 7.096852779388428, 6.863407611846924, 6.834792137145996 ], "n": 8 } }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "result": { "mean": 6.840818226337433, "std": 0.17257722313102455, "per_seed": [ 6.538304328918457, 6.585258960723877, 6.972299098968506, 6.974996089935303, 6.823678970336914, 7.017618656158447, 6.853421211242676, 6.960968494415283 ], "n": 8 } }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001 }, "result": { "mean": 6.841454744338989, "std": 0.2586476832475316, "per_seed": [ 7.215710163116455, 6.548867702484131, 7.098788261413574, 7.125370502471924, 6.484438896179199, 6.837231636047363, 6.688592910766602, 6.732637882232666 ], "n": 8 } } ], "protocol_notes": { "epochs": 15, "batch": 128, "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "track_rationale": "tabular is the prescribed structural track for optimizer modifications", "equal_budget_note": "same epochs and minibatch budget per replica; the idea uses two replicas and thus approximately 2x parameter-update compute" } }