{ "bench_version": 1, "track": "phase_checkpoint_regression", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.001, "epochs": 12, "sigma": 0.05 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0, "epochs": 12, "sigma": 0.0 }, "mean": 0.052177092991769314 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001, "epochs": 12, "sigma": 0.02 }, "mean": 0.05208037327975035 }, { "cfg": { "lr": 0.001, "weight_decay": 0.001, "epochs": 12, "sigma": 0.05 }, "mean": 0.051703399047255516 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "epochs": 12, "sigma": 0.0 }, "mean": 0.03177726315334439 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "epochs": 12, "sigma": 0.02 }, "mean": 0.03205729741603136 }, { "cfg": { "lr": 0.003, "weight_decay": 0.001, "epochs": 12, "sigma": 0.05 }, "mean": 0.03150508273392916 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0, "epochs": 12, "sigma": 0.0 }, "mean": 0.022574170026928186 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "epochs": 12, "sigma": 0.02 }, "mean": 0.022592097986489534 }, { "cfg": { "lr": 0.01, "weight_decay": 0.001, "epochs": 12, "sigma": 0.05 }, "mean": 0.02199754724279046 } ], "full": { "mean": 0.022857969626784325, "std": 0.0019890920183647087, "per_seed": [ 0.022877627983689308, 0.02057631127536297, 0.02327309176325798, 0.021263157948851585, 0.0209011472761631, 0.026269573718309402, 0.02207833342254162, 0.025624513626098633 ], "n": 8 } }, "idea": { "mean": 0.022857969626784325, "std": 0.0019890920183647087, "per_seed": [ 0.022877627983689308, 0.02057631127536297, 0.02327309176325798, 0.021263157948851585, 0.0209011472761631, 0.026269573718309402, 0.02207833342254162, 0.025624513626098633 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "anonymous trained-system checkpoint phase return slope = 1", "predicted_slope": 1.0, "observed_slope_mean": 0.04611545590999941, "priority_observed_slope_mean": 1.0049859781212493, "observed_gap_drift_mean": 2.667137344314341e-18, "confirmed": false, "custom_track": { "name": "phase_checkpoint_regression", "file": "phase_track.py", "domain": "training-dynamics" }, "idea_sweep": [ { "cfg": { "lr": 0.01, "weight_decay": 0.001, "epochs": 12, "sigma": 0.05 }, "mean": 0.02199754724279046 }, { "cfg": { "lr": 0.001, "weight_decay": 0.001, "epochs": 12, "sigma": 0.05 }, "mean": 0.051703399047255516 }, { "cfg": { "lr": 0.01, "weight_decay": 0.001, "epochs": 12, "sigma": 0.05 }, "mean": 0.02199754724279046 } ], "selected_idea_cfg": { "lr": 0.01, "weight_decay": 0.001, "epochs": 12, "sigma": 0.05 } } }