{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 15.90550446510315 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 15.877723932266235 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 9.71069884300232 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 9.578425407409668 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 7.003860950469971 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "mean": 6.940991640090942 } ], "full": { "mean": 7.183188855648041, "std": 0.6070482381931488, "per_seed": [ 6.755654335021973, 7.163381099700928, 6.924261093139648, 6.920670032501221, 6.168270111083984, 7.485415458679199, 7.807327747344971, 8.240530967712402 ], "n": 8 } }, "idea": { "mean": 220.65338706970215, "std": 6.711567657993523, "per_seed": [ 227.8157958984375, 220.93875122070312, 227.989990234375, 210.31065368652344, 223.4892578125, 218.9625701904297, 210.06019592285156, 225.65988159179688 ], "n": 8 }, "comparison": { "delta_mean": 213.4701982140541, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 221.06014156341553, 213.7753701210022, 221.06572914123535, 203.38998365402222, 217.32098770141602, 211.4771547317505, 202.2528681755066, 217.41935062408447 ], "p_value": 0.0081, "mde": 6.138174864466896, "mde_rel_pct": 85.45194881853251, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "noise enters acceleration only; at temperature=0 injected-noise std is zero", "predicted_injected_noise_std": 0.0, "observed_trained_acceleration_norm_mean": 15.645100752559667, "observed_trained_gradient_norm_mean": 98.2094500956436, "observed_acceleration_to_gradient_ratio_mean": 0.1593389100379601, "confirmed": false, "note": "State acceleration is nonzero from deterministic gradients, so this does not confirm a zero total-state prediction; it directly measures trained-model behavior." }, "idea_sweep": [ { "cfg": { "lr": 0.001, "gamma": 0.5, "temperature": 0.0 }, "result": { "mean": 235.77590942382812, "std": 7.662576847576715, "per_seed": [ 243.6631317138672, 235.733154296875, 241.19017028808594, 221.46832275390625, 245.36273193359375, 231.23699951171875, 228.62933349609375, 238.92343139648438 ], "n": 8 } }, { "cfg": { "lr": 0.003, "gamma": 1.0, "temperature": 0.0 }, "result": { "mean": 220.65338706970215, "std": 6.711567657993523, "per_seed": [ 227.8157958984375, 220.93875122070312, 227.989990234375, 210.31065368652344, 223.4892578125, 218.9625701904297, 210.06019592285156, 225.65988159179688 ], "n": 8 } }, { "cfg": { "lr": 0.01, "gamma": 2.0, "temperature": 0.0 }, "result": { "mean": 471.48626041412354, "std": 384.5950909075575, "per_seed": [ 105.4653091430664, 324.9513854980469, 402.4331970214844, 1098.881591796875, 90.00657653808594, 657.0219116210938, 78.45921325683594, 1014.6708984375 ], "n": 8 } } ], "protocol_notes": { "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "baseline_sweep_seeds": [ 0, 1, 2, 3 ], "dataset_sizes": [ 400, 400 ], "epochs": 30, "batch": 128, "baseline": "Adam via bench.train_model", "idea": "third-order Langevin; only optimizer loop differs", "search_space_union_learning_rates": [ 0.001, 0.003, 0.01 ] } }