Convex Bayesian Potential Head / report_bench_2026-09-04T140605.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Implemented the Convex Bayesian Potential Head as a separately trained normalized energy model against a matched unconstrained neural energy baseline on the registered bounded_energy_regression track. The idea achieved lower test MSE (0.76154 vs 0.77460; paired delta -0.01306; 7/8 wins), and the trained-model covariance Hessian signature was confirmed PSD (minimum eigenvalue 0.00470). However, p=0.06495 exceeded 0.05, so the result is a promising but non-significant win and worked=false under the bench rule.", "metrics": { "baseline": "Best lr=0.01; full 8-seed test MSE 0.774600 +/- 0.027591. Sweep means: lr=0.01 -> 0.776752, lr=0.03 -> 0.851800, lr=0.08 -> 1.003566.", "idea": "Best shared-grid lr=0.01; 8-seed test MSE 0.761540 +/- 0.030350. Idea sweep means: lr=0.01 -> 0.761540, lr=0.03 -> 0.763843, lr=0.08 -> 0.768748. Paired delta=-0.013060, 7/8 wins, permutation p=0.06495, verdict='no significant win'." }, "bench_report": { "bench_version": 1, "track": "bounded_energy_regression", "model": "energy_potential_mlp", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.01 }, "mean": 0.7767523378133774 }, { "cfg": { "lr": 0.03 }, "mean": 0.8518001586198807 }, { "cfg": { "lr": 0.08 }, "mean": 1.003566414117813 } ], "full": { "mean": 0.7746003046631813, "std": 0.02759112122134984, "per_seed": [ 0.7906999588012695, 0.7522919178009033, 0.7769189476966858, 0.7870985269546509, 0.8022679090499878, 0.781724214553833, 0.7115864157676697, 0.7942145466804504 ], "n": 8 } }, "idea": { "mean": 0.7615404203534126, "std": 0.03034974678225816, "per_seed": [ 0.774912416934967, 0.7445108890533447, 0.7894505262374878, 0.7848820090293884, 0.762522280216217, 0.777182400226593, 0.6890047788619995, 0.7698580622673035 ], "n": 8 }, "comparison": { "delta_mean": -0.013059884309768677, "idea_wins": 7, "n_pairs": 8, "per_seed_diffs": [ -0.01578754186630249, -0.007781028747558594, 0.012531578540802002, -0.002216517925262451, -0.03974562883377075, -0.00454181432723999, -0.022581636905670166, -0.024356484413146973 ], "p_value": 0.06495, "mde": 0.013448348264850439, "mde_rel_pct": 1.7361661470941674, "verdict": "no significant win", "system_worked": false }, "idea_sweep": [ { "cfg": { "lr": 0.01 }, "result": { "mean": 0.7615404203534126, "std": 0.03034974678225816, "per_seed": [ 0.774912416934967, 0.7445108890533447, 0.7894505262374878, 0.7848820090293884, 0.762522280216217, 0.777182400226593, 0.6890047788619995, 0.7698580622673035 ], "n": 8 } }, { "cfg": { "lr": 0.03 }, "result": { "mean": 0.7638429179787636, "std": 0.032194282961917974, "per_seed": [ 0.7802979946136475, 0.7446085810661316, 0.7884130477905273, 0.7881810665130615, 0.7655128836631775, 0.7819029688835144, 0.6864311099052429, 0.7753956913948059 ], "n": 8 } }, { "cfg": { "lr": 0.08 }, "result": { "mean": 0.7687475085258484, "std": 0.031868273247181104, "per_seed": [ 0.7850456833839417, 0.7469156980514526, 0.7934955954551697, 0.7940797805786133, 0.771902859210968, 0.7864246964454651, 0.6932292580604553, 0.7788864970207214 ], "n": 8 } } ], "structural_match": "Registered bounded_energy_regression: 2-D energy surface; latent coordinates are normalized particles conditioned on observed energy.", "mechanism_signature": { "prediction": "trained convex posterior head has covariance Hessian PSD", "observed_gradient_norm": 0.052461687475442886, "observed_covariance_min_eigenvalue": 0.004702107980847359, "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_experiment.py", "files": [ "bench_experiment.py", "bench_report.json", "bench_run.log" ], "limitations": "The registered matched task is a bounded 2-D energy regression rather than a full continuous inverse problem with Monte Carlo prior particles. The feature trunk was frozen, the prior integral used a fixed 64-point grid, calibration intervals and wall-clock/FLOP comparisons were not measured, and the observed win did not reach permutation significance with eight seeds.", "system_verdict": "partial", "practical_verdict": "inconclusive", "mechanism_ok": 1, "system_judged": true }