Lie-Poisson Hamiltonian latent block / report_bench_2026-08-31T162049.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 10, "verdict": "Implemented an end-to-end Lie-Poisson Hamiltonian recurrent block and evaluated it against a matched vanilla recurrent system using the shared dynamics task, parity-matched learning-rate sweep, and 8 paired seeds. The idea was significantly worse: test MSE 0.02712 versus 0.00588 for the baseline, paired delta +0.02124 with permutation p=0.0081. The trained-model signature observed momentum-scaling exponent 0.885 rather than the predicted quadratic scaling, so the mechanism prediction was not confirmed.", "metrics": { "baseline": "Best lr=0.003; 8-seed mean test MSE 0.0058796 ± 0.0028056.", "idea": "Best lr=0.01; 8-seed mean test MSE 0.0271235 ± 0.0049414; paired delta +0.0212439; p=0.0081; 0/8 paired wins.", "mechanism_signature": { "scales": [ 0.25, 0.5, 1.0 ], "observed_rms_effect": [ 0.007525605789851397, 0.014394661411643028, 0.025677648605778813 ], "observed_loglog_exponent": 0.8853167356267617, "confirmed": false } }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.009041695157065988 }, { "cfg": { "lr": 0.003 }, "mean": 0.004719233373180032 }, { "cfg": { "lr": 0.01 }, "mean": 0.006545157753862441 } ], "full": { "mean": 0.005879616655874997, "std": 0.0028056293033459226, "per_seed": [ 0.0026779656764119864, 0.004133712034672499, 0.008910770528018475, 0.0031544852536171675, 0.006136221811175346, 0.0032570217736065388, 0.00849937554448843, 0.010267380625009537 ], "n": 8 } }, "idea": { "mean": 0.02712346729822457, "std": 0.004941447293628063, "per_seed": [ 0.028157928958535194, 0.02860170602798462, 0.0332900770008564, 0.03025132603943348, 0.018054386600852013, 0.02373768761754036, 0.02242955192923546, 0.032465074211359024 ], "n": 8 }, "comparison": { "delta_mean": 0.02124385064234957, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.025479963282123208, 0.02446799399331212, 0.024379306472837925, 0.027096840785816312, 0.011918164789676666, 0.02048066584393382, 0.013930176384747028, 0.022197693586349487 ], "p_value": 0.0081, "verdict": "idea worse (significant)" }, "mechanism_signature": { "trained_model": "LiePoissonRNN", "predicted_effect": "coadjoint-vs-ablated effect scales as momentum^2", "scales": [ 0.25, 0.5, 1.0 ], "observed_rms_effect": [ 0.007525605789851397, 0.014394661411643028, 0.025677648605778813 ], "observed_loglog_exponent": 0.8853167356267617, "confirmed": false } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_run.py", "files": [ "bench_run.py", "bench_report.json" ], "limitations": "Only the built-in dynamics track was tested; no longer-horizon rollout metric, implicit midpoint integration, larger latent sizes, alternative Hamiltonian parameterizations, or wall-clock comparison was evaluated.", "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }