Structure-preserving SU(1,1) recurrent scan / report_bench_2026-09-02T163550.md
Beats tuned baseline
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": true, "confidence": 8, "verdict": "The exact SU(1,1) exponential scan significantly outperformed the matched Euler discretization on the registered dynamics track. Mean test MSE was 0.0317771 versus 0.0350234, paired delta was -0.0032463, permutation p=0.0081, and the idea won all 8 paired seeds. The trained-model mechanism signature confirmed invariant preservation, with exact maximum drift 1.43e-6 versus 0.102 for Euler.", "metrics": { "baseline": "Matched Euler discretization: mean test MSE 0.0350234136, std 0.0221484165, best lr 0.006, 193 parameters.", "idea": "Exact SU(1,1) exponential: mean test MSE 0.0317771100, std 0.0208386502, best lr 0.006, 193 parameters; delta -0.0032463036, p=0.0081, 8/8 wins." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_su11.py", "files": [ "bench_su11.py", "bench_report.json" ], "limitations": "Only the registered built-in dynamics pendulum track was tested, using 800 training samples, 400 test samples, 8 epochs, one recurrent width, and three learning rates. Other tracks, larger-scale training, long-horizon gradients, mixed precision, and throughput were not tested.", "bench_report": { "bench_version": 1, "track": "dynamics", "model": "su11_scan_matched", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.6121751964092255 }, { "cfg": { "lr": 0.003 }, "mean": 0.31023339182138443 }, { "cfg": { "lr": 0.006 }, "mean": 0.02995142457075417 } ], "full": { "mean": 0.035023413598537445, "std": 0.022148416496165235, "per_seed": [ 0.007818580605089664, 0.020558837801218033, 0.0673612505197525, 0.024067029356956482, 0.04443933442234993, 0.010387144051492214, 0.0372326523065567, 0.06832247972488403 ], "n": 8 } }, "idea": { "mean": 0.03177711000898853, "std": 0.020838650231134917, "per_seed": [ 0.006415394600480795, 0.017402278259396553, 0.061642639338970184, 0.02086794376373291, 0.04112565889954567, 0.008823038078844547, 0.0346921943128109, 0.06324773281812668 ], "n": 8 }, "comparison": { "delta_mean": -0.0032463035895489156, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.0014031860046088696, -0.00315655954182148, -0.005718611180782318, -0.0031990855932235718, -0.0033136755228042603, -0.001564105972647667, -0.002540457993745804, -0.005074746906757355 ], "p_value": 0.0081, "mde": 0.0012718422855006327, "mde_rel_pct": 3.6314058363338515, "verdict": "idea better (significant)", "system_worked": true }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.60923171043396 }, { "cfg": { "lr": 0.003 }, "mean": 0.30314522609114647 }, { "cfg": { "lr": 0.006 }, "mean": 0.02658206399064511 } ], "idea_best_cfg": { "lr": 0.006 }, "baseline_definition": "Euler discretization of the same learned SU(1,1) generator; exact exponential is the sole intervention.", "protocol_note": "Identical trained systems, data, parameters, optimizer, epochs, and learning-rate grid; lower MSE is better.", "mechanism_signature": { "prediction": "Exact exponential preserves |a|^2-|b|^2=1 while Euler drift accumulates.", "predicted_exact_invariant_error": 0.0, "observed_exact_mean_error": 2.8064474122402316e-07, "observed_exact_max_error": 1.430511474609375e-06, "observed_euler_mean_error": 0.029417473822832108, "observed_euler_max_error": 0.10198694467544556, "confirmed": true }, "timing_seconds": 95.12729549407959, "parameter_counts": { "baseline": 193, "idea": 193 } }, "system_verdict": "worked", "practical_verdict": "helps", "mechanism_ok": 1, "system_judged": true }