Padé-Hermite Neural ODE Integrator / report_bench_2026-08-31T171145.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Implemented and ran the Padé-Hermite rollout intervention on the registered dynamics/rnn_small benchmark. The idea produced a tiny nonsignificant improvement: baseline MSE 5.681601408014103e-06 versus idea MSE 5.6799913750182895e-06, paired delta -1.6100329958135262e-09, permutation p=0.78145; therefore the benchmark verdict is no measurable effect.", "metrics": { "baseline": "Best tuned baseline lr=0.01,h=0.025; full 8-seed mean MSE 5.681601408014103e-06.", "idea": "Best idea setting selected from the same lr/h union; full 8-seed mean MSE 5.6799913750182895e-06; 4/8 paired wins; p=0.78145." }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "h": 0.025 }, "sweep": [ { "cfg": { "lr": 0.001, "h": 0.025 }, "mean": 1.4525697110912006e-05 }, { "cfg": { "lr": 0.001, "h": 0.05 }, "mean": 1.4545178487423982e-05 }, { "cfg": { "lr": 0.001, "h": 0.1 }, "mean": 1.4584162499886588e-05 }, { "cfg": { "lr": 0.003, "h": 0.025 }, "mean": 8.580010785408376e-06 }, { "cfg": { "lr": 0.003, "h": 0.05 }, "mean": 8.575699666835135e-06 }, { "cfg": { "lr": 0.003, "h": 0.1 }, "mean": 8.567132681491785e-06 }, { "cfg": { "lr": 0.01, "h": 0.025 }, "mean": 5.892069680157874e-06 }, { "cfg": { "lr": 0.01, "h": 0.05 }, "mean": 5.897995151826763e-06 }, { "cfg": { "lr": 0.01, "h": 0.1 }, "mean": 5.909915387292131e-06 } ], "full": { "mean": 5.681601408014103e-06, "std": 2.730715161483723e-06, "per_seed": [ 2.3133106878958642e-06, 4.037152848468395e-06, 1.1316467862343416e-05, 5.901347321923822e-06, 5.3298954298952594e-06, 3.4796667023329064e-06, 8.45680187921971e-06, 4.618168532033451e-06 ], "n": 8 } }, "idea": { "mean": 5.6799913750182895e-06, "std": 2.7279983370928816e-06, "per_seed": [ 2.3146424155129353e-06, 4.040079147671349e-06, 1.1296857337583788e-05, 5.893076377105899e-06, 5.312819212122122e-06, 3.484348098936607e-06, 8.480390533804893e-06, 4.617717877408722e-06 ], "n": 8 }, "comparison": { "delta_mean": -1.6100329958135262e-09, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 1.3317276170710102e-09, 2.9262992029543966e-09, -1.961052475962788e-08, -8.27094481792301e-09, -1.7076217773137614e-08, 4.681396603700705e-09, 2.3588654585182667e-08, -4.5065462472848594e-10 ], "p_value": 0.78145, "mde": 1.1450469552506787e-08, "mde_rel_pct": 0.20153595316199915, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "two-derivative correction should improve finite-step rollout", "predicted": { "order": 4, "correction_coefficient": 0.5 }, "observed": { "mean_abs_field": 0.08425881783477962, "mean_abs_ph_correction": 7.20391401642928e-07 }, "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_ph.py", "files": [ "bench_ph.py", "bench_report.json", "bench_stdout.txt" ], "limitations": "Tested only the registered built-in dynamics pendulum forecast, not CIFAR probability-flow sampling or a genuine multi-stage implicit nonlinear solve. The benchmark GRU lacks forward-mode AD, so the JVP used reverse-mode differentiation. Global order, A/L-stability, wall-clock speed, function/JVP counts, and sample quality were not tested.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }