Transport-PDE Predictor for Delayed Neural State Updates / report_bench_2026-09-04T153136.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Ran the official registered dynamics track with canonical rnn_small, train_model, equal three-point learning-rate sweeps, and 8 paired seeds. The transport predictor slightly improved mean test MSE from 5.152216147052968e-06 to 4.707826093408585e-06, but the paired permutation test was not significant (delta_mean=-4.4439005364438344e-07, p=0.7344), so the canonical verdict is no significant win and system_worked=false. The trained-model mechanism signature was confirmed with mean predicted terminal-state shift 0.21677356958389282.", "metrics": { "baseline": "best lr=0.009; mean test MSE=5.152216147052968e-06", "idea": "best lr=0.009; mean test MSE=4.707826093408585e-06", "comparison": "delta_mean=-4.4439005364438344e-07; p_value=0.7344; verdict=no significant win" }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.009 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 3.668733984341088e-05 }, { "cfg": { "lr": 0.003 }, "mean": 8.922007737055537e-06 }, { "cfg": { "lr": 0.009 }, "mean": 4.542415013020218e-06 } ], "full": { "mean": 5.152216147052968e-06, "std": 1.9023458106411929e-06, "per_seed": [ 4.7863295549177565e-06, 5.878216143173631e-06, 3.588439312807168e-06, 3.7736158446932677e-06, 6.708174169034464e-06, 8.705701475264505e-06, 5.577248430199688e-06, 2.2000042463332647e-06 ], "n": 8 } }, "idea": { "mean": 4.707826093408585e-06, "std": 2.320462925135068e-06, "per_seed": [ 2.252499598398572e-06, 3.3756230095605133e-06, 3.7817651445948286e-06, 8.986970897240099e-06, 3.874472895404324e-06, 3.393555971342721e-06, 8.273613275378011e-06, 3.7241079553496093e-06 ], "n": 8 }, "comparison": { "delta_mean": -4.4439005364438344e-07, "idea_wins": 4, "n_pairs": 8, "p_value": 0.7344, "verdict": "no significant win", "system_worked": false }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 3.7107075286257896e-05 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 1.0382680102338782e-05 } }, { "cfg": { "lr": 0.009 }, "result": { "mean": 4.707826093408585e-06 } } ], "track_justification": "Dynamics is the built-in control/stability track and contains delayed actuated pendulum rollouts.", "mechanism_signature": { "delay": 4, "trained_models": true, "measured_on": "official dynamics test windows", "mean_predicted_terminal_state_shift": 0.21677356958389282, "predicted_signature": "finite-horizon transport prediction changes stale terminal state", "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 official_stage2.py", "files": [ "official_stage2.py", "bench_report.json" ], "limitations": "Only the built-in dynamics track and fixed delay d=4 were tested. The predictor uses a frozen local linearization rather than learned automatic-differentiation Jacobians; the benchmark showed a small nonsignificant improvement, not a significant win.", "system_verdict": "partial", "practical_verdict": "inconclusive", "mechanism_ok": 1, "system_judged": true }