Horizon-Adaptive Neural Tube Rollouts / report_bench_2026-09-02T002452.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Built and reran Horizon-Adaptive Neural Tube Rollouts on the registered dynamics/rnn_small track with matched architecture, paired seeds, tuned baseline, and a shared learning-rate sweep. The idea achieved a tiny lower MSE, but the paired permutation test was not significant (p=0.58005), so there is no demonstrated benchmark win. The trained-model mechanism signature was also not quantitatively confirmed.", "metrics": { "baseline": "Best lr=0.001; 8-seed mean test MSE=0.7859984934329987.", "idea": "Best lr=0.006, lambda=0.03; 8-seed mean test MSE=0.7857095971703529; paired delta=-0.00028889626264572144; p=0.58005." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_tube.py", "files": [ "bench_tube.py", "bench_report.json" ], "limitations": "The implementation uses a compact Jacobian penalty on the observed input-window map rather than a fully unrolled hidden-state tube with closed-loop policy Jacobians. Active robust constraints, held-out 99th-percentile residual estimation, and longer free-running rollout evaluation were not tested.", "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.8349032551050186 }, { "cfg": { "lr": 0.003 }, "mean": 0.8359973579645157 }, { "cfg": { "lr": 0.006 }, "mean": 0.8355543166399002 } ], "full": { "mean": 0.7859984934329987, "std": 0.07510655446575974, "per_seed": [ 0.8355869054794312, 0.7388775944709778, 0.8546704053878784, 0.9104781150817871, 0.7400559186935425, 0.7168379426002502, 0.8168118000030518, 0.6746692657470703 ], "n": 8 } }, "idea": { "mean": 0.7857095971703529, "std": 0.07640934958971482, "per_seed": [ 0.8372436761856079, 0.7375508546829224, 0.8549157381057739, 0.9125410914421082, 0.7379266023635864, 0.7164239287376404, 0.8165872693061829, 0.6724876165390015 ], "n": 8 }, "comparison": { "delta_mean": -0.00028889626264572144, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ 0.0016567707061767578, -0.00132673978805542, 0.0002453327178955078, 0.002062976360321045, -0.0021293163299560547, -0.0004140138626098633, -0.00022453069686889648, -0.0021816492080688477 ], "p_value": 0.58005, "mde": 0.0013284398908388765, "mde_rel_pct": 0.16901303271418006, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "quantity": "absolute local Jacobian gain vs finite-difference gain", "predicted_mean": [ 0.02751869708299637, 0.04405847191810608, 0.040442872792482376, 0.07109975069761276 ], "observed_mean": [ 0.019221652299165726, 0.029958780854940414, 0.018909338861703873, 0.0590406097471714 ], "correlation": 0.9556240583468331, "relative_error": 0.5613289126670399, "confirmed": false }, "idea_sweep": [ { "cfg": { "lr": 0.001, "lam": 0.03 }, "result": { "mean": 0.7859929502010345, "std": 0.07511012743166294, "per_seed": [ 0.8355842232704163, 0.7388842105865479, 0.8546649217605591, 0.9104771614074707, 0.740043580532074, 0.7168059349060059, 0.8168159127235413, 0.6746676564216614 ], "n": 8 } }, { "cfg": { "lr": 0.003, "lam": 0.03 }, "result": { "mean": 0.7857807502150536, "std": 0.07594789968969756, "per_seed": [ 0.8376532196998596, 0.7396882176399231, 0.8549769520759583, 0.9116700887680054, 0.738188624382019, 0.7167485356330872, 0.814774215221405, 0.6725461483001709 ], "n": 8 } }, { "cfg": { "lr": 0.006, "lam": 0.03 }, "result": { "mean": 0.7857095971703529, "std": 0.07640934958971482, "per_seed": [ 0.8372436761856079, 0.7375508546829224, 0.8549157381057739, 0.9125410914421082, 0.7379266023635864, 0.7164239287376404, 0.8165872693061829, 0.6724876165390015 ], "n": 8 } } ], "budget": { "epochs": 18, "n_train": 400, "n_test": 120, "seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ] } }, "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }