Online Taylor Residual World Model / report_bench_2026-09-04T150310.md
Beats tuned baseline
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": true, "confidence": 8, "verdict": "Implemented a matched rnn_small dynamics system with an online degree-1 Taylor residual updated by recursive least squares. The idea achieved significantly lower test MSE than the tuned neural-only baseline across all 8 paired seeds. The mechanism signature measured on trained benchmark models confirmed the expected local residual correction effect, though the test used offline adaptation over observed training transitions rather than a live MPC deployment.", "metrics": { "baseline": "Tuned rnn_small, lr=0.006: mean test MSE 0.04543822933919728, std 0.014322681353099428", "idea": "Matched rnn_small plus Taylor/RLS residual, lr=0.006, lambda=0.995, p0=10: mean test MSE 0.0008183727071746211, std 0.0005857487704347297; paired delta -0.044619856632022656, 8/8 wins, permutation p=0.00475" }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "wd": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "wd": 0.0 }, "mean": 0.41046395525336266 }, { "cfg": { "lr": 0.003, "wd": 0.0 }, "mean": 0.05568788480013609 }, { "cfg": { "lr": 0.006, "wd": 0.0 }, "mean": 0.04543822933919728 } ], "full": { "mean": 0.04543822933919728, "std": 0.014322681353099428, "per_seed": [ 0.04790250211954117, 0.028566891327500343, 0.057277221232652664, 0.07493516057729721, 0.03164242208003998, 0.03424108773469925, 0.04783138260245323, 0.04110916703939438 ], "n": 8 } }, "idea": { "mean": 0.0008183727071746211, "std": 0.0005857487704347297, "per_seed": [ 0.0005037843780949299, 0.0009486444474386546, 0.00047346246859643554, 0.0017819429777846984, 0.00027305720189630295, 0.001774419258314151, 0.00031528659531089673, 0.00047638432996090045 ], "n": 8 }, "comparison": { "delta_mean": -0.044619856632022656, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.04739871774144624, -0.02761824688006169, -0.05680375876405623, -0.07315321759951252, -0.03136936487814367, -0.032466668476385095, -0.047516096007142336, -0.040632782709433476 ], "p_value": 0.00475, "mde": 0.010499328941172536, "mde_rel_pct": 23.106817967739982, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "trained_model_test_mse_before_rls": 0.04790250211954117, "trained_model_test_mse_after_rls": 0.0005037843780949299, "relative_correction": 0.9894831301956267, "effective_memory_approx": 199.99999999999983, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.006, "wd": 0.0, "lam": 0.9, "p0": 10.0 }, "result": { "mean": 0.0009322937952897222, "std": 0.000574016816315803, "per_seed": [ 0.000917718187136525, 0.001109695949367615, 0.00047612724871288754, 0.001871022990995478, 0.0003091799744644345, 0.0017833768326602597, 0.0003931757740019105, 0.0005980534049786682 ], "n": 8 } }, { "cfg": { "lr": 0.006, "wd": 0.0, "lam": 0.98, "p0": 10.0 }, "result": { "mean": 0.0008583902984778593, "std": 0.0006199359208421757, "per_seed": [ 0.0005780594359315019, 0.0009298460194156407, 0.00048077141540815444, 0.0018578044183666753, 0.00028224137960249416, 0.0019118917096093264, 0.0003379446056156663, 0.0004885634038734143 ], "n": 8 } }, { "cfg": { "lr": 0.006, "wd": 0.0, "lam": 0.995, "p0": 10.0 }, "result": { "mean": 0.0008183727071746211, "std": 0.0005857487704347297, "per_seed": [ 0.0005037843780949299, 0.0009486444474386546, 0.00047346246859643554, 0.0017819429777846984, 0.00027305720189630295, 0.001774419258314151, 0.00031528659531089673, 0.00047638432996090045 ], "n": 8 } } ], "runtime_sec": 22.165063619613647 }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "Only the registered dynamics track was tested. The adaptation pass used observed training transitions offline rather than a live online deployment or MPC loop; abrupt distribution shifts, measurement-noise sweeps, recentering, higher Taylor orders, and latency were not tested.", "system_verdict": "worked", "practical_verdict": "helps", "mechanism_ok": 1, "system_judged": true }