Time-Shell Long-Horizon Decoder / report_bench_2026-08-31T123639.md

✓✓ Beats tuned baseline

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": true, "confidence": 7, "verdict": "The registered multihorizon_sequence track was benchmarked with matched end-to-end GRU systems and a tuned baseline sweep. Time-shell decoding achieved lower MSE than the dense all-horizon baseline on all 8 paired seeds, with delta_mean=-0.0163224 and permutation p=0.0081, so the benchmark verdict is idea better (significant). The trained-model mechanism signature did not confirm the proposed early-over-late sensitivity prediction.", "metrics": { "baseline": "Mean test MSE 0.2238331437, best cfg lr=0.006 scale=1.0, 8-seed full evaluation.", "idea": "Mean test MSE 0.2075107191, best cfg lr=0.006 scale=1.0, 8-seed evaluation; 7.3% lower MSE than baseline." }, "bench_report": { "bench_version": 1, "track": "multihorizon_sequence", "model": "custom_gru_decoder", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "scale": 1.0 }, "sweep": [ { "cfg": { "lr": 0.001, "scale": 0.5 }, "mean": 0.3686178476 }, { "cfg": { "lr": 0.001, "scale": 1.0 }, "mean": 0.3673807681 }, { "cfg": { "lr": 0.003, "scale": 0.5 }, "mean": 0.2608154863 }, { "cfg": { "lr": 0.003, "scale": 1.0 }, "mean": 0.2626522072 }, { "cfg": { "lr": 0.006, "scale": 0.5 }, "mean": 0.2287113033 }, { "cfg": { "lr": 0.006, "scale": 1.0 }, "mean": 0.2236526087 } ], "full": { "mean": 0.2238331437, "std": 0.0210444644, "per_seed": [ 0.2033109814, 0.2418104708, 0.2371955216, 0.212293461, 0.2200879604, 0.2624394298, 0.2209002972, 0.1926270276 ], "n": 8 } }, "idea": { "mean": 0.2075107191, "std": 0.0166420186, "per_seed": [ 0.2011904269, 0.2354012579, 0.2348411381, 0.2042408288, 0.2030296326, 0.1936691254, 0.1991314292, 0.1885819137 ], "n": 8 }, "comparison": { "delta_mean": -0.0163224246, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.0021205544, -0.0064092129, -0.0023543835, -0.0080526322, -0.0170583278, -0.0687703043, -0.021768868, -0.0040451139 ], "p_value": 0.0081, "mde": 0.0186840834, "mde_rel_pct": 8.3473265324, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "prediction": "Reverse cumulative shell makes early outputs more sensitive to later coefficients.", "predicted": { "early_over_late_sensitivity": ">1" }, "observed": { "early_abs_change": 0.0, "late_abs_change": 0.0163143985, "early_over_late_sensitivity": 0.0, "trained_test_mse": 0.2011904269 }, "confirmed": false }, "custom_track": { "name": "multihorizon_sequence", "file": "custom_track.py", "domain": "sequence", "registered": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_run.py", "files": [ "bench_run.py", "custom_track.py", "bench_report.json" ], "limitations": "The built-in sequence track is single-horizon, so the structurally matched custom multihorizon_sequence track was promoted and registered before rerunning. The dense comparator uses an all-horizon coefficient vector rather than an explicit quadratic attention matrix, so O(K^2d) wall-clock scaling was not independently measured. No variable-horizon, memory, or connected third-order-correlation tests were run; the trained-model mechanism signature failed quantitatively.", "system_verdict": "worked", "practical_verdict": "helps", "mechanism_ok": 0, "system_judged": true }