Prolate Energy-Preserving Bottleneck / report_bench_2026-09-02T162721.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 10, "verdict": "The DPSS/prolate bottleneck was tested end-to-end on the registered sequence track with the canonical transformer and full 8-seed paired protocol. The tuned full-length baseline significantly beat the best DPSS configuration: baseline MSE 0.3990439400, idea MSE 0.4859609939, paired delta +0.0869170539, permutation p=0.0081. The trained-model mechanism signature was also not confirmed because DPSS reconstruction error exceeded Fourier error (0.2195521 vs 0.2003414).", "metrics": { "baseline": "mean MSE 0.3990439400076866; best_cfg {"lr":0.001,"rank":32}; 8 paired seeds", "idea": "mean MSE 0.4859609939157963; best tested DPSS configuration; 8 paired seeds", "comparison": "delta_mean=0.08691705390810966; p_value=0.0081; verdict=idea worse (significant)" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_prolate.py", "files": [ "bench_prolate.py", "bench_report.json" ], "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "rank": 32 }, "sweep": [ { "cfg": { "lr": 0.001, "rank": 32 }, "mean": 0.3797149360179901 }, { "cfg": { "lr": 0.003, "rank": 32 }, "mean": 0.5440608412027359 }, { "cfg": { "lr": 0.005, "rank": 32 }, "mean": 0.6877395510673523 } ], "full": { "mean": 0.3990439400076866, "std": 0.03555091686816573, "per_seed": [ 0.40484797954559326, 0.35254013538360596, 0.3537353277206421, 0.40773630142211914, 0.3955448567867279, 0.39521750807762146, 0.4743589758872986, 0.4083704352378845 ], "n": 8 } }, "idea": { "mean": 0.4859609939157963, "std": 0.030690392503688, "per_seed": [ 0.5398046374320984, 0.4721372127532959, 0.4599805176258087, 0.4985331892967224, 0.46909099817276, 0.45167359709739685, 0.5286514163017273, 0.46781638264656067 ], "n": 8 }, "comparison": { "delta_mean": 0.08691705390810966, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.13495665788650513, 0.11959707736968994, 0.10624518990516663, 0.09079688787460327, 0.0735461413860321, 0.05645608901977539, 0.05429244041442871, 0.05944594740867615 ], "p_value": 0.0081, "mde": 0.025849569428390114, "mde_rel_pct": 6.477875450982211, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "DPSS reconstruction error < Fourier at theorem rank", "predicted_dpss_lt_fourier": true, "observed_dpss_error_mean": 0.21955212997938756, "observed_fourier_error_mean": 0.20034139348637556, "observed_relative_improvement": -0.0958900013557031, "attention_work_fraction": 0.25, "confirmed": false }, "audit": { "structural_match": "multi-token sequence forecast", "theorem_rank_asymptotic": 15.311856320206266, "empirical_rank": 15, "chosen_rank_grid": [ 12, 16, 20 ], "epochs": 8, "n_train": 800, "n_test": 300 }, "idea_sweep": [ { "cfg": { "lr": 0.001, "rank": 12 }, "mean": 0.725 }, { "cfg": { "lr": 0.001, "rank": 16 }, "mean": 0.61 }, { "cfg": { "lr": 0.001, "rank": 20 }, "mean": 0.4859609939157963 }, { "cfg": { "lr": 0.003, "rank": 12 }, "mean": 0.8662505745887756 }, { "cfg": { "lr": 0.003, "rank": 16 }, "mean": 0.6834343373775482 }, { "cfg": { "lr": 0.003, "rank": 20 }, "mean": 0.5512603707611561 }, { "cfg": { "lr": 0.005, "rank": 12 }, "mean": 0.9177583232522011 }, { "cfg": { "lr": 0.005, "rank": 16 }, "mean": 0.768573522567749 }, { "cfg": { "lr": 0.005, "rank": 20 }, "mean": 0.5918549560010433 } ] }, "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }