Dual-Ensemble Latent Transition Model / report_bench_2026-08-31T124819.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Implemented a local dual-head GRU benchmark on the structurally matched dynamics track, with parity-matched learning-rate sweeps and eight paired seeds. Overall test MSE improved from 0.0014198302 to 0.0013625476, but the paired permutation test was non-significant (delta=-5.73e-05, p=0.7975), so there is no validated benchmark win. The source-sink subset improvement is invalid evidence because Q selection used observed test targets, creating evaluation leakage.", "metrics": { "baseline": "Best lr=0.01; full 8-seed test MSE mean 0.0014198302379, std 0.0003983911490.", "idea": "Best lr=0.01; full 8-seed test MSE mean 0.0013625475767, std 0.0004764418205; paired delta=-0.0000572826611, 4/8 wins, permutation p=0.7975.", "mechanism_signature": "Leaky target-selected subset MSE: baseline=0.0010878387475, idea=0.0006060761043; rejected as valid confirmation." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_dual.py", "files": [ "bench_dual.py", "bench_report.json" ], "limitations": "The fixed dynamics track has no explicit source/sink labels or recycling rollouts. The implementation therefore cannot validly test latent occupancy, committors, MFPT, or directed flux. Its Q evaluation mask uses observed targets and is target leakage; no custom track was built.", "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.0042987791 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.0034615941 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 0.0014865802 } ], "full": { "mean": 0.0014198302, "std": 0.0003983911, "per_seed": [ 0.0009327388, 0.0018641707, 0.0010785291, 0.0020708824, 0.000926081, 0.0014055332, 0.0016443433, 0.0014363637 ], "n": 8 } }, "idea": { "mean": 0.0013625476, "std": 0.0004764418, "per_seed": [ 0.0014115098, 0.0007051811, 0.0013796384, 0.0019934017, 0.0011387406, 0.002205852, 0.0010818139, 0.0009842431 ], "n": 8 }, "comparison": { "delta_mean": -5.72827e-05, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.000478771, -0.0011589896, 0.0003011094, -7.74807e-05, 0.0002126596, 0.0008003188, -0.0005625293, -0.0004521206 ], "p_value": 0.7975, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "quantity": "source-to-sink subset test MSE measured on trained models, but target-selected and therefore leaky", "baseline_predicted": 0.0010878387, "dual_predicted": 0.0006060761, "observed_reduction": 0.0004817626, "confirmed": false }, "idea_sweep": [ { "lr": 0.001, "mean": 0.0315414073 }, { "lr": 0.003, "mean": 0.005806408 }, { "lr": 0.01, "mean": 0.0013625476 } ], "custom_track": null }, "system_verdict": "failed", "practical_verdict": "inconclusive", "mechanism_ok": 0, "system_judged": true }