Steady-State First-Passage Sensitivity Regularizer / report_bench_2026-09-01T125928.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "The steady-state first-passage sensitivity regularizer was implemented and evaluated on the registered dynamics/rnn_small benchmark with matched architecture and paired seeds. The best idea had higher test MSE than the tuned baseline (0.04840 vs 0.04493), with paired delta +0.00347 and permutation p=0.89505; therefore the idea did not win.", "metrics": { "baseline": "mean test MSE 0.0449314, std 0.0383548, best lr=0.005", "idea": "mean test MSE 0.0484015, std 0.0418776, best lr=0.005; paired delta +0.0034701, p=0.89505" }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.005, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.5572434142231941 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.18839699774980545 }, { "cfg": { "lr": 0.005, "weight_decay": 0.0 }, "mean": 0.04846041998825967 } ], "full": { "mean": 0.044931408134289086, "std": 0.03835479942009323, "per_seed": [ 0.11073682457208633, 0.013142957352101803, 0.052351340651512146, 0.01761055737733841, 0.10532612353563309, 0.013849301263689995, 0.029122132807970047, 0.017312027513980865 ], "n": 8 } }, "idea": { "mean": 0.048401523381471634, "std": 0.0418776346225875, "per_seed": [ 0.018566235899925232, 0.14753688871860504, 0.05397643893957138, 0.04880054295063019, 0.061454158276319504, 0.008690654300153255, 0.037352874875068665, 0.010834393091499805 ], "n": 8 }, "comparison": { "delta_mean": 0.003470115247182548, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ -0.0921705886721611, 0.13439393136650324, 0.0016250982880592346, 0.03118998557329178, -0.04387196525931358, -0.005158646963536739, 0.008230742067098618, -0.00647763442248106 ], "p_value": 0.89505, "mde": 0.054278585169126606, "mde_rel_pct": 120.80321410560086, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "predicted_vs_observed": { "predicted_aux_response": -0.0, "observed_short_fpt_response": -0.25157928466796875, "abs_error": 0.25157928466796875, "confirmed": false, "event_rate": 0.27937498688697815 }, "selected_idea_cfg": { "lr": 0.005, "weight_decay": 0.0 }, "regularizer": "soft regenerative FPT over short hidden-state prefixes" }, "idea_grid": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "full": { "mean": 0.607760451734066, "std": 0.06258788186798508, "per_seed": [ 0.6598727703094482, 0.7312052845954895, 0.6191193461418152, 0.622126042842865, 0.5374733209609982, 0.584874153137207, 0.5832061171531677, 0.5242065787315369 ], "n": 8 } }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "full": { "mean": 0.24948854185640812, "std": 0.08010761069435396, "per_seed": [ 0.28027984499931335, 0.4332640767097473, 0.19582977890968323, 0.19673879444599152, 0.1759151667356491, 0.22718526422977448, 0.2931903898715973, 0.19350501894950867 ], "n": 8 } }, { "cfg": { "lr": 0.005, "weight_decay": 0.0 }, "full": { "mean": 0.048401523381471634, "std": 0.0418776346225875, "per_seed": [ 0.018566235899925232, 0.14753688871860504, 0.05397643893957138, 0.04880054295063019, 0.061454158276319504, 0.008690654300153255, 0.037352874875068665, 0.010834393091499805 ], "n": 8 } } ], "budget": { "epochs": 4, "n_train": 200, "n_test": 200 } }, "how_to_run": "python3 bench_fpt.py", "files": [ "bench_fpt.py", "bench_report.json" ], "limitations": "The complete registered-track run used a reduced equal budget of 4 epochs and 200 training/200 test examples after the initial full-size implementation exceeded the shared 40-minute limit. The intervention is a differentiable soft first-passage surrogate over the eight observed prefixes rather than a learned clustered continuous-time Markov generator with an explicitly solved stationary distribution; long rollouts, large-scale training, alternative target definitions, and ill-conditioned ergodic regimes were not tested.", "system_verdict": "failed", "practical_verdict": "inconclusive", "mechanism_ok": 0, "system_judged": true }