Bellman-Resolvent Uncertainty Targets / report_bench_2026-08-31T160152.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Built and evaluated Bellman-resolvent uncertainty weighting on the structurally matched controlled-pendulum dynamics track with the shared rnn_small architecture. The baseline won slightly: mean test MSE 0.000652883 versus 0.000730047 for the idea, paired delta +0.0000771643 and permutation p=0.43375, so there is no significant improvement. The trained-model mechanism signature was also not confirmed because uncertainty/residual correlation averaged only 0.0727.", "metrics": { "baseline": "Registered dynamics track, rnn_small, tuned sweep lr={0.001,0.003,0.01}, selected lr=0.01; 8-seed mean test MSE 0.000652883", "idea": "Bellman-resolvent weighted loss at lr=0.01; 8-seed mean test MSE 0.000730047; paired delta +0.0000771643; permutation p=0.43375" }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.005440622277092189 }, { "cfg": { "lr": 0.003 }, "mean": 0.0012262430100236088 }, { "cfg": { "lr": 0.01 }, "mean": 0.000702349963830784 } ], "full": { "mean": 0.0006528829871967901, "std": 0.0001692890895210604, "per_seed": [ 0.0006883637397550046, 0.00054119125707075, 0.0005475711077451706, 0.0010322737507522106, 0.00068665825529024, 0.00041018708725459874, 0.0006441730074584484, 0.0006726456922478974 ], "n": 8 } }, "idea": { "mean": 0.0007300472607312258, "std": 0.0002903965020952602, "per_seed": [ 0.0010002460330724716, 0.00031693512573838234, 0.0007908044499345124, 0.0009665557299740613, 0.000615738972555846, 0.000473311694804579, 0.00047172754420898855, 0.0012050585355609655 ], "n": 8 }, "comparison": { "delta_mean": 7.716427353443578e-05, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.000311882293317467, -0.00022425613133236766, 0.00024323334218934178, -6.571802077814937e-05, -7.091928273439407e-05, 6.31246075499802e-05, -0.00017244546324945986, 0.0005324128433130682 ], "p_value": 0.43375, "mde": 0.00022023526291826335, "mde_rel_pct": 33.732731168851956, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "structural_match": "dynamics controlled pendulum rollout; shared rnn_small", "idea_grid": [ 0.001, 0.003, 0.01 ], "baseline_grid_union": [ 0.001, 0.003, 0.01 ], "mechanism_signature": { "predicted": "higher propagated Bellman uncertainty tracks larger neural-network residuals", "predicted_sign": "positive correlation", "observed_mean_corr": 0.0726964430386442, "observed_corr_per_seed": [ 0.07096080660950917, -0.07323832720421877, 0.18244864224380744, 0.13663901810339665, 0.0744279022054703, -0.01757320069773833, 0.1342003985639885, 0.07370630448493865 ], "confirmed": false }, "n_train": 400, "n_test": 200, "epochs": 15 } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_experiment.py", "files": [ "bench_experiment.py", "bench_results.json" ], "limitations": "Only the registered dynamics track was tested. The experiment did not test CartPole, DQN/SAC, policy improvement, offline replay buffers, larger datasets, longer schedules, or calibration beyond the trained-model uncertainty/residual correlation. The empirical transition operator used compact nearest prototypes and a simplified supervised one-step target fluctuation.", "system_verdict": "failed", "practical_verdict": "inconclusive", "mechanism_ok": 0, "system_judged": true }