Feasibility-Ranked Group Policy Gradient / report_bench_2026-09-02T233524.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Built a local feasibility-ranked group policy-gradient surrogate on the structurally matched dynamics/rnn_small benchmark, with identical architecture and standard test-MSE evaluation for both systems. Mean MSE improved from 0.00393015 to 0.00148475 with 6/8 paired wins, and the model-derived mechanism signature was confirmed. The paired permutation p-value was 0.0533, so the required significant-win criterion was not met.", "metrics": { "baseline": "Best baseline lr=0.003, mean test MSE=0.0039301491, std=0.0019852212.", "idea": "Best ranked setting wf=2.0,wv=1.0,lr=0.003, mean test MSE=0.0014847495, std=0.0005846185; delta_mean=-0.0024453995; 6/8 wins; permutation p=0.0533.", "mechanism_signature": "Observed normalized advantage variance=0.9999971 and weighted feasible margin=1.6912; confirmed=true." }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "epochs": 10, "wf": 1.0, "wv": 1.0 }, "sweep": [ { "cfg": { "lr": 0.0005, "epochs": 10, "wf": 1.0, "wv": 1.0 }, "mean": 0.2456760956 }, { "cfg": { "lr": 0.0005, "epochs": 10, "wf": 2.0, "wv": 1.0 }, "mean": 0.2456760956 }, { "cfg": { "lr": 0.0005, "epochs": 10, "wf": 3.0, "wv": 0.5 }, "mean": 0.2456760956 }, { "cfg": { "lr": 0.001, "epochs": 10, "wf": 1.0, "wv": 1.0 }, "mean": 0.0231512931 }, { "cfg": { "lr": 0.001, "epochs": 10, "wf": 2.0, "wv": 1.0 }, "mean": 0.0231512931 }, { "cfg": { "lr": 0.001, "epochs": 10, "wf": 3.0, "wv": 0.5 }, "mean": 0.0231512931 }, { "cfg": { "lr": 0.003, "epochs": 10, "wf": 1.0, "wv": 1.0 }, "mean": 0.0039301491 }, { "cfg": { "lr": 0.003, "epochs": 10, "wf": 2.0, "wv": 1.0 }, "mean": 0.0039301491 }, { "cfg": { "lr": 0.003, "epochs": 10, "wf": 3.0, "wv": 0.5 }, "mean": 0.0039301491 } ], "full": { "mean": 0.003930149076, "std": 0.001985221219, "per_seed": [ 0.001290512038, 0.003923733719, 0.004607336596, 0.005378642119, 0.001359768445, 0.002192517277, 0.006944973487, 0.005743708927 ], "n": 8 } }, "idea": { "mean": 0.001484749548, "std": 0.000584618535, "per_seed": [ 0.002039443469, 0.000948414323, 0.001109164441, 0.000987955485, 0.002350056544, 0.002045162255, 0.00068665843, 0.001711141434 ], "n": 8, "best_cfg": { "lr": 0.003, "epochs": 10, "wf": 2.0, "wv": 1.0 }, "sweep": [ { "cfg": { "lr": 0.003, "epochs": 10, "wf": 2.0, "wv": 1.0 }, "mean": 0.001484749548 }, { "cfg": { "lr": 0.003, "epochs": 10, "wf": 3.0, "wv": 0.5 }, "mean": 0.002001789063 }, { "cfg": { "lr": 0.003, "epochs": 10, "wf": 4.0, "wv": 0.25 }, "mean": 0.001844244835 } ] }, "comparison": { "delta_mean": -0.002445399528, "idea_wins": 6, "n_pairs": 8, "per_seed_diffs": [ 0.00074893143, -0.002975319395, -0.003498172155, -0.004390686634, 0.000990288099, -0.000147355022, -0.006258315058, -0.004032567493 ], "p_value": 0.0533, "mde": 0.002223949478, "mde_rel_pct": 56.5869, "verdict": "no significant win", "system_worked": false }, "protocol_note": "8 paired seeds; baseline sweep and idea 3-setting sweep; lower MSE better", "mechanism_signature": { "observed_test_abs_error_mean": 0.0365568064, "observed_test_feasibility_rate": 1.0, "observed_ranked_normalized_adv_variance": 0.9999971305, "observed_weighted_feasible_margin": 1.691169739, "prediction": "normalized group variance approximately one; feasible weighted margin positive", "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_experiment.py", "files": [ "bench_experiment.py", "bench_report.json" ], "limitations": "Only the built-in dynamics regression track was tested; no CartPole/Pendulum environment, learned-critic PPO comparison, longer training budget, larger seed count, or independent replication was run. The custom surrogate uses stochastic prediction groups and a small supervised anchor because the benchmark exposes supervised sequence regression rather than rollout interaction.", "system_verdict": "partial", "practical_verdict": "inconclusive", "mechanism_ok": 1, "system_judged": true }