Recycled-curvature proximal optimizer / report_bench_2026-08-31T163740.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 10, "verdict": "Implemented the recycled-curvature proximal optimizer as a custom training-loop intervention on the structurally matched tabular Friedman regression track with the shared mlp_tiny architecture. The full 8-seed paired protocol and shared learning-rate sweep showed the idea was significantly worse: test MSE 124.025 versus baseline 7.418, paired delta +116.607, permutation p=0.0081. The trained-model transport identity was confirmed at mean error 1.59e-6, but the promised evaluation reduction was not observed: 73 versus 72 gradient calls on average.", "metrics": { "baseline": "Adam, best lr=0.03; 8-seed mean test MSE 7.4183, std 0.9955; sweep means lr=0.001:24.1424, lr=0.003:13.7540, lr=0.01:8.3259, lr=0.03:6.8654; final paired-run mean gradient calls 72", "idea": "Recycled-curvature proximal loop, best tested lr=0.03; 8-seed mean test MSE 124.0250, std 19.8886; idea trial means lr=0.003:235.4396, lr=0.01:223.3305, lr=0.03:130.3428; final paired-run mean gradient calls 73", "comparison": "delta_mean=+116.6066 (idea minus baseline), 0/8 idea wins, permutation p=0.0081, verdict=idea worse (significant)", "mechanism_signature": "Mean trained-model residual transport error 1.593e-6 versus predicted zero; confirmed transport arithmetic but not call reduction, with observed call-reduction fraction -0.0139" }, "bench_report": { "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.03 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 24.142436981201172 }, { "cfg": { "lr": 0.003 }, "mean": 13.75401242574056 }, { "cfg": { "lr": 0.01 }, "mean": 8.325917879740397 }, { "cfg": { "lr": 0.03 }, "mean": 6.865411599477132 } ], "full": { "mean": 7.418325066566467, "std": 0.9955428790176792, "per_seed": [ 6.716945648193359, 5.94451379776001, 7.934775352478027, 9.200451850891113, 7.416287899017334, 6.373697280883789, 8.270235061645508, 7.489693641662598 ], "n": 8 } }, "idea": { "mean": 124.02495861053467, "std": 19.888619557248344, "per_seed": [ 133.7542266845703, 95.59589385986328, 161.67819213867188, 123.55552673339844, 96.50812530517578, 130.4013214111328, 120.75763702392578, 129.94874572753906 ], "n": 8, "chosen_cfg": { "lr": 0.03 }, "trials": [ { "cfg": { "lr": 0.003 }, "mean": 235.4395955403646 }, { "cfg": { "lr": 0.01 }, "mean": 223.33053588867188 }, { "cfg": { "lr": 0.03 }, "mean": 130.3427708943685 } ] }, "comparison": { "delta_mean": 116.6066335439682, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 127.03728103637695, 89.65138006210327, 153.74341678619385, 114.35507488250732, 89.09183740615845, 124.02762413024902, 112.48740196228027, 122.45905208587646 ], "p_value": 0.0081, "mde": 17.547701974609687, "mde_rel_pct": 236.54533627402162, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted": { "transport_error": 0.0, "call_reduction_fraction": 0.5 }, "observed": { "mean_transport_error": 1.59325485071804e-06, "mean_idea_grad_calls": 73.0, "mean_baseline_grad_calls": 72.0, "call_reduction_fraction": -0.013888888888888888 }, "confirmed": false } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_experiment.py", "files": [ "bench_experiment.py", "bench_report.json" ], "limitations": "Only the structurally matched tabular/Friedman track and mlp_tiny model were tested; vision, sequence, and dynamics tracks were not tested. The implementation uses a full flattened parameter vector rather than production per-parameter-group L-BFGS storage, and the benchmark's small minibatch regime did not create expensive-gradient savings.", "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }