Discounted Saddle-Gap Controller / report_bench_2026-09-04T171408.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Implemented the Discounted Saddle-Gap Controller on the structurally matched built-in dynamics track using paired rnn_small systems, discounted adversarial probes, hysteretic learning-rate control, and optimizer-state clearing. Mean test MSE was lower for the idea, but the paired permutation test was not significant, so there is no verified benchmark win. The mechanism signature was not confirmed because the probe gap was zero for every trained model.", "metrics": { "baseline": "8-seed mean test MSE 0.000710839 ± 0.000202608; best lr=0.006, epochs=18.", "idea": "8-seed mean test MSE 0.000624476 ± 0.000172594; best lr=0.006, rho=0.9, k=2, epochs=18; paired delta=-0.0000863621, p=0.47205, 5/8 wins." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json", "bench_stdout.txt" ], "limitations": "Only the built-in dynamics/rnn_small track was tested. The adversarial probe gap collapsed to zero on all trained models, so the controller did not demonstrably respond to a meaningful saddle-gap signal. No GAN, vision, tabular, or sequence track was evaluated, and no separate wall-clock or FLOP measurement was recorded.", "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 18, "rho": 0.9, "k": 2 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 18, "rho": 0.9, "k": 2 }, "mean": 0.0026806407840922475 }, { "cfg": { "lr": 0.003, "epochs": 18, "rho": 0.9, "k": 2 }, "mean": 0.001453446806408465 }, { "cfg": { "lr": 0.006, "epochs": 18, "rho": 0.9, "k": 2 }, "mean": 0.0007141287642298266 } ], "full": { "mean": 0.0007108385761966929, "std": 0.00020260791778280052, "per_seed": [ 0.0008331689168699086, 0.0007008879329077899, 0.0006333848577924073, 0.0008832181920297444, 0.0010298240231350064, 0.0005573644884862006, 0.00032093568006530404, 0.0007279245182871819 ], "n": 8 } }, "idea": { "mean": 0.0006244764626899268, "std": 0.00017259395969689844, "per_seed": [ 0.0005345472018234432, 0.0004471810825634748, 0.0004362085019238293, 0.0008414528565481305, 0.00048033404164016247, 0.0008765239617787302, 0.0005815455224364996, 0.0007980185328051448 ], "n": 8 }, "comparison": { "delta_mean": -8.636211350676604e-05, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.0002986217150464654, -0.00025370685034431517, -0.00019717635586857796, -4.1765335481613874e-05, -0.000549489981494844, 0.0003191594732925296, 0.00026060984237119555, 7.009401451796293e-05 ], "p_value": 0.47205, "mde": 0.0002470609130160734, "mde_rel_pct": 34.75626130730844, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "claim": "discounted probe gap is lower late than over training on trained dynamics models", "observed_mean_gap": 0.0, "observed_late_gap": 0.0, "confirmed": false } }, "system_verdict": "failed", "practical_verdict": "inconclusive", "mechanism_ok": 0, "system_judged": true }