Spectral pinning of neural modules / report_bench_2026-09-02T015625.md

✓✓ Beats tuned baseline

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": true, "confidence": 8, "verdict": "Re-ran the full Stage-2 protocol on the registered built-in dynamics track with matched four-module GRU systems. Spectral-greedy pinning improved test MSE significantly: paired delta -0.0004116853, 7/8 wins, permutation p=0.0245, yielding the required bench verdict.", "metrics": { "baseline": "Mean test MSE 0.0037503628409467638; best lr=0.01, consensus=0.0.", "idea": "Mean test MSE 0.0033386775467079133; paired delta -0.0004116852942388505; 7/8 wins; p=0.0245." }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "consensus": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "consensus": 0.0 }, "mean": 0.19337305054068565 }, { "cfg": { "lr": 0.001, "consensus": 0.01 }, "mean": 0.19314046204090118 }, { "cfg": { "lr": 0.001, "consensus": 0.05 }, "mean": 0.1922968477010727 }, { "cfg": { "lr": 0.003, "consensus": 0.0 }, "mean": 0.014081272296607494 }, { "cfg": { "lr": 0.003, "consensus": 0.01 }, "mean": 0.013959631556645036 }, { "cfg": { "lr": 0.003, "consensus": 0.05 }, "mean": 0.013560101622715592 }, { "cfg": { "lr": 0.01, "consensus": 0.0 }, "mean": 0.004480039002373815 }, { "cfg": { "lr": 0.01, "consensus": 0.01 }, "mean": 0.004745688289403915 }, { "cfg": { "lr": 0.01, "consensus": 0.05 }, "mean": 0.0076980371959507465 } ], "full": { "mean": 0.0037503628409467638, "std": 0.0010392951000048232, "per_seed": [ 0.003767967689782381, 0.004212214145809412, 0.0051866089925169945, 0.004753365181386471, 0.00401176605373621, 0.002003958448767662, 0.002254849299788475, 0.0038121729157865047 ], "n": 8 } }, "idea": { "mean": 0.0033386775467079133, "std": 0.000882734589731385, "per_seed": [ 0.0032974749337881804, 0.004293782636523247, 0.00453130342066288, 0.003945973236113787, 0.003240686608478427, 0.001959612825885415, 0.0020674322731792927, 0.003373154439032078 ], "n": 8 }, "comparison": { "delta_mean": -0.0004116852942388505, "idea_wins": 7, "n_pairs": 8, "per_seed_diffs": [ -0.0004704927559942007, 8.156849071383476e-05, -0.0006553055718541145, -0.0008073919452726841, -0.0007710794452577829, -4.434562288246697e-05, -0.00018741702660918236, -0.00043901847675442696 ], "p_value": 0.0245, "mde": 0.00027872874101319965, "mde_rel_pct": 7.432047320062389, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "pins": [ 2, 0 ], "lambda_min_grounded": 0.21781201402076653, "test_representation_disagreement": 0.01838405802845955, "task_prediction_disagreement": 0.0007268482004292309, "baseline_random_gap": 0.2000357110567112, "confirmed": false } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "Only the registered built-in dynamics track was tested, using four GRU modules and a fixed four-node graph. No vision, sequence, MoE, throughput, communication-cost, asynchronous-worker, or external-teacher experiments were run; the exact temporal decay-rate signature was not confirmed from final snapshots.", "system_verdict": "worked", "practical_verdict": "helps", "mechanism_ok": 0, "system_judged": true }