Correlated stochastic integrate-and-fire recurrent layer / report_bench_2026-09-04T210923.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 10, "verdict": "Implemented the correlated stochastic integrate-and-fire recurrent layer and evaluated it against a matched deterministic leaky recurrent system on the structurally appropriate dynamics track. The trained-model mechanism signature was confirmed quantitatively: observed shared-noise covariance factor 0.42043 versus predicted 0.42250. The idea nevertheless lost significantly on dynamics MSE, 0.0702823 versus 0.00186508, paired delta +0.0684172 with permutation p=0.0081, so it does not provide a benchmark win.", "metrics": { "baseline": "dynamics MSE mean 0.00186508 over 8 paired seeds; best lr=0.01", "idea": "dynamics MSE mean 0.07028228 over 8 paired seeds; best lr=0.01; mean spike rate 0.03861", "mechanism_signature": "predicted covariance factor 0.42250; observed trained-model mean 0.42043; confirmed=true" }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.07048395439051092 }, { "cfg": { "lr": 0.003 }, "mean": 0.0036796721105929464 }, { "cfg": { "lr": 0.01 }, "mean": 0.0020796392345800996 } ], "full": { "mean": 0.0018650785204954445, "per_seed": [ 0.0020393452141433954, 0.0022905797231942415, 0.0019529510755091906, 0.002035680925473571, 0.0009734529303386807, 0.003012745874002576, 0.0011985950404778123, 0.001417277380824089 ] } }, "idea": { "mean": 0.07028227765113115, "per_seed": [ 0.09344271570444107, 0.035067640244960785, 0.06569516658782959, 0.06504810601472855, 0.057421158999204636, 0.045870814472436905, 0.06615367531776428, 0.1335589438676834 ] }, "comparison": { "delta_mean": 0.06841719913063571, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.09140337049029768, 0.03277706052176654, 0.0637422155123204, 0.06301242508925498, 0.056447706068865955, 0.04285806859843433, 0.06495508027728647, 0.13214166648685932 ], "p_value": 0.0081, "mde": 0.02590531560040504, "mde_rel_pct": 1388.9664867044569, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted_shared_covariance_factor": 0.4225, "observed_shared_noise_correlation_mean": 0.42043366931669834, "observed_shared_noise_correlation_per_seed": [ 0.4126678738329091, 0.4521553626790912, 0.41302410068546774, 0.40544973371858345, 0.4157424909414776, 0.44676270990572226, 0.4155898912561236, 0.40207719151421156 ], "spike_rate_mean": 0.03861450147815049, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.6029151976108551 }, { "cfg": { "lr": 0.003 }, "mean": 0.2946254089474678 }, { "cfg": { "lr": 0.01 }, "mean": 0.06481340713799 } ] }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_exp.py", "files": [ "bench_exp.py", "bench_report.json", "bench_run.log" ], "limitations": "Only the built-in dynamics track was tested, with 400 training and 200 test examples, 8 epochs, hidden width 64, and three learning rates. No longer-horizon rollout, refractory/noise/rho ablation, larger dataset, or additional task track was tested.", "system_verdict": "partial", "practical_verdict": "harms", "mechanism_ok": 1, "system_judged": true }