Fading-Memory Habituation Gate / report_bench_2026-09-02T225317.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 10, "verdict": "Implemented the fading-memory habituation gate in a matched sequence transformer_tiny system and ran the full 8-seed paired protocol with a parity-preserving baseline learning-rate sweep. The mechanism matched its predicted steady-state gain and recovery slope, but trained task performance was significantly worse: idea test MSE 0.13939 versus baseline 0.13418, delta +0.00520, permutation p=0.0081, with 0/8 paired wins. Thus the mechanism transfers mathematically but not as a benchmark performance win.", "metrics": { "baseline": "sequence/transformer_tiny; best lr=0.0015; full 8-seed mean test MSE 0.1341835428, std 0.0076598566", "idea": "best cfg lr=0.0015, rho=0.9, beta=0.5; full 8-seed mean test MSE 0.1393878823, std 0.0115220628", "comparison": "delta_mean=+0.0052043395, p_value=0.0081, idea_wins=0/8, verdict=idea worse (significant)", "mechanism_signature": "trained model mean_state=0.6669986, mean_gain=0.7588040, first_gain=0.9565723, last_gain=0.7013749; predicted-vs-observed steady gain absolute error=1.67e-16 and recovery slope absolute error=0.0; confirmed=true" }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.0015 }, "sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.1378745660185814 }, { "cfg": { "lr": 0.003 }, "mean": 0.15594297274947166 }, { "cfg": { "lr": 0.006 }, "mean": 0.18980268761515617 } ], "full": { "mean": 0.13418354280292988, "std": 0.0076598566165628846, "per_seed": [ 0.14167749881744385, 0.1361875683069229, 0.1388712227344513, 0.1347619742155075, 0.13164938986301422, 0.12680462002754211, 0.14429330825805664, 0.11922276020050049 ], "n": 8 } }, "idea": { "mean": 0.1393878823146224, "std": 0.011522062825842876, "per_seed": [ 0.1466989368200302, 0.14225052297115326, 0.1430283635854721, 0.13774199783802032, 0.13372863829135895, 0.13080823421478271, 0.16135968267917633, 0.11948668211698532 ], "n": 8, "best_cfg": { "lr": 0.0015, "rho": 0.9, "beta": 0.5 } }, "comparison": { "delta_mean": 0.005204339511692524, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.005021438002586365, 0.006062954664230347, 0.004157140851021119, 0.0029800236225128174, 0.0020792484283447266, 0.004003614187240601, 0.01706637442111969, 0.00026392191648483276 ], "p_value": 0.0081, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "mean_state": 0.666998565196991, "mean_gain": 0.7588040232658386, "first_gain": 0.9565722942352295, "last_gain": 0.701374888420105, "steady_gain_predicted": 0.22727272727272727, "steady_gain_observed": 0.22727272727272743, "steady_abs_error": 1.6653345369377348e-16, "rho": 0.9, "recovery_slope_predicted": -0.10536051565782628, "recovery_slope_observed": -0.10536051565782628, "slope_abs_error": 0.0, "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "Only the structurally matched sequence forecast track was tested; no inference KV-cache implementation, latency measurement, other bench tracks, or broader rho/beta sweep was evaluated.", "system_verdict": "partial", "practical_verdict": "harms", "mechanism_ok": 1, "system_judged": true }