Noise-Triggered Latent Rank Adaptation / report_bench_2026-08-31T115428.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Implemented Noise-Triggered Latent Rank Adaptation as a covariance-controlled hysteretic active mask over a 64-channel GRU on the registered dynamics track. The correction math passed and trained models showed rank adaptation, but the adaptive system was significantly worse than the tuned fixed-width baseline: MSE 0.002004 versus 0.001291, paired delta +0.000713, permutation p=0.0303.", "metrics": { "baseline": "Tuned fixed-width rnn_small, lr=0.006, 8 epochs: mean test MSE 0.001290830463403836 across 8 seeds.", "idea": "Adaptive masked GRU, best of 3 settings: mean test MSE 0.0020039106311742216 across 8 seeds; paired delta +0.0007130801677703857; permutation p=0.0303." }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 8 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 8 }, "mean": 0.006717785610817373 }, { "cfg": { "lr": 0.003, "epochs": 8 }, "mean": 0.001539975477498956 }, { "cfg": { "lr": 0.006, "epochs": 8 }, "mean": 0.0013831749238306656 } ], "full": { "mean": 0.001290830463403836, "std": 0.0005098154991553572, "per_seed": [ 0.001963656395673752, 0.0016316777328029275, 0.0007375201093964279, 0.0011998454574495554, 0.0005706549272872508, 0.0011663567274808884, 0.0010045842500403523, 0.002052348107099533 ], "n": 8 } }, "idea": { "mean": 0.0020039106311742216, "std": 0.0006166624712056951, "per_seed": [ 0.0014695058343932033, 0.0029612784273922443, 0.002112278714776039, 0.0011878599179908633, 0.0012330585159361362, 0.0023434634786099195, 0.0020484665874391794, 0.002675373572856188 ], "n": 8 }, "comparison": { "delta_mean": 0.0007130801677703857, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ -0.0004941505612805486, 0.0013296006945893168, 0.0013747586053796113, -1.198553945869207e-05, 0.0006624035886488855, 0.0011771067511290312, 0.0010438823373988273, 0.0006230254657566547 ], "p_value": 0.0303, "mde": 0.0005597031685205955, "mde_rel_pct": 43.359928696189485, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "activation when lambda_next > 2.0 * noise_floor with persistence=2", "observed_mean_active_rank": 16.0, "observed_min_rank": 2, "observed_max_rank": 30, "observed_structural_events": 28, "observed_crossing_samples": 56, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.006, "epochs": 8, "con": 2.0 }, "mean": 0.0019327307236380875 }, { "cfg": { "lr": 0.001, "epochs": 8, "con": 2.0 }, "mean": 0.0686129005625844 }, { "cfg": { "lr": 0.003, "epochs": 8, "con": 2.0 }, "mean": 0.01151486299932003 } ], "math_check": { "predicted_on_boundary": 2.0, "corrected_population_eigenvalues": [ 0.5, 2.0, 3.0 ], "on_condition": [ false, false, true ], "off_condition": [ true, false, false ], "boundary_exact": true }, "track_match": "dynamics contains recurrent controlled state evolution" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_rank_bench.py", "files": [ "stage2_rank_bench.py", "bench_report.json" ], "limitations": "This uses a fixed maximum-width GRU with masking rather than physically adding/removing optimizer parameters or a diagonal-plus-low-rank SSM. The noise floor is an empirical low-spectrum estimate; inference speed, optimizer-state transfer, decoder transfer during pruning, longer rollouts, and other tracks were not tested.", "system_verdict": "partial", "practical_verdict": "harms", "mechanism_ok": 1, "system_judged": true }