Gale-Nullspace Feature Mixer / report_bench_2026-09-01T165502.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Built and trained an end-to-end Gale nullspace mixer on the structurally matched sequence forecast track using the canonical transformer training loop. The core SVD check passed with maximum residual 5.56e-15, and the trained-model null residual averaged 9.66e-7. Test MSE changed from 0.306645 to 0.306060, but the paired delta was -0.000585 with permutation p=0.18685, so there was no significant benchmark win.", "metrics": { "baseline": "Test MSE mean 0.3066449799, std 0.0326071854; best lr 0.001", "idea": "Test MSE mean 0.3060599342, std 0.0324784173; best lr 0.001; paired delta -0.0005850457; 5/8 wins; permutation p=0.18685" }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.2947123125195503 }, { "cfg": { "lr": 0.003 }, "mean": 0.3950112909078598 }, { "cfg": { "lr": 0.006 }, "mean": 0.6112398952245712 } ], "full": { "mean": 0.3066449798643589, "std": 0.032607185412887076, "per_seed": [ 0.34020674228668213, 0.267076700925827, 0.2600124776363373, 0.31155332922935486, 0.3084578514099121, 0.3220774829387665, 0.36002540588378906, 0.28374984860420227 ], "n": 8 } }, "idea": { "mean": 0.30605993419885635, "std": 0.03247841729165149, "per_seed": [ 0.3398566246032715, 0.26776447892189026, 0.2589544951915741, 0.3121564984321594, 0.3084918260574341, 0.3192761540412903, 0.35937950015068054, 0.28259989619255066 ], "n": 8 }, "comparison": { "delta_mean": -0.0005850456655025482, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.00035011768341064453, 0.0006877779960632324, -0.0010579824447631836, 0.0006031692028045654, 3.3974647521972656e-05, -0.0028013288974761963, -0.0006459057331085205, -0.0011499524116516113 ], "p_value": 0.18685, "mde": 0.0009443470728781248, "mde_rel_pct": 0.3079610412327136, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "Dual summary should have low linear overlap with primary summary while Gale residual remains numerical roundoff.", "predicted_abs_summary_corr_max": 0.2, "observed_abs_summary_corr_mean": 0.1512247179634869, "observed_null_residual_mean": 9.662536939458732e-07, "observed_gate_mean": 0.4977433420717716, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.2946830242872238 }, { "cfg": { "lr": 0.003 }, "mean": 0.4010865166783333 }, { "cfg": { "lr": 0.006 }, "mean": 0.5471484512090683 } ], "core_math_check": { "max_residual": 5.559546421959475e-15, "passed": true }, "setup": { "epochs": 8, "n_train": 1200, "n_test": 400, "a": 8, "window": 32 } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 gale_stage2_bench.py", "files": [ "gale_stage2_bench.py", "bench_report.json" ], "limitations": "Only the built-in sequence forecast track was tested; no WikiText-2, six-layer 128-dimensional Transformer, randomized-SVD inference, learned diagonal gauge, activation-memory measurement, or equal-parameter memory study was run.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }