Gauge-Free Spectral OT Layer / report_bench_2026-09-01T134833.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 10, "verdict": "Implemented and evaluated gauge-free covariance-whitened OT attention on the registered sequence track with the shared transformer_tiny-style architecture and canonical training loop. The idea did not improve test MSE: baseline mean 1.0048756599 versus idea mean 1.0048756525, paired permutation p=1.0. The trained-model mechanism signature failed quantitatively, with observed idea-to-baseline row/column plan-change ratio 6200.737 rather than suppression.", "metrics": { "baseline": { "best_cfg": { "lr": 0.003, "delta": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "delta": 0.0001 }, "mean": 1.0469075739383698 }, { "cfg": { "lr": 0.003, "delta": 0.0001 }, "mean": 1.004875659942627 }, { "cfg": { "lr": 0.01, "delta": 0.0001 }, "mean": 1.015213631093502 } ], "full_mean": 1.004875659942627, "full_std": 0.08302304230055646, "per_seed": [ 1.0032966136932373, 0.8694341778755188, 1.1456023454666138, 1.081549882888794, 0.9330782294273376, 0.9555575847625732, 1.0619580745697021, 0.9885283708572388 ] }, "idea": { "best_cfg": { "lr": 0.003, "delta": 0.0001 }, "mean": 1.0048756524920464, "std": 0.0830230295635864, "per_seed": [ 1.0032966136932373, 0.8694342374801636, 1.1456023454666138, 1.0815497636795044, 0.9330782294273376, 0.9555575847625732, 1.0619581937789917, 0.9885282516479492 ] }, "comparison": { "delta_mean": -7.450580596923828e-09, "idea_wins": 2, "n_pairs": 8, "p_value": 1.0, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "quotient attention suppresses row/column nuisance sensitivity while retaining interaction sensitivity", "baseline_rowcol_plan_rms": 4.0958703095839155e-10, "idea_rowcol_plan_rms": 2.545942379583721e-06, "baseline_interaction_plan_rms": 1.726159410964101e-07, "idea_interaction_plan_rms": 5.0314388317929115e-06, "observed_ratio": 6200.737450574088, "confirmed": false } }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "delta": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "delta": 0.0001 }, "mean": 1.0469075739383698 }, { "cfg": { "lr": 0.003, "delta": 0.0001 }, "mean": 1.004875659942627 }, { "cfg": { "lr": 0.01, "delta": 0.0001 }, "mean": 1.015213631093502 } ], "full": { "mean": 1.004875659942627, "std": 0.08302304230055646, "per_seed": [ 1.0032966136932373, 0.8694341778755188, 1.1456023454666138, 1.081549882888794, 0.9330782294273376, 0.9555575847625732, 1.0619580745697021, 0.9885283708572388 ], "n": 8 } }, "idea": { "mean": 1.0048756524920464, "std": 0.0830230295635864, "per_seed": [ 1.0032966136932373, 0.8694342374801636, 1.1456023454666138, 1.0815497636795044, 0.9330782294273376, 0.9555575847625732, 1.0619581937789917, 0.9885282516479492 ], "n": 8 }, "comparison": { "delta_mean": -7.450580596923828e-09, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 0.0, 5.960464477539063e-08, 0.0, -1.1920928955078125e-07, 0.0, 0.0, 1.1920928955078125e-07, -1.1920928955078125e-07 ], "p_value": 1.0, "mde": 6.759130857174038e-08, "mde_rel_pct": 6.726335532457765e-06, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "idea_config": { "lr": 0.003, "delta": 0.0001 }, "idea_sweep": [ { "cfg": { "lr": 0.001, "delta": 0.0001 }, "result": { "mean": 1.046907588839531, "std": 0.07630641547099135, "per_seed": [ 1.033826470375061, 0.9115373492240906, 1.1899056434631348, 1.0792663097381592, 0.9867245554924011, 1.0289349555969238, 1.0983328819274902, 1.0467325448989868 ], "n": 8 } }, { "cfg": { "lr": 0.003, "delta": 0.0001 }, "result": { "mean": 1.0048756524920464, "std": 0.0830230295635864, "per_seed": [ 1.0032966136932373, 0.8694342374801636, 1.1456023454666138, 1.0815497636795044, 0.9330782294273376, 0.9555575847625732, 1.0619581937789917, 0.9885282516479492 ], "n": 8 } }, { "cfg": { "lr": 0.01, "delta": 0.0001 }, "result": { "mean": 1.0152136087417603, "std": 0.07053051427342504, "per_seed": [ 1.039136290550232, 0.8907526731491089, 1.1310786008834839, 1.0511094331741333, 1.0021077394485474, 0.9427624940872192, 1.071175456047058, 0.9935861825942993 ], "n": 8 } } ], "mechanism_signature": { "prediction": "quotient attention suppresses row/column nuisance sensitivity while retaining interaction sensitivity", "baseline": { "kind": "baseline", "rowcol_plan_rms": 4.0958703095839155e-10, "interaction_plan_rms": 1.726159410964101e-07 }, "idea": { "kind": "idea", "rowcol_plan_rms": 2.545942379583721e-06, "interaction_plan_rms": 5.0314388317929115e-06 }, "predicted_ratio_bound": 1.0, "observed_ratio": 6200.737450574088, "confirmed": false } } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "Only the registered built-in sequence forecasting track was tested. No vision, tabular, dynamics, graph-matching, larger K=32, or deeper multi-layer attention evaluation was run; the implementation used a three-coordinate explicit pair-feature map and a small OT attention layer rather than the full proposed high-dimensional feature basis.", "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }