Gauge-Free Inverse OT Attention / report_bench_2026-09-02T171818.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Built an end-to-end Gauge-Free Inverse OT Attention transformer by replacing row-softmax attention with differentiable log-domain Sinkhorn attention, while keeping the transformer architecture, Adam optimizer, batch size, epochs, and paired seeds matched. On the corrected benchmark, baseline test MSE was 0.92694 and the idea was 0.93569, giving delta_mean +0.00875 with permutation p=0.75565; therefore there is no significant win. The trained-model mechanism signature also did not confirm the predicted marginal error below 1e-4: observed row error was 0.00786, although column error was 1.13e-8.", "metrics": { "baseline": "Sequence/transformer_tiny, tuned lr=0.006; full 8-seed test MSE mean 0.9269421473, std 0.0813036234; per-seed [0.9268826246, 0.8607907891, 0.8572450280, 0.8207906485, 1.0688729286, 0.9266430140, 1.0371272564, 0.9171848893]", "idea": "Sinkhorn attention, best tested eps=0.5 at lr=0.006; full 8-seed test MSE mean 0.9356912449, std 0.0569688326; per-seed [0.9681993127, 0.8495118022, 0.9008096457, 0.9619098306, 0.9716687799, 0.9182450175, 1.0382701159, 0.8769154549]", "paired_delta": "Mean idea-baseline MSE delta +0.0087490976; idea wins 4/8 pairs; permutation p-value 0.75565", "mechanism_signature": "Predicted maximum row/column marginal error <1e-4; observed mean row error 0.0078572490, observed mean column error 1.1294106e-8, mean minimum attention entry 1.0011e-14, confirmed=false" }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "eps": 0.7, "iters": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "eps": 0.7, "iters": 12 }, "mean": 0.9074711948633194 }, { "cfg": { "lr": 0.003, "eps": 0.7, "iters": 12 }, "mean": 0.915537878870964 }, { "cfg": { "lr": 0.006, "eps": 0.7, "iters": 12 }, "mean": 0.8664272725582123 } ], "full": { "mean": 0.9269421473145485, "std": 0.08130362337327321, "per_seed": [ 0.9268826246261597, 0.8607907891273499, 0.8572450280189514, 0.8207906484603882, 1.0688729286193848, 0.9266430139541626, 1.0371272563934326, 0.9171848893165588 ], "n": 8 } }, "idea": { "mean": 0.9356912449002266, "std": 0.05696883264914271, "per_seed": [ 0.9681993126869202, 0.8495118021965027, 0.900809645652771, 0.961909830570221, 0.9716687798500061, 0.9182450175285339, 1.038270115852356, 0.876915454864502 ], "n": 8 }, "comparison": { "delta_mean": 0.0087490975856781, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.0413166880607605, -0.011278986930847168, 0.04356461763381958, 0.14111918210983276, -0.09720414876937866, -0.008397996425628662, 0.0011428594589233398, -0.040269434452056885 ], "p_value": 0.75565, "mde": 0.05842531038665775, "mde_rel_pct": 6.303015841487215, "verdict": "no measurable effect", "system_worked": false }, "idea_sweep": [ { "lr": 0.006, "eps": 0.5, "iters": 12 }, { "lr": 0.006, "eps": 0.7, "iters": 12 }, { "lr": 0.006, "eps": 1.0, "iters": 12 } ], "track_justification": "Sequence forecast contains multi-token correlations and directly exercises attention.", "mechanism_signature": { "predicted_max_marginal_error": 0.0001, "observed_mean_row_marginal_error": 0.007857249001972377, "observed_mean_column_marginal_error": 1.1294105761727735e-08, "observed_min_attention_mean": 1.0011145091900235e-14, "confirmed": false } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_experiment.py", "files": [ "bench_experiment.py", "bench_report.json" ], "limitations": "The inverse-cost consistency penalty and recovered cost were not used as a learned auxiliary loss or next-block bias; this benchmark tested the core Sinkhorn attention replacement only. The local loop was used because the intervention changes the attention forward pass. No FLOP or wall-clock comparison, larger datasets, alternative sequence lengths, or multi-head implementation was tested.", "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }