Markov Spectral Equivariant Layer / report_bench_2026-08-31T153159.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "The full registered vision benchmark was completed with eight paired seeds, a tuned baseline sweep, and a matched learning-rate sweep for the Markov-filter system. The mechanism signature was confirmed: the trained idea model had observed maximum filtered-to-input activation ratio 0.974, below the predicted non-expansive bound of 1.0. The task metric nevertheless worsened from baseline error 0.8284 to idea error 0.8434, with paired delta +0.0150 and permutation p=0.19565, so the idea did not win.", "metrics": { "baseline": "cnn_small vision baseline; best lr=0.003; 8-seed test error mean 0.828437477350235.", "idea": "Markov-filter cnn_small; gamma=0.7, best lr=0.003; 8-seed test error mean 0.843437485396862; paired delta +0.015000008046627045; p=0.19565." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_markov.py", "files": [ "bench_markov.py", "bench_report.json" ], "limitations": "The benchmark used only the built-in vision track, 400 training examples, 400 test examples, and 5 epochs. Full SO(3)/Wigner implementation, rotation generalization, FLOPs, deeper networks, larger datasets, and broader filter/gamma sweeps were not tested.", "bench_report": { "bench_version": 1, "track": "vision", "model": "cnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.8612499833106995 }, { "cfg": { "lr": 0.003 }, "mean": 0.8112499713897705 }, { "cfg": { "lr": 0.01 }, "mean": 0.8918749839067459 } ], "full": { "mean": 0.828437477350235, "std": 0.03745701284007905, "per_seed": [ 0.79749995470047, 0.8574999570846558, 0.824999988079071, 0.7649999856948853, 0.8700000047683716, 0.8574999570846558, 0.8650000095367432, 0.7899999618530273 ], "n": 8 } }, "idea": { "mean": 0.843437485396862, "std": 0.03642066574738751, "per_seed": [ 0.7824999690055847, 0.9024999737739563, 0.8700000047683716, 0.8075000047683716, 0.8574999570846558, 0.8349999785423279, 0.8700000047683716, 0.8224999904632568 ], "n": 8 }, "comparison": { "delta_mean": 0.015000008046627045, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ -0.014999985694885254, 0.04500001668930054, 0.04500001668930054, 0.04250001907348633, -0.01250004768371582, -0.02249997854232788, 0.004999995231628418, 0.03250002861022949 ], "p_value": 0.19565, "mde": 0.024531031621491128, "mde_rel_pct": 2.9611204577506394, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "prediction": "positive normalized filter is non-expansive in sup norm", "baseline_signature": { "test_metric": 0.79749995470047, "layer_ratios": [ 1.1681838035583496, 1.1140750646591187, 0.872684895992279 ], "max_ratio": 1.1681838035583496, "prediction": "Markov filter ratio <= 1 relative to pre-filter activation" }, "idea_signature": { "test_metric": 0.7824999690055847, "layer_ratios": [ 0.7950915694236755, 0.97414231300354, 0.9690303802490234 ], "max_ratio": 0.97414231300354, "prediction": "Markov filter ratio <= 1 relative to pre-filter activation" }, "predicted_max_ratio": 1.0, "observed_max_ratio": 0.97414231300354, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.8543749898672104 }, { "cfg": { "lr": 0.003 }, "mean": 0.840624988079071 }, { "cfg": { "lr": 0.01 }, "mean": 0.8699999898672104 } ], "protocol": { "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "epochs": 5, "n_train": 400, "n_test": 400, "filter_gamma": 0.7, "same_lr_grid": true } }, "system_verdict": "partial", "practical_verdict": "inconclusive", "mechanism_ok": 1, "system_judged": true }