Gram-Whitened Directional Pooling / report_bench_2026-09-01T133239.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Implemented Gram-whitened directional pooling as an end-to-end CNN readout with learnable normalized atoms, soft partition-of-unity weights, finite Gram estimation, and ridge whitening. On the required 8-seed vision benchmark, the idea was slightly worse than the tuned baseline (error 0.798125 vs 0.795000; paired delta +0.003125; permutation p=0.8129), so there is no significant win. The trained-model mechanism signature was confirmed: partition-of-unity error was 1.19e-7 and projected energy 0.07936 was below pooled feature energy 0.08952, but this did not translate into task improvement.", "metrics": { "baseline": "vision/cnn_small error mean=0.79499997, std=0.02091650, best lr=0.001, epochs=8.", "idea": "Gram-whitened directional CNN error mean=0.79812498, std=0.03741134, best tested lr=0.003, epsilon=0.35, lambda=0.01, epochs=8; paired delta=+0.00312500, p=0.8129, 4/8 seed wins." }, "bench_report": { "bench_version": 1, "track": "vision", "model": "cnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "epochs": 8, "epsilon": 0.25, "lam": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 8, "epsilon": 0.25, "lam": 0.01 }, "mean": 0.7974999696016312 }, { "cfg": { "lr": 0.003, "epochs": 8, "epsilon": 0.25, "lam": 0.01 }, "mean": 0.8012499809265137 }, { "cfg": { "lr": 0.006, "epochs": 8, "epsilon": 0.25, "lam": 0.01 }, "mean": 0.8087499737739563 } ], "full": { "mean": 0.794999971985817, "std": 0.020916503869207948, "per_seed": [ 0.7799999713897705, 0.7999999523162842, 0.824999988079071, 0.7849999666213989, 0.8299999833106995, 0.7649999856948853, 0.7899999618530273, 0.7849999666213989 ], "n": 8 } }, "idea": { "mean": 0.7981249764561653, "std": 0.037411342897785256, "per_seed": [ 0.7799999713897705, 0.8549999594688416, 0.8549999594688416, 0.7549999952316284, 0.8100000023841858, 0.7549999952316284, 0.7749999761581421, 0.7999999523162842 ], "n": 8 }, "comparison": { "delta_mean": 0.003125004470348358, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.05500000715255737, 0.029999971389770508, -0.029999971389770508, -0.019999980926513672, -0.009999990463256836, -0.014999985694885254, 0.014999985694885254 ], "p_value": 0.8129, "mde": 0.02385367502560343, "mde_rel_pct": 3.0004623731016924, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "predicted_pou_error~0": 1.1920928955078125e-07, "observed_pooled_energy": 0.08952471613883972, "observed_ridge_projected_energy": 0.07936406880617142, "prediction_projected_le_raw": true, "confirmed": true, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 8, "epsilon": 0.25, "lam": 0.01 }, "mean": 0.844374991953373 }, { "cfg": { "lr": 0.003, "epochs": 8, "epsilon": 0.35, "lam": 0.01 }, "mean": 0.7981249764561653 }, { "cfg": { "lr": 0.006, "epochs": 8, "epsilon": 0.25, "lam": 0.01 }, "mean": 0.8024999797344208 } ], "structural_match": "vision CNN spatial directional pooling; same task and trained systems" } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "Tested only the built-in CIFAR-10 subset vision track, cnn_small architecture, 8 epochs, 400 training and 200 test samples per seed, and three learning rates with fixed epsilon/lambda choices. Rotation robustness, larger datasets, alternative atom counts, annealed epsilon, and FLOP/throughput measurements were not tested.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }