Laplace-Heterogeneous MoE Routing / report_bench_2026-08-31T223231.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "The officially registered custom heterogeneous-regime MoE benchmark found no win for Laplace-Heterogeneous routing. The best idea MSE was 0.3042489160 versus tuned baseline MSE 0.3030446615, with paired delta +0.0012042541 and permutation p=0.8799. The trained-model mechanism signature was not confirmed: predicted raw pressure CV was 0.1783 while observed routed-load CV was 0.4250.", "metrics": { "baseline": "MSE 0.3030446615, lr=0.006, aux=0.05, epochs=3, 8 seeds", "idea": "MSE 0.3042489160, lr=0.006, alpha=2.0, beta=0.9, epochs=3, 8 seeds", "paired_delta_mean": 0.0012042541056871414, "permutation_pvalue": 0.8799, "idea_wins": 3, "n_pairs": 8 }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json", "/home/maxwelhelp/all/math2nn/bench/custom_tracks/heterogeneous_regime_moe.py" ], "limitations": "The built-in tracks lacked MoE routing structure, so the custom track was officially promoted with bench.validate_and_promote. The reduced but complete protocol used 200 train samples, 200 test samples, 8 experts, top-2 routing, and 3 epochs; no large Transformer, learned mixture parameters, capacity overflow dispatch, or throughput study was tested.", "bench_report": { "bench_version": 1, "track": "heterogeneous_regime_moe", "model": "custom_sparse_moe", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "alpha": 0.0, "aux": 0.05, "beta": 0.9, "wd": 0.0, "epochs": 3 }, "sweep": [ { "cfg": { "lr": 0.001, "aux": 0.0 }, "mean": 0.3828819804 }, { "cfg": { "lr": 0.001, "aux": 0.02 }, "mean": 0.3829777471 }, { "cfg": { "lr": 0.001, "aux": 0.05 }, "mean": 0.3831127425 }, { "cfg": { "lr": 0.001, "aux": 0.1 }, "mean": 0.3834027647 }, { "cfg": { "lr": 0.003, "aux": 0.0 }, "mean": 0.321269989 }, { "cfg": { "lr": 0.003, "aux": 0.02 }, "mean": 0.3187646864 }, { "cfg": { "lr": 0.003, "aux": 0.05 }, "mean": 0.3176380399 }, { "cfg": { "lr": 0.003, "aux": 0.1 }, "mean": 0.3171907961 }, { "cfg": { "lr": 0.006, "aux": 0.0 }, "mean": 0.3090713192 }, { "cfg": { "lr": 0.006, "aux": 0.02 }, "mean": 0.3058390431 }, { "cfg": { "lr": 0.006, "aux": 0.05 }, "mean": 0.3030446615 }, { "cfg": { "lr": 0.006, "aux": 0.1 }, "mean": 0.3041238932 } ], "full": { "mean": 0.3030446615, "std": 0.0492813, "per_seed": [ 0.3340249956, 0.3469650149, 0.2999320328, 0.3352453113, 0.2639300525, 0.2693466544, 0.2422015667, 0.3327103774 ], "n": 8 } }, "idea": { "best_cfg": { "lr": 0.006, "alpha": 2.0, "beta": 0.9, "wd": 0.0, "epochs": 3 }, "sweep": [ { "cfg": { "lr": 0.001, "alpha": 0.5 }, "mean": 0.3829677515 }, { "cfg": { "lr": 0.001, "alpha": 1.0 }, "mean": 0.3830015771 }, { "cfg": { "lr": 0.001, "alpha": 2.0 }, "mean": 0.3818103075 }, { "cfg": { "lr": 0.003, "alpha": 0.5 }, "mean": 0.321269989 }, { "cfg": { "lr": 0.003, "alpha": 1.0 }, "mean": 0.3213426806 }, { "cfg": { "lr": 0.003, "alpha": 2.0 }, "mean": 0.3229005374 }, { "cfg": { "lr": 0.006, "alpha": 0.5 }, "mean": 0.3090713192 }, { "cfg": { "lr": 0.006, "alpha": 1.0 }, "mean": 0.3074618801 }, { "cfg": { "lr": 0.006, "alpha": 2.0 }, "mean": 0.304248916 } ], "per_seed": [ 0.3405990899, 0.3489361107, 0.2619922161, 0.3619314134, 0.2746115923, 0.2645150423, 0.2257442027, 0.3556616604 ], "mean": 0.304248916, "std": 0.04961677095, "n": 8 }, "comparison": { "delta_mean": 0.0012042541056871414, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.0065740943, 0.0019710958, -0.0379398167, 0.0266861022, 0.0106815398, -0.0048316121, -0.016457364, 0.0229499936 ], "p_value": 0.8799, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "predicted_raw_pressure_cv_reduction": 0.1782733512, "observed_trained_routed_load_cv": 0.4249846712, "confirmed": false }, "custom_track": { "name": "heterogeneous_regime_moe", "file": "stage2_bench.py", "domain": "moe-routing" } }, "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }