Expansion-balanced MoE routing / report_bench_2026-08-31T180832.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Expansion-balanced routing produced a small directional improvement but not a statistically significant task-metric win. The benchmark mechanism signature was confirmed directionally, with slightly larger token-group expert neighborhoods and lower routing load dispersion, but bench.make_report() returned no measurable effect because the paired permutation p-value was 0.0863.", "metrics": { "baseline": "Full 8-seed sequence MSE mean 0.9596702233, std 0.0851384368; best baseline config lr=0.003, temperature=0.7, epochs=3.", "idea": "Full 8-seed sequence MSE mean 0.9594315290, std 0.0850028169; paired delta -0.0002386943, 6/8 wins, permutation p=0.0863." }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.0, "epochs": 3 }, "sweep": [ { "cfg": { "lr": 0.001, "temperature": 0.7, "lambda": 0.0, "epochs": 3 }, "mean": 0.9924133718013763 }, { "cfg": { "lr": 0.001, "temperature": 1.0, "lambda": 0.0, "epochs": 3 }, "mean": 0.9980460554361343 }, { "cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.0, "epochs": 3 }, "mean": 0.9220127463340759 }, { "cfg": { "lr": 0.003, "temperature": 1.0, "lambda": 0.0, "epochs": 3 }, "mean": 0.9310937225818634 } ], "full": { "mean": 0.9596702232956886, "std": 0.08513843682164902, "per_seed": [ 0.9665683507919312, 0.7839867472648621, 0.9865642786026001, 0.9509316086769104, 0.9385733604431152, 0.9886918663978577, 1.1170657873153687, 0.9449797868728638 ], "n": 8 } }, "idea": { "mean": 0.959431529045105, "std": 0.08500281686713337, "per_seed": [ 0.9662969708442688, 0.7839559316635132, 0.9864087700843811, 0.9510284662246704, 0.9385600090026855, 0.9874905347824097, 1.1167069673538208, 0.9450045824050903 ], "n": 8, "sweep": [ { "cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.01, "epochs": 3 }, "mean": 0.921985849738121 }, { "cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.03, "epochs": 3 }, "mean": 0.922079473733902 }, { "cfg": { "lr": 0.003, "temperature": 0.7, "lambda": 0.08, "epochs": 3 }, "mean": 0.9221688061952591 } ] }, "comparison": { "delta_mean": -0.00023869425058364868, "idea_wins": 6, "n_pairs": 8, "per_seed_diffs": [ -0.0002713799476623535, -3.081560134887695e-05, -0.00015550851821899414, 9.685754776000977e-05, -1.33514404296875e-05, -0.001201331615447998, -0.00035881996154785156, 2.47955322265625e-05 ], "p_value": 0.0863, "mde": 0.0003498030498009527, "mde_rel_pct": 0.03645033901329803, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "expansion penalty increases token-group expert neighborhood and reduces load dispersion", "baseline_observed": { "soft_C": 8.0, "mean_hard_neighborhood": 4.5625, "violation_fraction": 0.21875, "load_std": 446.43703842163086 }, "idea_observed": { "soft_C": 8.0, "mean_hard_neighborhood": 4.625, "violation_fraction": 0.21875, "load_std": 430.1180419921875 }, "confirmed": true }, "idea_hyperparameter_grid": [ { "lr": 0.003, "temperature": 0.7, "lambda": 0.01, "epochs": 3 }, { "lr": 0.003, "temperature": 0.7, "lambda": 0.03, "epochs": 3 }, { "lr": 0.003, "temperature": 0.7, "lambda": 0.08, "epochs": 3 } ], "notes": "Matched compact sequence forecaster; same 8-expert dense MoE and training budget; CPU fallback used to avoid shared GPU contention." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_expansion.py", "files": [ "bench_expansion.py", "bench_report.json", "bench_run.log" ], "limitations": "The initial larger configuration exceeded the 40-minute budget, so the final full protocol used a compact one-layer, 16-wide transformer, 200 training samples, 100 test samples, and 3 epochs. Dense soft MoE routing was used rather than hard top-1/top-2 sparse dispatch with capacity enforcement; no C4-scale language-model experiment was performed.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }