Expansion-balanced MoE routing / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "sequence",
4 "model": "transformer_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.003,
10 "temperature": 0.7,
11 "lambda": 0.0,
12 "epochs": 3
13 },
14 "sweep": [
15 {
16 "cfg": {
17 "lr": 0.001,
18 "temperature": 0.7,
19 "lambda": 0.0,
20 "epochs": 3
21 },
22 "mean": 0.9924133718013763
23 },
24 {
25 "cfg": {
26 "lr": 0.001,
27 "temperature": 1.0,
28 "lambda": 0.0,
29 "epochs": 3
30 },
31 "mean": 0.9980460554361343
32 },
33 {
34 "cfg": {
35 "lr": 0.003,
36 "temperature": 0.7,
37 "lambda": 0.0,
38 "epochs": 3
39 },
40 "mean": 0.9220127463340759
41 },
42 {
43 "cfg": {
44 "lr": 0.003,
45 "temperature": 1.0,
46 "lambda": 0.0,
47 "epochs": 3
48 },
49 "mean": 0.9310937225818634
50 }
51 ],
52 "full": {
53 "mean": 0.9596702232956886,
54 "std": 0.08513843682164902,
55 "per_seed": [
56 0.9665683507919312,
57 0.7839867472648621,
58 0.9865642786026001,
59 0.9509316086769104,
60 0.9385733604431152,
61 0.9886918663978577,
62 1.1170657873153687,
63 0.9449797868728638
64 ],
65 "n": 8
66 }
67 },
68 "idea": {
69 "mean": 0.959431529045105,
70 "std": 0.08500281686713337,
71 "per_seed": [
72 0.9662969708442688,
73 0.7839559316635132,
74 0.9864087700843811,
75 0.9510284662246704,
76 0.9385600090026855,
77 0.9874905347824097,
78 1.1167069673538208,
79 0.9450045824050903
80 ],
81 "n": 8,
82 "sweep": [
83 {
84 "cfg": {
85 "lr": 0.003,
86 "temperature": 0.7,
87 "lambda": 0.01,
88 "epochs": 3
89 },
90 "mean": 0.921985849738121
91 },
92 {
93 "cfg": {
94 "lr": 0.003,
95 "temperature": 0.7,
96 "lambda": 0.03,
97 "epochs": 3
98 },
99 "mean": 0.922079473733902
100 },
101 {
102 "cfg": {
103 "lr": 0.003,
104 "temperature": 0.7,
105 "lambda": 0.08,
106 "epochs": 3
107 },
108 "mean": 0.9221688061952591
109 }
110 ]
111 },
112 "comparison": {
113 "delta_mean": -0.00023869425058364868,
114 "idea_wins": 6,
115 "n_pairs": 8,
116 "per_seed_diffs": [
117 -0.0002713799476623535,
118 -3.081560134887695e-05,
119 -0.00015550851821899414,
120 9.685754776000977e-05,
121 -1.33514404296875e-05,
122 -0.001201331615447998,
123 -0.00035881996154785156,
124 2.47955322265625e-05
125 ],
126 "p_value": 0.0863,
127 "mde": 0.0003498030498009527,
128 "mde_rel_pct": 0.03645033901329803,
129 "verdict": "no measurable effect",
130 "system_worked": false
131 },
132 "mechanism_signature": {
133 "prediction": "expansion penalty increases token-group expert neighborhood and reduces load dispersion",
134 "baseline_observed": {
135 "soft_C": 8.0,
136 "mean_hard_neighborhood": 4.5625,
137 "violation_fraction": 0.21875,
138 "load_std": 446.43703842163086
139 },
140 "idea_observed": {
141 "soft_C": 8.0,
142 "mean_hard_neighborhood": 4.625,
143 "violation_fraction": 0.21875,
144 "load_std": 430.1180419921875
145 },
146 "confirmed": true
147 },
148 "idea_hyperparameter_grid": [
149 {
150 "lr": 0.003,
151 "temperature": 0.7,
152 "lambda": 0.01,
153 "epochs": 3
154 },
155 {
156 "lr": 0.003,
157 "temperature": 0.7,
158 "lambda": 0.03,
159 "epochs": 3
160 },
161 {
162 "lr": 0.003,
163 "temperature": 0.7,
164 "lambda": 0.08,
165 "epochs": 3
166 }
167 ],
168 "notes": "Matched compact sequence forecaster; same 8-expert dense MoE and training budget; CPU fallback used to avoid shared GPU contention."
169}