Expansion-balanced MoE routing / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "sequence",
  4  "model": "transformer_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.003,
 10      "temperature": 0.7,
 11      "lambda": 0.0,
 12      "epochs": 3
 13    },
 14    "sweep": [
 15      {
 16        "cfg": {
 17          "lr": 0.001,
 18          "temperature": 0.7,
 19          "lambda": 0.0,
 20          "epochs": 3
 21        },
 22        "mean": 0.9924133718013763
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.001,
 27          "temperature": 1.0,
 28          "lambda": 0.0,
 29          "epochs": 3
 30        },
 31        "mean": 0.9980460554361343
 32      },
 33      {
 34        "cfg": {
 35          "lr": 0.003,
 36          "temperature": 0.7,
 37          "lambda": 0.0,
 38          "epochs": 3
 39        },
 40        "mean": 0.9220127463340759
 41      },
 42      {
 43        "cfg": {
 44          "lr": 0.003,
 45          "temperature": 1.0,
 46          "lambda": 0.0,
 47          "epochs": 3
 48        },
 49        "mean": 0.9310937225818634
 50      }
 51    ],
 52    "full": {
 53      "mean": 0.9596702232956886,
 54      "std": 0.08513843682164902,
 55      "per_seed": [
 56        0.9665683507919312,
 57        0.7839867472648621,
 58        0.9865642786026001,
 59        0.9509316086769104,
 60        0.9385733604431152,
 61        0.9886918663978577,
 62        1.1170657873153687,
 63        0.9449797868728638
 64      ],
 65      "n": 8
 66    }
 67  },
 68  "idea": {
 69    "mean": 0.959431529045105,
 70    "std": 0.08500281686713337,
 71    "per_seed": [
 72      0.9662969708442688,
 73      0.7839559316635132,
 74      0.9864087700843811,
 75      0.9510284662246704,
 76      0.9385600090026855,
 77      0.9874905347824097,
 78      1.1167069673538208,
 79      0.9450045824050903
 80    ],
 81    "n": 8,
 82    "sweep": [
 83      {
 84        "cfg": {
 85          "lr": 0.003,
 86          "temperature": 0.7,
 87          "lambda": 0.01,
 88          "epochs": 3
 89        },
 90        "mean": 0.921985849738121
 91      },
 92      {
 93        "cfg": {
 94          "lr": 0.003,
 95          "temperature": 0.7,
 96          "lambda": 0.03,
 97          "epochs": 3
 98        },
 99        "mean": 0.922079473733902
100      },
101      {
102        "cfg": {
103          "lr": 0.003,
104          "temperature": 0.7,
105          "lambda": 0.08,
106          "epochs": 3
107        },
108        "mean": 0.9221688061952591
109      }
110    ]
111  },
112  "comparison": {
113    "delta_mean": -0.00023869425058364868,
114    "idea_wins": 6,
115    "n_pairs": 8,
116    "per_seed_diffs": [
117      -0.0002713799476623535,
118      -3.081560134887695e-05,
119      -0.00015550851821899414,
120      9.685754776000977e-05,
121      -1.33514404296875e-05,
122      -0.001201331615447998,
123      -0.00035881996154785156,
124      2.47955322265625e-05
125    ],
126    "p_value": 0.0863,
127    "mde": 0.0003498030498009527,
128    "mde_rel_pct": 0.03645033901329803,
129    "verdict": "no measurable effect",
130    "system_worked": false
131  },
132  "mechanism_signature": {
133    "prediction": "expansion penalty increases token-group expert neighborhood and reduces load dispersion",
134    "baseline_observed": {
135      "soft_C": 8.0,
136      "mean_hard_neighborhood": 4.5625,
137      "violation_fraction": 0.21875,
138      "load_std": 446.43703842163086
139    },
140    "idea_observed": {
141      "soft_C": 8.0,
142      "mean_hard_neighborhood": 4.625,
143      "violation_fraction": 0.21875,
144      "load_std": 430.1180419921875
145    },
146    "confirmed": true
147  },
148  "idea_hyperparameter_grid": [
149    {
150      "lr": 0.003,
151      "temperature": 0.7,
152      "lambda": 0.01,
153      "epochs": 3
154    },
155    {
156      "lr": 0.003,
157      "temperature": 0.7,
158      "lambda": 0.03,
159      "epochs": 3
160    },
161    {
162      "lr": 0.003,
163      "temperature": 0.7,
164      "lambda": 0.08,
165      "epochs": 3
166    }
167  ],
168  "notes": "Matched compact sequence forecaster; same 8-expert dense MoE and training budget; CPU fallback used to avoid shared GPU contention."
169}